魔搭社区模型速递(5.11-5.17)

简介: 🙋魔搭ModelScope本期社区进展:📟1656个模型,151个数据集,645个创新应用,📄 9 篇内容

image.gif 编辑

 

🙋魔搭ModelScope本期社区进展:

📟1656个模型:通义万相2.1-VACE-视频生成编辑-14B、WorldPM-72B系列、Step1X-3D、Nexus-Gen、Qwen3系列量化模型 等;

📁151个数据集:AudioJailbreak、multiplayer-racing-low-res、AceCode-V1.1-69K 等;

🎨645个创新应用:DreamO、PP-StructureV3 Online Demo 等;

📄 9 篇内容:

  • ModelScope魔搭25年5月发布月报
  • 阶跃星辰联合光影焕像开源 3D 大模型 Step1X-3D,高保真+可控!
  • 通义万相Wan2.1-VACE开源!业内首个视频编辑统一模型!附推理教程
  • 全模态图像模型Nexus-Gen对齐GPT-4o!图片理解生成编辑同时搞定,数据、训练框架、模型全面开源
  • 小米开源MiMo-7B!从预训练到强化学习,解锁语言模型的推理潜能
  • 10分钟,用RAG搭建专业钉钉/飞书客服机器人
  • “一丹一世界”三等奖 | 木刻时光·细密风 经验分享
  • MCP&RL系统学,打榜赛尽情玩!书生大模型实战营第5期课程玩法双升级,火热报名中
  • 魔搭核心开发者共创会 | 邀请函

01.模型推荐

通义万相2.1-VACE-视频生成编辑-14B

通义万相2.1-VACE是一款由阿里巴巴开源的多功能AI视频生成与编辑模型,具备文生视频、图像参考生成、视频重绘、局部编辑、背景延展等多种功能,支持文本、图像、视频等多种输入形式。它采用统一模型架构,支持细粒度控制信号,能够在消费级显卡上高效运行,降低了使用门槛。该模型适用于创意视频制作、视频内容编辑、虚拟现实、AI自动化内容创作和个性化视频定制等场景。

模型地址:

https://www.modelscope.cn/models/Wan-AI/Wan2.1-VACE-14B

深度讲解,推理教程,效果展示,详见文章:

通义万相Wan2.1-VACE开源!业内首个视频编辑统一模型!附推理教程

 

WorldPM-72B系列

WorldPM是通义千问团队和复旦大学自然语言处理实验室的一项关于“建模世界偏好”(Modeling World Preference)的联合研究,证明了偏好建模遵循与语言建模类似的规模法则。研究团队通过在不同规模(1.5B~72B)的Qwen 2.5模型上使用1500万条偏好数据进行大规模训练,显示随着模型规模和训练数据量增加,在客观评估和对抗性领域呈明确可扩展性趋势,而在主观评估中风格偏好可能是限制因素。

同时,研究团队进一步实验验证了WorldPM作为偏好微调基础的有效性,WorldPM显著提升了不同规模(7K/100K/800K样本)人类偏好数据集的泛化性能,将WorldPM集成至内部RLHF流程后,在自建和公共评估集上均取得显著改进。本次研究论文、代码与模型(1个基模、3个微调后的偏好模型)已开源。

论文链接:

https://arxiv.org/abs/2505.10527

模型地址:

  • WorldPM-72B

https://www.modelscope.cn/models/Qwen/WorldPM-72B

  • WorldPM-72B-HelpSteer2

https://www.modelscope.cn/models/Qwen/WorldPM-72B-HelpSteer2

  • WorldPM-72B-UltraFeedback

https://www.modelscope.cn/models/Qwen/WorldPM-72B-UltraFeedback

  • WorldPM-72B-RLHFLow

https://www.modelscope.cn/models/Qwen/WorldPM-72B-RLHFLow

 

示例代码:

from modelscope import AutoModel, AutoTokenizer, AutoConfig
model_name = 'Qwen/WorldPM-72B'
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
config = AutoConfig.from_pretrained(model_name,trust_remote_code=True )
model = AutoModel.from_pretrained(
    model_name, 
    config = config, 
    device_map = "auto", 
    trust_remote_code=True,
).eval()
def get_score(model, tokenizer, conversation):
    con_str = tokenizer.apply_chat_template(conversation, tokenize=False, add_generation_prompt=False)
    input_ids = tokenizer.encode(con_str, return_tensors="pt", add_special_tokens=False)
    outputs = model(input_ids=input_ids.to(model.device))
    score = outputs[0].cpu().item()
    return score
messages = [
    [
        {'role': 'system', 'content': ""},
        {'role': 'user', 'content': "Tips for better sleep?"},
        {'role': 'assistant', 'content': "Three key tips for better sleep:\n1. Set a consistent bedtime and wake-up schedule\n2. Avoid screens 1 hour before bed\n3. Keep your bedroom cool and dark\n\nStart with these habits and you should notice improvement within a week."}
    ],
    [
        {'role': 'system', 'content': ""},
        {'role': 'user', 'content': "Tips for better sleep?"},
        {'role': 'assistant', 'content': "just try sleeping earlier or take some pills if u cant sleep lol. maybe watch tv until u get tired idk"}
    ]
]
score = [get_score(model, tokenizer=tokenizer, conversation=message) for message in messages]
print(score) #[0.6298332214355469, -1.6425328254699707] for WorldPM-72B

image.gif

 

Step1X-3D

阶跃星辰联合光影焕像开源的3D大模型Step1X-3D,具有4.8B参数量,采用3D原生两阶段架构,解耦几何与纹理表征,生成结构清晰、细节生动的3D内容。模型基于200万高质量数据训练,支持对称性、表面细节等属性的精细调控,且在CLIP-Score等关键指标上表现优异,为3D内容创作提供了高保真、可控的生成方案。

模型地址:

https://www.modelscope.cn/models/stepfun-ai/Step1X-3D

 

02.数据集推荐

AudioJailbreak

一个专门设计用于评估音频语言模型(Audio LLMs)安全性的基准框架。该项目通过各种音频扰动技术测试模型对恶意请求的防御能力。 注意:此项目旨在提高音频语言模型的安全性。研究人员应负责任地使用此工具。

 

数据集链接:

https://modelscope.cn/datasets/MBZUAI/AudioJailbreak

 

AceCode-V1.1-69K

TIGER-Lab 的 AceCode-V1.1-69K 是 AceCode-87K 升级版,由 GPT-o1-mini 重写、Qwen Coder 筛选,含 3 个子集,过滤后约 6.9 万样本(平均 17 个测试用例 / 样本),可直接加载,训练模型在编程测试中表现良好。

 

数据集链接:

https://www.modelscope.cn/datasets/TIGER-Lab/AceCode-V1.1-69K

 

03.精选应用

DreamO

体验直达:

https://www.modelscope.cn/studios/ByteDance/DreamO

 

PP-StructureV3 Online Demo

体验直达:

https://www.modelscope.cn/studios/PaddlePaddle/PP-StructureV3_Online_Demo

04.社区精选文章

目录
相关文章
|
机器学习/深度学习 开发框架 数据可视化
B站开源SOTA动画视频生成模型 Index-AniSora!
B站升级动画视频生成模型Index-AniSora技术并开源,支持番剧、国创、漫改动画、VTuber、动画PV、鬼畜动画等多种二次元风格视频镜头一键生成!
1574 32
|
1月前
|
存储 人工智能 编解码
AI短剧/AI广告生成实战流程:阿里云百炼新上线的HappyHorse 1.1功能详解、参数调试、成本指南
HappyHorse是阿里云推出的端到端AI视频生成大模型,2026年6月22日正式上线迭代版本HappyHorse 1.1,部署在阿里云百炼平台对外开放API调用与在线调试能力,主打短剧、电商广告、品牌宣传片、内容营销短片四大商用内容场景。相比初代HappyHorse 1.0,新版本在动态时序、角色一致性、画面质感、音画协同、长指令理解五大核心维度完成系统性升级,解决旧版动作僵硬、人物面部失真、多角色画面互相污染、长分镜逻辑断裂等行业常见痛点。
434 2
|
机器学习/深度学习 算法 计算机视觉
产教融合结成果 与阿里云合作的结晶
近日,上海市计算机学会公布2024年度教学成果奖名单,赵卫东老师荣获一等奖。他长期专注计算机科学教学与科研,在课程体系创新和人才培养方面成效显著。获奖项目《面向新工科的计算机专业实践教学体系构建与创新》聚焦工程教育需求,通过教学改革提升学生实践能力。该成果包含与阿里云合作结晶,其深度学习教材涵盖多个实际应用案例,如图像分类、声音识别等,助力读者深入理解算法实践。
306 2
产教融合结成果  与阿里云合作的结晶
|
开发框架 人工智能 安全
ModelScope魔搭25年5月发布月报
不知不觉间,日历已经翻过了立夏,而开源模型的世界中似乎并没有春夏秋冬。在刚刚过去的四月份,见证了开源社区又一次蓬勃发展的浪潮。以Qwen3家族为代表,一系列新模型的开源为整个生态注入了新的活力。通过全面覆盖多种规格的 dense 与 MoE 模型架构,Qwen3 首次在开源模型中引入“快思考与慢思考” 双模式的支持,获得了广大开发者的热烈欢迎,成为新一代开源大模型的标杆之作。
549 10
|
人工智能 数据可视化 物联网
Reasoning模型蒸馏实践:用大模型提升小模型能力
DeepSeek-R1的爆火让更多开发者注意到模型蒸馏技术——这种让小模型也能"开小灶"习得大模型知识精华的秘诀。今天我们就用Qwen2.5-1.5B小模型(相当于AI界的初中生)来进行实践!
1256 5
|
数据采集 人工智能 自然语言处理
阶跃星辰联合光影焕像开源 3D 大模型 Step1X-3D,高保真+可控!
阶跃星辰联合光影焕像开源 3D 大模型 Step1X-3D,高保真+可控!
522 4
|
消息中间件
使用RabbitMQ如何保证消息不丢失 ?
消息从发送,到消费者接收,会经理多个过程 , 其中的每一步都可能导致消息丢失 针对这些问题,RabbitMQ分别给出了解决方案: ● 消息发送到交换机丢失 : 发布者确认机制publisher-confirm消息发送到交换机失败会向生产者返回ACK , 生产者通过回调接收发送结果 , 如果发送失败, 重新发送, 或者记录日志人工介入 ● 消息从交换机路由到队列丢失 : 发布者回执机制publisher-return消息从交换机路由到队列失败会向生产者返回失败原因 , 生产者通过回调接收回调结果 , 如果发送失败, 重新发送, 或者记录日志人工介入 ● 消息保存到队列中丢失 : MQ持久化(交
|
缓存 网络协议 算法
Golang简单实现 分布式缓存+一致性哈希+节点再平衡(gossip + consistent + rebalance)
Golang简单实现 分布式缓存+一致性哈希+节点再平衡(gossip + consistent + rebalance)
618 0
|
供应链 搜索推荐 算法
淘宝电商运营的小秘籍,看完血赚。
在淘宝电商竞争激烈的环境中,掌握实用运营技巧是成功的关键。本文深入剖析了淘宝电商运营的五大核心策略:精准市场定位与选品、引人入胜的店铺装修、优质客户服务、灵活营销推广及数据驱动决策。通过这些技巧,你可以在淘宝平台上打造独具魅力的店铺,吸引更多流量和客户,实现销售业绩稳步增长,最终脱颖而出,成为知名品牌。
1881 10

热门文章

最新文章