论文推荐:R1-Omni、VisualPRM、4D LangSplat、Vision-R1、GoT

本文涉及的产品
模型在线服务 PAI-EAS,A10/V100等 500元 1个月
交互式建模 PAI-DSW,每月250计算时 3个月
模型训练 PAI-DLC,100CU*H 3个月
简介: 简要介绍:由复旦大学、上海AI实验室等机构提出了首个统一多模态理解和生成的奖励模型UnifiedReward。该工作构建了大规模人类偏好数据集,包含图像和视频生成/理解任务,并利用该模型进行自动构建高质量偏好对数据,最终通过DPO优化视觉模型。实验结果表明,联合学习评估多样化视觉任务可以带来显著的相互益处。

5eecdaf48460cde5d5fb57f04567d5924607b27caa4c0b5458e70b814913bc360a414d3de9277d871abf3af1cbd752490a6821246a42478fac60da290331e111f9ef99549683b2f93c7e273e20172cc2b8c2f1031b0cf01bfc653b69905bac42.gif

作者:InternLM、Qwen 等 LLM每周一览热门论文版,顶会投稿选题不迷惘。快来看看由「机智流」和「ModelScope」社区推荐的上周「多模态」方向的热门论文吧!

Unified Reward Model for Multimodal Understanding and Generation

论文链接:

https://modelscope.cn/papers/124332

简要介绍:由复旦大学、上海AI实验室等机构提出了首个统一多模态理解和生成的奖励模型UnifiedReward。该工作构建了大规模人类偏好数据集,包含图像和视频生成/理解任务,并利用该模型进行自动构建高质量偏好对数据,最终通过DPO优化视觉模型。实验结果表明,联合学习评估多样化视觉任务可以带来显著的相互益处。

核心图片:

image.png

GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing

论文链接:

https://modelscope.cn/papers/126628

简要介绍:提出了Generation Chain-of-Thought (GoT),这是一种将推理能力融入视觉生成和编辑的新范式。该工作将常规的文本到图像生成和编辑转变为推理引导框架,分析语义关系和空间排列。研究团队构建了包含900万样本的大规模GoT数据集,并开发了一个统一框架,整合了Qwen2.5-VL的推理能力和扩散模型的生成能力。

核心图片:

image.png

Taking Notes Brings Focus? Towards Multi-Turn Multimodal Dialogue Learning

论文链接:

https://modelscope.cn/papers/125186

简要介绍:该研究介绍了MMDiag,一个多轮多模态对话数据集,通过精心设计的规则和GPT辅助生成,特点是问题之间、问题与图像之间以及不同图像区域之间的强相关性。同时提出了DiagNote,一个具备多模态定位和推理能力的MLLM,包含两个相互作用的模块(Deliberate和Gaze),在多轮对话中执行思维链和注释。

核心图片:

image.png

R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcing Learning

论文链接:

https://modelscope.cn/papers/124176

简要介绍:这项工作首次将可验证奖励强化学习(RLVR)应用于全模态大型语言模型用于情感识别,这是一项视觉和音频模态都起关键作用的任务。研究利用RLVR优化Omni模型,在三个关键方面显著提升其性能:推理能力、情感识别准确性和泛化能力。这种方法不仅提高了模型在分布内数据上的整体性能,还在分布外数据集评估中展示了更强的鲁棒性。

VisualPRM: An Effective Process Reward Model for Multimodal Reasoning

论文链接:

https://modelscope.cn/papers/126372

简要介绍:由清华大学、上海AI实验室等机构提出了VisualPRM,一个拥有8B参数的多模态过程奖励模型,它通过Best-of-N评估策略显著提升了现有多模态大语言模型的推理能力。该模型改进了三种类型、四种不同规模的MLLM的推理性能,即使应用于InternVL2.5-78B这样的高能力模型,也在七项多模态推理基准上获得了5.9点的提升。

核心图片:

image.png

UniF^2ace: Fine-grained Face Understanding and Generation with Unified Multimodal Models

论文链接:

https://modelscope.cn/papers/125793

简要介绍:研究提出了UniF^2ace,这是第一个专为精细人脸理解和生成设计的统一多模态模型(UMM)。该模型通过两种互补的扩散技术和两级专家混合架构,在特制的数据集上进行训练。团队构建了大规模人脸数据集UniF^2ace-130K,包含13万图像-文本对和100万问答对,涵盖广泛的人脸属性,并建立了离散扩散分数匹配和掩码生成模型之间的理论联系。

核心图片:

image.png

4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language Models

论文链接:

https://modelscope.cn/papers/126311

简要介绍:这项工作提出了4D LangSplat,一种学习4D语言场的方法,以便在动态场景中处理时间敏感或时间无关的开放词汇查询。该方法绕过了从视觉特征学习语言场的传统途径,而是直接从多模态大语言模型(MLLM)生成的对象级视频描述文本中学习。研究提出了多模态对象级视频提示方法,生成详细、时间一致的高质量描述,并使用大语言模型将这些描述编码为高质量句子嵌入。

核心图片:

image.png

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

论文链接:

https://modelscope.cn/papers/124832

简要介绍:受DeepSeek-R1-Zero成功通过强化学习(RL)激发LLM推理能力的启发,该研究探索了如何利用RL提升多模态大语言模型(MLLM)的推理能力。研究者提出了Vision-R1,通过利用现有MLLM和DeepSeek-R1通过模态桥接和数据过滤构建了20万多模态思维链数据集作为冷启动初始化数据,并提出了渐进思维抑制训练(PTST)策略来减轻冷启动后过度思考的优化挑战。

核心图片:

image.png

VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search

论文链接:

https://modelscope.cn/papers/126288

简要介绍:研究团队提出了VisualWebInstruct,一种利用搜索引擎创建多样化高质量数据集的新方法,涵盖数学、物理、金融、化学等多个学科。从精心挑选的3万种子图像开始,通过Google图像搜索识别包含类似图像的网站,收集并处理了来自70万唯一URL源的HTML。通过内容提取、过滤和合成管道,构建了约90万问答对的数据集,其中40%为视觉QA对,其余为文本QA对。

核心图片:

image.png

OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models

论文链接:

https://modelscope.cn/papers/125368

简要介绍:由华中科技大学等机构提出了OmniMamba,这是首个基于线性架构的多模态生成模型,通过统一的下一个令牌预测范式同时生成文本和图像。该模型充分利用Mamba-2的高计算和内存效率,将其功能从文本生成扩展到多模态生成。为解决现有统一模型的数据效率问题,提出了两项关键创新:解耦词汇表来引导特定模态生成,以及用于参数高效适应的任务特定LoRA。

核心图片:

image.png

目录
相关文章
|
5天前
|
弹性计算 运维 自动驾驶
首个云超算国标正式发布!
近日,我国首个云超算国家标准GB/T 45400-2025正式发布,将于今年10月实施。该标准由阿里云联合多家机构起草,为云超算在高性能计算领域的应用提供规范。云超算结合传统HPC与云计算优势,解决传统HPC复杂、昂贵等问题。阿里云E-HPC V2.0是国内首批通过该标准认证的产品,支持大规模弹性计算,显著降低成本。新标准将推动算力基础设施迈向标准化、智能化新时代。
|
6天前
|
传感器 自然语言处理 监控
快速部署实现Bolt.diy
Bolt.diy 是 Bolt.new 的开源版本,提供灵活的自然语言交互与全栈开发支持。基于阿里云函数计算 FC 和百炼模型服务,最快5分钟完成部署。新手注册阿里云账号后可领取免费额度,按指引开通相关服务并授权。通过项目模板一键部署,配置 API-KEY 后即可使用。Bolt.diy 支持多种场景,如物联网原型开发、久坐提醒、语音控制灯光等,助力快速实现创意应用。
2244 19
|
7天前
|
云安全 人工智能 安全
|
7天前
|
Serverless API
【MCP教程系列】在阿里云百炼,实现超级简单的MCP服务部署
阿里云百炼推出业界首个全生命周期MCP服务,支持一键在线注册托管。企业可将自研或外部MCP服务部署于阿里云百炼平台,借助FC函数计算能力,免去资源购买与服务部署的复杂流程,快速实现开发。创建MCP服务仅需四步,平台提供预置服务与自定义部署选项,如通过npx安装代码配置Flomo等服务。还可直接在控制台开通预置服务,体验高效便捷的企业级解决方案。
【MCP教程系列】在阿里云百炼,实现超级简单的MCP服务部署
|
1月前
|
人工智能 自然语言处理 Java
快速带你上手通义灵码 2.0,体验飞一般的感觉
通义灵码个人版为开发者免费提供智能编码能力,专业版限免期内开放更多功能。使用需先注册阿里云账号,支持JetBrains IDEs、Visual Studio Code等开发工具。以Visual Studio Code为例,安装插件并登录后即可体验其强大功能。通义灵码2.0在代码生成、需求理解及单元测试自动化等方面有显著提升,支持多语言和复杂场景,大幅提高开发效率。
234891 36
快速带你上手通义灵码 2.0,体验飞一般的感觉
|
13天前
|
存储 人工智能 监控
一键部署 Dify + MCP Server,高效开发 AI 智能体应用
本文将着重介绍如何通过 SAE 快速搭建 Dify AI 研发平台,依托 Serverless 架构提供全托管、免运维的解决方案,高效开发 AI 智能体应用。
1888 6
|
5天前
|
人工智能 运维 数据可视化
阿里云百炼 MCP服务使用教程合集
阿里云百炼推出首个全生命周期MCP服务,支持一键部署、无需运维,具备高可用与低成本特点。该服务提供多类型供给、低成本托管及全链路工具兼容,帮助企业快速构建专属智能体。MCP(模型上下文协议)作为标准化开源协议,助力大模型与外部工具高效交互。教程涵盖简单部署、GitHub运营、数据分析可视化及文档自动化等场景,助您快速上手。欢迎加入阿里云百炼生态,共同推动AI技术发展!
|
1月前
|
人工智能 开发工具 C++
利用通义灵码AI在VS Code中快速开发扫雷游戏:Qwen2.5-Max模型的应用实例
本文介绍了如何利用阿里云通义灵码AI程序员的Qwen2.5-Max模型,在VS Code中一键生成扫雷小游戏。通过安装通义灵码插件并配置模型,输入指令即可自动生成包含游戏逻辑与UI设计的Python代码。生成的游戏支持难度选择,运行稳定无Bug。实践表明,AI工具显著提升开发效率,但人机协作仍是未来趋势。建议开发者积极拥抱新技术,同时不断提升自身技能以适应行业发展需求。
22202 17
|
7天前
|
人工智能 API 数据库
MCP Server 开发实战 | 大模型无缝对接 Grafana
以 AI 世界的“USB-C”标准接口——MCP(Model Context Protocol)为例,演示如何通过 MCP Server 实现大模型与阿里云 Grafana 服务的无缝对接,让智能交互更加高效、直观。
477 110
|
7天前
|
人工智能 监控 JavaScript
MCP 正当时:FunctionAI MCP 开发平台来了!
Function AI 是基于函数计算构建的 Serverless AI 应用开发平台,基于函数计算的运行时能力上线了完整的 MCP 开发能力,您可以进入 FunctionAI 控制台,快速体验 MCP 服务的能力。
405 10

热门文章

最新文章