上周多模态论文推荐:MAPS、MapGlue、OmniGeo、OThink-MR1

简介: 由西安交通大学、新加坡国立大学和南洋理工大学联合提出,该工作推出了MAPS框架,利用基于Big Seven人格理论的七个智能体和苏格拉底式引导,解决多模态科学问题(MSPs)。通过四阶段求解策略和批判性反思智能体,MAPS在EMMA、Olympiad和MathVista数据集上超越当前最佳模型15.84%,展现了卓越的多模态推理与泛化能力。

5eecdaf48460cde5d5fb57f04567d5924607b27caa4c0b5458e70b814913bc360a414d3de9277d871abf3af1cbd752490a6821246a42478fac60da290331e111f9ef99549683b2f93c7e273e20172cc2b8c2f1031b0cf01bfc653b69905bac42.gif

作者:InternLM、Qwen 等 LLM本周,「机智流」和 「ModelScope」社区精选了多模态领域的论文,涵盖科学问题求解、遥感图像匹配、癌症生存预测到临床试验患者匹配等前沿应用。从多智能体框架到超维空间学习,这些研究不仅突破了技术瓶颈,还为AI的跨模态融合与实际落地提供了新思路。快来一起探索这些令人振奋的创新成果吧!✨


MAPS: A Multi-Agent Framework Based on Big Seven Personality and Socratic Guidance for Multimodal Scientific Problem Solving

论文链接:

https://modelscope.cn/papers/2503.16905  

简要介绍:

由西安交通大学、新加坡国立大学和南洋理工大学联合提出,该工作推出了MAPS框架,利用基于Big Seven人格理论的七个智能体和苏格拉底式引导,解决多模态科学问题(MSPs)。通过四阶段求解策略和批判性反思智能体,MAPS在EMMA、Olympiad和MathVista数据集上超越当前最佳模型15.84%,展现了卓越的多模态推理与泛化能力。

核心图片:

image.png

 


MapGlue: Multimodal Remote Sensing Image Matching

论文链接:

https://modelscope.cn/papers/2503.16185  

简要介绍:

武汉大学团队提出了MapGlue框架及MapData数据集,针对多模态遥感图像(MRSI)匹配中的几何和辐射差异难题。MapGlue通过双图引导机制提取跨模态不变特征,在全球233个采样点的大规模数据集上实现优异匹配精度,并在未见模态上展现强大泛化性。

核心图片:

image.png

 


Disentangled and Interpretable Multimodal Attention Fusion for Cancer Survival Prediction

论文链接:

https://modelscope.cn/papers/2503.16069  

简要介绍:

乌得勒支大学和荷兰癌症研究所合作开发了DIMAF框架,通过解缠注意力机制融合全切片图像和转录组数据,提升癌症生存预测。引入距离相关性损失和SHAP解释方法,DIMAF在四个公共数据集上提升1.85%性能和23.7%解缠度,增强了生物学解释性。

核心图片:

  image.png


OmniGeo: Towards a Multimodal Large Language Models for Geospatial Artificial Intelligence

论文链接:

https://modelscope.cn/papers/2503.16326  

简要介绍:

北京交通大学和蒙特利尔大学团队提出了OmniGeo,一种面向地理空间AI的多模态大语言模型。OmniGeo整合卫星图像、地理元数据和文本描述,在健康地理、城市感知等五大核心任务中表现出色,首次实现GeoAI多模态统一建模。

核心图片:

image.png

 


OThink-MR1: Stimulating multimodal generalized reasoning capabilities through dynamic reinforcement learning

论文链接:

https://modelscope.cn/papers/2503.16081  

简要介绍:

OPPO研究院和香港科技大学(广州)提出了OThink-MR1,通过动态强化学习增强多模态语言模型的泛化推理能力。引入动态KL策略,OThink-MR1在视觉计数和几何推理任务中超越监督微调,并在跨任务迁移中展现显著优势。

核心图片:

  image.png


M3: 3D-Spatial MultiModal Memory

论文链接:

https://modelscope.cn/papers/2503.16413  

简要介绍:

加州大学圣地亚哥分校和NVIDIA联合推出了M3,一种3D空间多模态记忆系统。M3结合3D高斯 splatting和基础模型,解决特征压缩难题,并在机器人室内场景中验证其实用性,首次攻克3D特征蒸馏的核心挑战。

核心图片:

image.png

 


Real-world validation of a multimodal LLM-powered pipeline for High-Accuracy Clinical Trial Patient Matching leveraging EHR data

论文链接:

https://modelscope.cn/papers/2503.15374  

简要介绍:

该研究提出了一种无需集成、基于多模态LLM的患者-试验匹配管道,利用EHR原始文档实现自动化筛选。在n2c2数据集上达到93%准确率,真实世界数据中缩短80%审核时间,展示出广泛应用的潜力。

核心图片:

image.png

 


SemEval-2025 Task 1: AdMIRe -- Advancing Multimodal Idiomaticity Representation

论文链接:

https://modelscope.cn/papers/2503.15358  

简要介绍:

谢菲尔德大学等机构推出了AdMIRe任务,挑战多模态模型在图像排序和序列预测中理解习语表达。最佳方法结合预训练LLM和视觉-语言模型,达到人类水平性能,推动了多模态语义表征研究。

核心图片:

 

image.png


Leveraging Perfect Multimodal Alignment and Gaussian Assumptions for Cross-modal Transfer

论文链接:

https://modelscope.cn/papers/2503.15352  

简要介绍:

伊利诺伊大学团队提出了一种完美多模态对齐方法,结合高斯假设实现无监督跨模态迁移。通过将语义类建模为高斯混合,实验验证了其在合成数据上的高效性,为跨模态学习开辟新方向。

核心图片:

image.png


Machine Unlearning in Hyperbolic vs. Euclidean Multimodal Contrastive Learning: Adapting Alignment Calibration to MERU

论文链接:

https://modelscope.cn/papers/2503.15166  

简要介绍:

奥尔堡大学等机构研究了超维与欧几里得空间中的机器遗忘,提出HAC方法适配MERU模型。实验显示超维几何在概念移除中具有优势,揭示了几何结构对多模态表征遗忘动态的影响。

核心图片:

image.png

-- 完 --

欢迎在「机智流」公众号后台回复「cc」,加入机智流大模型交流群,与我们一起探索 AI 与人类潜能的未来,一起共赴 AI 浪潮!

目录
相关文章
|
7月前
|
人工智能 API 数据安全/隐私保护
别再浪费 OpenClaw 超能力!阿里云/本地部署+Prompt+Skills,解锁AI助手90%潜力
很多人花时间搭建好OpenClaw(原Clawdbot),却只用来做简单的信息搜索和问答——这无疑是对这款强大AI执行引擎的浪费。OpenClaw的核心价值从来不是“替代聊天工具”,而是通过“优质大模型+体系化方法+精准指令”的组合,成为能替你动手完成工作的“数字员工”。
957 1
|
关系型数据库 MySQL 数据库
自建数据库如何迁移至RDS MySQL实例
数据库迁移是一项复杂且耗时的工程,需考虑数据安全、完整性及业务中断影响。使用阿里云数据传输服务DTS,可快速、平滑完成迁移任务,将应用停机时间降至分钟级。您还可通过全量备份自建数据库并恢复至RDS MySQL实例,实现间接迁移上云。
|
Linux Android开发 数据安全/隐私保护
AirServer最新免费版手机投屏电脑软件下载
AirServer是适用于Mac和PC的先进的屏幕投屏软件,功能是十分强大。它的主要功能在于实时地将移动设备上的图像画面内容投放到电脑设备上,让电脑成为iPad、iPhone等iOS系统设备的大屏显示器。在设备之间建立局域网内的信号发送与接收通道,确保数据可以稳定安全地进行传输。
1038 0
|
存储 固态存储 关系型数据库
性能优化特性之:16K原子写
本文介绍了在倚天实例上进行内存优化的调优特性:16K原子写 的优化原理、使用方法。
|
存储 Java Android开发
Android插件化动态加载apk
支付宝作为一个宿主apk提前将要集成的apk作为一个插件(plugin)下载到本地,然后当使用该plugin(apk)的时候再去加载对应plugin(apk)的资源文件以及对应的native页面。就是不去安装plugin(apk)就可以直接运行该plugin(apk)中的页面。
1438 0
|
编译器
overleaf 参考文献引用,创建引用目录.bib文件,在文档中引用参考文献,生成参考文献列表
overleaf 参考文献引用,创建引用目录.bib文件,在文档中引用参考文献,生成参考文献列表
12668 0
|
人工智能 自然语言处理 API
AutoAgent:无需编程!接入DeepSeek用自然语言创建和部署AI智能体!港大开源框架让AI智能体开发变成填空题
香港大学推出的AutoAgent框架通过自然语言交互实现零代码创建AI智能体,支持多模型接入与自动化工作流编排,在GAIA基准测试中表现优异。
2076 16
AutoAgent:无需编程!接入DeepSeek用自然语言创建和部署AI智能体!港大开源框架让AI智能体开发变成填空题
|
编解码 文字识别 自然语言处理
Dots.ocr:告别复杂多模块架构,1.7B参数单一模型统一处理所有OCR任务22
Dots.ocr 是一款仅1.7B参数的视觉语言模型,正在重塑文档处理技术。它将布局检测、文本识别、阅读顺序理解和数学公式解析等任务统一于单一架构,突破传统OCR多模块流水线的限制。在多项基准测试中,其表现超越大参数模型,展现出“小而精”的实用价值,标志着OCR技术向高效、统一、灵活方向演进。
1119 0
Dots.ocr:告别复杂多模块架构,1.7B参数单一模型统一处理所有OCR任务22
|
数据采集 人工智能 编解码
书生·万象InternVL 2.5:上海 AI Lab 开源的多模态大语言模型,超越了目前许多商业模型
书生·万象InternVL 2.5是由上海AI实验室OpenGVLab团队推出的开源多模态大语言模型系列。该模型在多模态理解基准(MMMU)上表现优异,超越了许多商业模型,适用于图像和视频分析、视觉问答、文档理解和多语言处理等多个领域。
2011 7
书生·万象InternVL 2.5:上海 AI Lab 开源的多模态大语言模型,超越了目前许多商业模型
|
存储 人工智能 文字识别
MME-CoT:多模态模型推理能力终极评测!六大领域细粒度评估,港中大等机构联合推出
MME-CoT 是由港中文等机构推出的用于评估大型多模态模型链式思维推理能力的基准测试框架,涵盖数学、科学、OCR、逻辑、时空和一般场景等六个领域,提供细粒度的推理质量、鲁棒性和效率评估。
1056 0