Prompt-Region Grounding:为什么把题目画进图片,多模态大模型就集体"不会做题"了

简介: 这篇2026年新论文揭示:多模态大模型“能读出图中题目”不等于“会照它执行”。作者通过VTS控制实验确证“读≠用”的本质鸿沟,并提出region级prompt-region grounding训练法,在不依赖OCR、不增推理开销下显著缩小差距。(239字)

氛围图

💡 一句话总结:把题目从文本挪进图片,主流多模态大模型几乎全军覆没(24 个组合全掉分,平均 17.8 分),而它们常常能正确"读"出题目却不照它作答——这篇论文用一套干净的控制实验证明"读视觉文本"和"把它当任务指令用"是两种能力,并给了一个 region 级训练法把这道鸿沟缩小,推理还不用 OCR。

🤔 先问一个可能戳到你的问题

你有没有过这种经历:让大模型看一张图——工单截图、学生拍的试卷、一张报表——它明明把图里的文字一字不差"读"出来了,答案却跑偏到离谱。

你的第一反应大概是:OCR 不行,换个更强的视觉模型。换完,还是错。再换,还是错。

然后你开始怀疑人生:它字都认对了,题怎么还是做不对?

这篇 2026 年 8 月挂在 arXiv 上的论文《When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning》给的答案有点反直觉:问题大概率不在"读",在"用"。作者用一套相当干净的控制实验证明,对多模态大模型(MLLM)来说,"认出图片里印着的问题"和"把这个问题当成指令去执行"——是两种不同的能力,中间隔着一道被几乎所有评测忽略的鸿沟。

做截图问答、文档智能、RAG over 扫描件、让 agent 读 UI 的人,这篇值得花十分钟。

想自己动手试?

  • 📄 论文:arXiv 2608.04726
  • 📄 全文 HTML:arxiv.org/html/2608.04726v1
  • 💻 代码 / 📊 数据集:论文称计划释放标注、脚本与通过合规审查的图像,当前未见公开仓库,留意作者主页

🎯 这篇论文到底想解决什么问题?

先说一个被大多数 MLLM 评测默认的前提:问题放文本里,图片只当"证据"。

你回想一下自己跑过的多模态 benchmark——MATH-Vision、ChartQA、MathVista、MMMU——题目永远是用文本发给模型的,图片只负责提供图表、公式、场景。也就是说,"视觉文字(visual text)"在这套设定里永远是被抽取的对象(一个标签、一个数值、一段话),而不是定义任务本身的指令

但现实世界不是这样。真实场景里,题目常常就印在图片上:一张拍照的试卷、一封截图邮件、一份扫描工单。这时候图片里的文字不是"证据",是"指挥棒"——它决定模型该怎么用剩下的视觉信息、要算出什么。

问题来了:当这道指挥棒从文本通道搬到图像通道,模型还使得动它吗?

之前不是没人发现这个现象。VIM、VoQA、VISTA-Bench 都报告过"把指令视觉化会让模型变差"。但作者指出,这些观测到的"变差"是个大杂烩——里面混着画布变大、图片被 resize、渲染器出错、问题内容丢失、以及"语义通道本身切换"五个效应。光看一个精度下降,你根本分不清模型到底是"没读对题目"还是"读对了但没用上"。

这就是这篇论文要切的第一刀:把"读"和"用"分开度量

VTS 概念图
图说:同一道题、同一张图、同一个答案,唯一的变化是"问题"从文本(上)跑到了图片像素里(下)——这就是 VTS 干预,目的是让"通道切换"成为唯一扰动

🛠️ 它的思路是什么?

作者的思路分两步:先用一个叫 VTS(Visualized Task Semantics,视觉化任务语义) 的干预精准测出鸿沟,再用 prompt-region grounding 这个训练法缩小鸿沟

第一步:VTS——把"通道切换"孤立出来。

给定一道 benchmark 题(问题 $q$、图 $x$、答案 $a$),VTS 做的事很简单:用一个确定性的渲染器把问题 $q$ 画进图片上方的白板里,然后把原来文本通道的问题换成一个跟题目无关的固定提示——"Help me solve the problem"(论文里记作 $q_{\min}$)。源问题、视觉证据、答案三者原封不动地配对。

光这样还不够,作者还配了三个控制组来排除混淆——这一步是我觉得全文最漂亮的设计:

  • Canvas(空白画板):问题还在文本里,图片上方加一块空白白板——测"画布变大、图片被 resize"单独的影响
  • Duplicate(双通道):问题同时出现在文本和图片里——测"问题内容有没有丢"
  • Image-only(双通道都无):两个通道都把问题拿掉——测一个底线

结果非常干净:Canvas 偏离原始精度不超过 1.1 分,Duplicate 不超过 0.6 分,Image-only 直接崩塌。换句话说,画布、resize、内容丢失都解释不了那道鸿沟,能解释的只剩"语义通道本身切换"。这下"读≠用"才真正立住。

第二步:prompt-region grounding——教模型"把图片里的问题当指令用"。

知道了鸿沟在哪,怎么补?作者的答案是两个 region 级训练目标,名字都挺吓人,但原理可以用人话说清楚:

  • PVRD-SG(区域语义对齐):训练时模型手里有"问题区域的方框"(VTS 渲染器记录的,或真实数据用 GLM-OCR 划的)。它要求"图片里问题区域"的内部表示,必须接近"同一道题用纯文本输入时"的表示——而且文本侧那个表示是冻结的、不跟着训练变。一句话:逼着图片里那块区域的"语义指纹"长得像文本题的"语义指纹"
  • PRMLP(区域掩码预测):把问题区域随机挡住一部分,要求模型从挡过的残图里还原出"干净问题截图"的表示。注意它还原的是表示,不是像素、也不是文字——逼着那块区域在"部分看不清"时仍然稳定

这两条损失和普通的监督学习损失加一起训练,关键在于:方框、干净截图这些辅助信息只在训练时用,推理时模型只收到一张图 + 一句固定提示,直接作答,不需要 OCR、不需要定位框

Prompt-region grounding 方法架构
图说:左边的 Paired Replay 让同一题以"文本版"和"图片版"两种视图出现、共享答案;中间 PVRD-SG 把图片问题区域连到冻结的文本表示;PRMLP 从遮蔽的问题区域重建干净截图的表示;右边 GSPO 是最后的强化学习精修。推理时这些辅助都不在

为什么非要"区域级",而不是整张图对齐?因为 VTS 合成图里有两类信息——问题定义任务、背景图提供证据。你要是拿整张图的表示去对齐,它会被图表、物体、示意图带偏,淹没掉问题本身的语义。只从"问题那块方框"里读表示,问的才是一个干净的问题:这块印着指令的区域,表达的到底是不是同一道题?

我觉得这个设计直觉很对——它做的事本质上是给模型装一个"局部对齐探针",而且消融实验里有个很硬的证据支持它:把对齐目标故意错配到别的样本上(deranged target),PVRD-SG 掉 2.6 分。这说明增益不是"随便加个辅助 loss 就行",而是真的在学"这块区域 = 这道题"的映射。

训练完还有一步 GSPO(Group Sequence Policy Optimization,一种强化学习算法)做精修——用"格式对不对 + 答案对不对"两个可验证的信号继续优化。这块不是本文主角,更像锦上添花。

📈 效果到底怎么样?

先看最扎心的那条发现。

作者在 6 个 MLLM(包括 Qwen3-VL 的 thinking 和 instruct 变体、InternVL3.5、DeepEyes)× 4 个 benchmark 上跑了 VTS,24 个"模型×任务"组合,准确率全部下降,平均掉 17.8 分,最多的掉 28.0 分。没有一个是例外。

所有模型在 VTS 下都变弱
图说:每个模型的 VTS 条(右)都低于 Original 条(左),无一例外;作者刻意同时画两条,因为有的模型"差距小"只是因为两边都差

而且有个反直觉的细节:会"想"的模型反而栽得更狠。Qwen3-VL-4B-Thinking 在 MATH-Vision 上原始精度 60.0,比 instruct 版的 51.6 强一截,但它把题目画进图后掉 27.4 分,instruct 版只掉 16.8。换句话说,思考能力越强,似乎越依赖"问题得在文本通道里"才能发力。

那"读≠用"到底怎么证明的?看这组诊断数字:base 模型能把视觉题目精确转录 87.6%(基本都认对了),但只答对 48.4%。更妙的是,把模型自己转录出来的文字再塞回文本通道,答案准确率还能再涨 7.7 分。字都认对了,可这些字"作为像素"时对答案的指挥力,远不如"作为 token"时——这就是鸿沟落在"读出来之后"的铁证。

上了 prompt-region grounding 之后呢?在 Qwen3-VL-4B 上、控制了训练成本的前提下:

  • 四任务平均 VTS 准确率:58.0 → 66.3(鸿沟从 11.2 缩到 4.0)
  • 原始文本接口精度:69.1 → 70.3(没掉,还略涨)
  • 等成本的普通 SFT 只有 58.0——单纯多训 next-token 解释不了这个增益

外推也站得住:在独立构建的 VISTA-Bench 上 +4.1 分,在 1000 张训练时没见过的真实截图/试卷/表单上 +7.9 分。

最后看一个最有"代入感"的案例——银行对账。从一笔 GH¢12,345 的余额出发算现金账未调整余额,对照模型(Qwen3VL-8B-Thinking)把图片里的 23,000 误读成 2,300、把 4,321 误读成 4,123,一个识别错误经过几步加减乘除,最终答案少了 GH¢20,898——恰好等于被误读的 20,700 加上漏掉的 198。

银行对账案例
图说:一个"读错一个数"如何被多步计算放大成两万多的偏差;红色是第一个识别错误及所有受它影响的后续数值——这是"视觉任务"里最典型的失败传播

这个案例我觉得比任何精度数字都更能说明问题:真实世界的视觉任务常常是"一长串计算",一个字认错,后面全跟着错。这也是为什么"读得对"在这类场景里性命攸关。

💡 为什么你要关心?

落到你自己的工作上,这篇论文至少有三处值得停下来想想:

  • 如果你做多模态评测:你跑的分很可能系统性高估了模型处理真实视觉任务的能力——因为你的题目都在文本通道里。把 VTS 这套"配对干预 + 三控制"搬到自家 benchmark 上跑一遍,你大概率会看到一个不太好看的数字。这是一种便宜又有说服力的"能力体检"。
  • 如果你做截图问答 / 文档智能 / agent 读 UI:那道 17.8 分的鸿沟就是你线上掉点的来源之一。这篇给的 region 级训练法是一个可借鉴的方向——尤其如果你手里能拿到"问题区域的框"(哪怕用现成 OCR 划一下),PVRD-SG 的"区域表示对齐到文本表示"是个低成本可试的 loss。
  • 如果你只是个 MLLM 使用者:下次遇到"模型明明认对了字却答错",别急着换模型——先想想,你是不是把"指令"也塞进图片里了。把关键指令单独放到文本 prompt 里,可能比换模型管用。

换个角度看,这其实也说明:我们给多模态模型出的题,一直都在"作弊"。把题目放在文本里,等于偷偷帮模型省掉了一种能力。一旦把这层保护罩拿掉,模型真实水平才露出来。

🧊 理性看待

该泼的冷水也得泼。

第一,这道鸿沟是被缩小,不是被消除。四任务残差 gap 还有 4.0 分,ChartQA 6.8、MMMU 6.1——离"通道完全等价"还远。把它当"已解决"会吃亏。

第二,论文的"等成本"对照是用 FLOPs 估算做的(把 PVRD-SG / PRMLP 多出来的 forward / target / backward pass 都算进去,把普通 SFT 卡在 5% 误差内)。但 FLOPs 估算本身有任意性,PRMLP 每 2 步要多跑两次视觉编码——"等成本 SFT 步数更少"可能让 SFT 处于不利位置。作者诚实地写了"不主张更长 SFT 一定更差",但读者心里要对这个 +8.4 分的绝对值打个折。

第三,真实世界那 1000 张测试图的标注,和训练用的 5 万多张真实图走的是同一条标注管线(GLM-OCR 提框 + GPT-5.4 标注 + Gemini 质检)。标注内部自洽(学生抽查 97.4% 一致)不等于"和真实正确答案一致"——若管线对某类版式系统性误标,训练和测试会共享同一个偏差,+7.9 的外推强度因此要打折。

最后,作者自己也很坦诚:注意力图和表示检索只能描述模型学了什么,没法证明唯一内部机制。换句话说,"区域表示对齐到文本语义"是设计意图,不是被坐实的机理——它和"区域级数据增强 + 一致性正则"的边界,论文用错配目标实验挡了一部分,但没完全分开。

所以一句话:现象诊断几乎无懈可击,方法有效但要按作者的成本口径理解,机制解释留在描述层。这种"诚实标注自己证据边界"的姿态,反而是我相信它核心结论的一个重要原因。

作者:lusca
版本:lusca-paper-blog v1.5.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-blog

相关文章
|
5天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1572 112
|
12天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1939 8
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
6天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
|
6天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
526 112
|
18天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
2559 4
|
10天前
|
存储 人工智能 关系型数据库
阿里云AI产品与云产品最新组合套餐:Token Plan、AI coding及云服务器和建站等组合优惠价
阿里云推出全新“算力+模型+应用”一站式云与AI组合套餐活动,覆盖从个人开发者到中大型企业的全场景需求。核心亮点为分三档定价的Token Plan订阅服务,支持Qwen3.8-Max-Preview大模型调用,错峰时段最低可享0.2折优惠。活动同步推出AI Coding、智能体部署、云电脑托管、0代码建站等十余类场景化组合,搭配99元/年的普惠云服务器、88元/年的入门数据库等经典特惠产品,还为企业提供1V1定制化AI转型方案,大幅降低了不同用户群体拥抱AI的技术门槛与采购成本。
720 111
|
20天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2634 13
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
6天前
|
人工智能 JSON Shell
2026AI漫剧本地全开源方案(附各个软件模型链接),8G显卡也能流畅运行
这是一套完全本地化部署的AI漫剧生成技术链路:涵盖LLM剧本分镜生成、FLUX文生图(IP-Adapter人脸锁定)、StoryDiffusion时序连贯控制、LTX-2.3唇形同步视频生成,及ComfyUI全流程调度。零云端费用,仅耗硬件算力,单集2–4小时可产出竖屏短视频,适配抖音/B站分发。
|
7天前
Qoder 一周年 × Qwen3.8-Max 正式上线,多重好礼限时领
8月3日,Qwen3.8-Max 正式上线Qoder,迎来Qoder一周年。新老用户可领800次免费调用,下单再赠2000次;夜间(22:00–08:00)调用5折;邀请好友双方得积分与调用额度。
446 1