Prompt-Region Grounding:为什么把题目画进图片,多模态大模型就集体“不会做题“了
一句话总结把题目从文本挪进图片主流多模态大模型几乎全军覆没24 个组合全掉分平均 17.8 分而它们常常能正确读出题目却不照它作答——这篇论文用一套干净的控制实验证明读视觉文本和把它当任务指令用是两种能力并给了一个 region 级训练法把这道鸿沟缩小推理还不用 OCR。 先问一个可能戳到你的问题你有没有过这种经历让大模型看一张图——工单截图、学生拍的试卷、一张报表——它明明把图里的文字一字不差读出来了答案却跑偏到离谱。你的第一反应大概是OCR 不行换个更强的视觉模型。换完还是错。再换还是错。然后你开始怀疑人生它字都认对了题怎么还是做不对这篇 2026 年 8 月挂在 arXiv 上的论文《When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning》给的答案有点反直觉问题大概率不在读在用。作者用一套相当干净的控制实验证明对多模态大模型MLLM来说“认出图片里印着的问题和把这个问题当成指令去执行”——是两种不同的能力中间隔着一道被几乎所有评测忽略的鸿沟。做截图问答、文档智能、RAG over 扫描件、让 agent 读 UI 的人这篇值得花十分钟。想自己动手试 论文arXiv 2608.04726 全文 HTMLarxiv.org/html/2608.04726v1 代码 / 数据集论文称计划释放标注、脚本与通过合规审查的图像当前未见公开仓库留意作者主页 这篇论文到底想解决什么问题先说一个被大多数 MLLM 评测默认的前提问题放文本里图片只当证据。你回想一下自己跑过的多模态 benchmark——MATH-Vision、ChartQA、MathVista、MMMU——题目永远是用文本发给模型的图片只负责提供图表、公式、场景。也就是说视觉文字visual text在这套设定里永远是被抽取的对象一个标签、一个数值、一段话而不是定义任务本身的指令。但现实世界不是这样。真实场景里题目常常就印在图片上一张拍照的试卷、一封截图邮件、一份扫描工单。这时候图片里的文字不是证据是指挥棒——它决定模型该怎么用剩下的视觉信息、要算出什么。问题来了当这道指挥棒从文本通道搬到图像通道模型还使得动它吗之前不是没人发现这个现象。VIM、VoQA、VISTA-Bench 都报告过把指令视觉化会让模型变差。但作者指出这些观测到的变差是个大杂烩——里面混着画布变大、图片被 resize、渲染器出错、问题内容丢失、以及语义通道本身切换五个效应。光看一个精度下降你根本分不清模型到底是没读对题目还是读对了但没用上。这就是这篇论文要切的第一刀把读和用分开度量。图说同一道题、同一张图、同一个答案唯一的变化是问题从文本上跑到了图片像素里下——这就是 VTS 干预目的是让通道切换成为唯一扰动️ 它的思路是什么作者的思路分两步先用一个叫VTSVisualized Task Semantics视觉化任务语义的干预精准测出鸿沟再用prompt-region grounding这个训练法缩小鸿沟。第一步VTS——把通道切换孤立出来。给定一道 benchmark 题问题q qq、图x xx、答案a aaVTS 做的事很简单用一个确定性的渲染器把问题q qq画进图片上方的白板里然后把原来文本通道的问题换成一个跟题目无关的固定提示——“Help me solve the problem”论文里记作q min ⁡ q_{\min}qmin​。源问题、视觉证据、答案三者原封不动地配对。光这样还不够作者还配了三个控制组来排除混淆——这一步是我觉得全文最漂亮的设计Canvas空白画板问题还在文本里图片上方加一块空白白板——测画布变大、图片被 resize单独的影响Duplicate双通道问题同时出现在文本和图片里——测问题内容有没有丢Image-only双通道都无两个通道都把问题拿掉——测一个底线结果非常干净Canvas 偏离原始精度不超过 1.1 分Duplicate 不超过 0.6 分Image-only 直接崩塌。换句话说画布、resize、内容丢失都解释不了那道鸿沟能解释的只剩语义通道本身切换。这下读≠用才真正立住。第二步prompt-region grounding——教模型把图片里的问题当指令用。知道了鸿沟在哪怎么补作者的答案是两个 region 级训练目标名字都挺吓人但原理可以用人话说清楚PVRD-SG区域语义对齐训练时模型手里有问题区域的方框VTS 渲染器记录的或真实数据用 GLM-OCR 划的。它要求图片里问题区域的内部表示必须接近同一道题用纯文本输入时的表示——而且文本侧那个表示是冻结的、不跟着训练变。一句话逼着图片里那块区域的语义指纹长得像文本题的语义指纹。PRMLP区域掩码预测把问题区域随机挡住一部分要求模型从挡过的残图里还原出干净问题截图的表示。注意它还原的是表示不是像素、也不是文字——逼着那块区域在部分看不清时仍然稳定。这两条损失和普通的监督学习损失加一起训练关键在于方框、干净截图这些辅助信息只在训练时用推理时模型只收到一张图 一句固定提示直接作答不需要 OCR、不需要定位框。图说左边的 Paired Replay 让同一题以文本版和图片版两种视图出现、共享答案中间 PVRD-SG 把图片问题区域连到冻结的文本表示PRMLP 从遮蔽的问题区域重建干净截图的表示右边 GSPO 是最后的强化学习精修。推理时这些辅助都不在为什么非要区域级而不是整张图对齐因为 VTS 合成图里有两类信息——问题定义任务、背景图提供证据。你要是拿整张图的表示去对齐它会被图表、物体、示意图带偏淹没掉问题本身的语义。只从问题那块方框里读表示问的才是一个干净的问题这块印着指令的区域表达的到底是不是同一道题我觉得这个设计直觉很对——它做的事本质上是给模型装一个局部对齐探针而且消融实验里有个很硬的证据支持它把对齐目标故意错配到别的样本上deranged targetPVRD-SG 掉 2.6 分。这说明增益不是随便加个辅助 loss 就行而是真的在学这块区域 这道题的映射。训练完还有一步GSPOGroup Sequence Policy Optimization一种强化学习算法做精修——用格式对不对 答案对不对两个可验证的信号继续优化。这块不是本文主角更像锦上添花。 效果到底怎么样先看最扎心的那条发现。作者在 6 个 MLLM包括 Qwen3-VL 的 thinking 和 instruct 变体、InternVL3.5、DeepEyes× 4 个 benchmark 上跑了 VTS24 个模型×任务组合准确率全部下降平均掉 17.8 分最多的掉 28.0 分。没有一个是例外。图说每个模型的 VTS 条右都低于 Original 条左无一例外作者刻意同时画两条因为有的模型差距小只是因为两边都差而且有个反直觉的细节会想的模型反而栽得更狠。Qwen3-VL-4B-Thinking 在 MATH-Vision 上原始精度 60.0比 instruct 版的 51.6 强一截但它把题目画进图后掉 27.4 分instruct 版只掉 16.8。换句话说思考能力越强似乎越依赖问题得在文本通道里才能发力。那读≠用到底怎么证明的看这组诊断数字base 模型能把视觉题目精确转录87.6%基本都认对了但只答对48.4%。更妙的是把模型自己转录出来的文字再塞回文本通道答案准确率还能再涨 7.7 分。字都认对了可这些字作为像素时对答案的指挥力远不如作为 token时——这就是鸿沟落在读出来之后的铁证。上了 prompt-region grounding 之后呢在 Qwen3-VL-4B 上、控制了训练成本的前提下四任务平均 VTS 准确率58.0 →66.3鸿沟从 11.2 缩到 4.0原始文本接口精度69.1 → 70.3没掉还略涨等成本的普通 SFT 只有 58.0——单纯多训 next-token 解释不了这个增益外推也站得住在独立构建的 VISTA-Bench 上 4.1 分在 1000 张训练时没见过的真实截图/试卷/表单上 7.9 分。最后看一个最有代入感的案例——银行对账。从一笔 GH¢12,345 的余额出发算现金账未调整余额对照模型Qwen3VL-8B-Thinking把图片里的 23,000 误读成 2,300、把 4,321 误读成 4,123一个识别错误经过几步加减乘除最终答案少了 GH¢20,898——恰好等于被误读的 20,700 加上漏掉的 198。图说一个读错一个数如何被多步计算放大成两万多的偏差红色是第一个识别错误及所有受它影响的后续数值——这是视觉任务里最典型的失败传播这个案例我觉得比任何精度数字都更能说明问题真实世界的视觉任务常常是一长串计算一个字认错后面全跟着错。这也是为什么读得对在这类场景里性命攸关。 为什么你要关心落到你自己的工作上这篇论文至少有三处值得停下来想想如果你做多模态评测你跑的分很可能系统性高估了模型处理真实视觉任务的能力——因为你的题目都在文本通道里。把 VTS 这套配对干预 三控制搬到自家 benchmark 上跑一遍你大概率会看到一个不太好看的数字。这是一种便宜又有说服力的能力体检。如果你做截图问答 / 文档智能 / agent 读 UI那道 17.8 分的鸿沟就是你线上掉点的来源之一。这篇给的 region 级训练法是一个可借鉴的方向——尤其如果你手里能拿到问题区域的框哪怕用现成 OCR 划一下PVRD-SG 的区域表示对齐到文本表示是个低成本可试的 loss。如果你只是个 MLLM 使用者下次遇到模型明明认对了字却答错别急着换模型——先想想你是不是把指令也塞进图片里了。把关键指令单独放到文本 prompt 里可能比换模型管用。换个角度看这其实也说明我们给多模态模型出的题一直都在作弊。把题目放在文本里等于偷偷帮模型省掉了一种能力。一旦把这层保护罩拿掉模型真实水平才露出来。 理性看待该泼的冷水也得泼。第一这道鸿沟是被缩小不是被消除。四任务残差 gap 还有 4.0 分ChartQA 6.8、MMMU 6.1——离通道完全等价还远。把它当已解决会吃亏。第二论文的等成本对照是用FLOPs 估算做的把 PVRD-SG / PRMLP 多出来的 forward / target / backward pass 都算进去把普通 SFT 卡在 5% 误差内。但 FLOPs 估算本身有任意性PRMLP 每 2 步要多跑两次视觉编码——“等成本 SFT 步数更少可能让 SFT 处于不利位置。作者诚实地写了不主张更长 SFT 一定更差”但读者心里要对这个 8.4 分的绝对值打个折。第三真实世界那 1000 张测试图的标注和训练用的 5 万多张真实图走的是同一条标注管线GLM-OCR 提框 GPT-5.4 标注 Gemini 质检。标注内部自洽学生抽查 97.4% 一致不等于和真实正确答案一致——若管线对某类版式系统性误标训练和测试会共享同一个偏差7.9 的外推强度因此要打折。最后作者自己也很坦诚注意力图和表示检索只能描述模型学了什么没法证明唯一内部机制。换句话说区域表示对齐到文本语义是设计意图不是被坐实的机理——它和区域级数据增强 一致性正则的边界论文用错配目标实验挡了一部分但没完全分开。所以一句话现象诊断几乎无懈可击方法有效但要按作者的成本口径理解机制解释留在描述层。这种诚实标注自己证据边界的姿态反而是我相信它核心结论的一个重要原因。作者lusca版本lusca-paper-blog v1.5.0出处https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-blog

相关新闻

单Activity+多Fragment以及多模块Activity+多Fragment“的设计模式编写的架构

单Activity+多Fragment以及多模块Activity+多Fragment“的设计模式编写的架构

单Activity多Fragment以及多模块Activity多Fragment"的设计模式编写的架构Rocket一、特性二、Github地址三、分享设计Rockt架构的思路四、踩坑经验之旅1、Can not perform this action after onSaveInstanceState2、FragmentManager is already executing transactions3、…

2026/10/12 0:32:32 阅读更多 →
三步搞定SoundCloud音乐收藏:scdl下载器实战指南

三步搞定SoundCloud音乐收藏:scdl下载器实战指南

三步搞定SoundCloud音乐收藏:scdl下载器实战指南 【免费下载链接】scdl Soundcloud Music Downloader 项目地址: https://gitcode.com/gh_mirrors/sc/scdl 想要轻松收藏SoundCloud上的音乐,建立个人专属音乐库吗?scdl下载器正是你需要…

2026/10/10 17:44:38 阅读更多 →
职业信心崩塌的深层原因与系统性重建路径

职业信心崩塌的深层原因与系统性重建路径

1. 先理解“职业信心”崩塌,到底在崩塌什么 这个话题看起来很大,但落到每个具体的人身上,其实非常具体。当一个阶层的劳动者普遍对自己的职业生涯失去信心,核心崩塌的不是“努力”这个动作,而是支撑“努力”的几根支柱…

2026/10/10 13:41:48 阅读更多 →

最新新闻

螺栓销钉缺失检测:1209张VOC数据集与YOLOv8训练实践

螺栓销钉缺失检测:1209张VOC数据集与YOLOv8训练实践

简介:输电线路螺栓销钉缺失检测图像数据集专注电力设施智能巡检场景,面向计算机视觉研究者与电力运维开发人员,旨在解决销钉缺失这一高危隐患的自动识别问题。数据集共2000个文件、约89.52MB,包含791张高清JPEG巡检图像及1209个PA…

2026/10/12 0:32:15 阅读更多 →
AI知识简记(持续更新):用TaoToken统一Key打通VS Code与Cursor的大模型调用

AI知识简记(持续更新):用TaoToken统一Key打通VS Code与Cursor的大模型调用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 0:32:15 阅读更多 →
信用风险预测模型实战:从标签定义、WOE特征工程到评分卡转换

信用风险预测模型实战:从标签定义、WOE特征工程到评分卡转换

简介:这份PDF是一篇基于机器学习算法的商业银行信用风险预测模型研究论文,适合金融科技、风控建模方向的从业者、研究生及竞赛选手参考。文章从信用风险研究的现实背景切入,系统梳理了多元判别分析、Logistic回归等传统统计方法,以…

2026/10/12 0:32:15 阅读更多 →
基于VGG的自然灾害图像分类:迁移学习与Grad-CAM实战

基于VGG的自然灾害图像分类:迁移学习与Grad-CAM实战

简介:这份资源面向图像识别与机器学习方向的初学者及进阶开发者,聚焦自然灾害场景的自动分类任务,帮助读者理解如何用VGG卷积神经网络完成从数据预处理到模型训练与评估的完整流程。压缩包共29个文件,约1.54MB,包含5个…

2026/10/12 0:31:15 阅读更多 →
JDK11核心新特性与升级实战:语法、API及GC全面解析

JDK11核心新特性与升级实战:语法、API及GC全面解析

1. 为什么说JDK11是继JDK8之后最值得升级的版本JDK11确实是一个非常特殊的存在。作为Oracle在2018年9月发布的LTS版本,它既是Java 8之后第一个真正意义上的长期支持版本,又是Oracle调整Java版本发布节奏后的关键节点。对于做Java开发的同学来说&#xff…

2026/10/12 0:31:15 阅读更多 →
Python+OpenCV答题卡自动批改:检测、切分、考号识别与选择题评分

Python+OpenCV答题卡自动批改:检测、切分、考号识别与选择题评分

简介:这份源码包面向计算机、数学、电子信息等专业的学生与开发者,聚焦答题卡自动识别与批改场景,可用于课程设计、期末大作业、毕设项目或初期项目立项演示。项目基于Python实现答题卡检测、试题切分、学生考号识别与选择题自动批改&#xf…

2026/10/12 0:31:15 阅读更多 →

日新闻

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

在数码相机、高清显示屏与现代矢量图形技术高度发达的今天,画面可以做到绝对的锐利、平滑与无瑕。然而,当一张秋日手账插画或拍立得照片过于“平整无瑕”时,往往会散发出一种冰冷生硬的“数码塑料感(Digital Plasticity&#xff0…

2026/10/12 0:00:59 阅读更多 →
活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

在现代网页与移动端设计中,横排(Horizontal Layout)早已经成为了绝对的主流。然而,当我们翻开泛黄的线装古籍、宋版木刻诗集,或是欣赏一张茶道雅集的手写便签时,那种**自上而下纵向书写、自右向左逐列铺展&…

2026/10/12 0:00:59 阅读更多 →
周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

每到周日的晚上八点到十点,很多人心里都会悄悄亮起一盏警示灯。 在心理学上,这种现象有一个专门的称谓——“周日夜晚焦虑症(Sunday Scaries)”。明天又是周一,闹钟又要重新在七点响彻卧房;脑海里仿佛有一个…

2026/10/12 0:00:59 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/12 0:16:30 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/12 0:16:38 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/12 0:16:43 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →