AAAI 2026 | LAT:让文档RAG一边推理,一边指出证据在哪里
在视觉文档问答中模型给出正确答案并不代表推理过程可信。面对论文、报告、网页截图和多页文档用户不仅需要知道“答案是什么”还需要知道模型依据了哪一页、哪张表以及每一步推理是否得到原始文档的支持。针对这一问题中国科学技术大学提出了Chain-of-EvidenceCoE推理范式和Look As You ThinkLAT强化学习框架让视觉语言模型在生成推理步骤的同时持续定位相应的视觉证据。一、文档RAG的问题不只是答错更是无法验证现有视觉文档检索增强生成系统通常包括两个环节。系统首先从文档库中检索相关页面再由视觉语言模型阅读页面并生成答案。为了提高可信度部分方法还会在最终答案后提供页码或边界框指出答案可能来自哪个区域。但这种“答案加最终证据”的方式仍然存在明显缺陷。模型只展示了最终结果却没有说明自己如何逐步找到答案。用户无法判断模型是否先定位到了正确章节是否准确读取了对应表格也无法确定中间推理是否引用了错误内容。例如面对“研究中共有多少名患者”这一问题模型可能正确回答“231”但用户仍然不知道模型是否找到了描述研究对象的部分是否正确读取了男性患者204人和女性患者27人以及最终答案是否真的由这两个数字相加得到。人类阅读复杂文档时通常不会直接跳到答案而是按照“章节、段落、具体元素”的顺序逐步缩小范围。论文认为可靠的文档RAG也应该呈现类似的渐进式证据搜索过程。Figure 1Figure 1清晰展示了传统回答方式与CoE的区别。模型不再只框出最终答案而是在寻找章节、读取句子、检查表格和完成计算的过程中持续标记当前使用的视觉区域。二、Chain-of-Evidence每一步推理都有据可查传统的 Chain-of-Thought 让模型输出一连串文本推理例如“先查找临床特征部分再阅读表格男性患者为204人女性患者为27人因此患者总数为231人。”这些文字看起来逻辑完整但用户无法确定模型是否真的看到了对应内容。模型也可能根据语言模式生成一段听起来合理、实际上没有文档支撑的解释。CoE在此基础上增加了一个关键要求每当推理步骤引用文档中的事实、图表或文字时模型都要同时输出对应的页码和边界框。以论文第一页展示的案例为例。模型需要回答“研究中共有多少名患者”。CoE推理过程会依次完成第一页展示的案例找到文档中“Clinical characteristics”部分。定位介绍队列特征的句子。转向表格进行确认。找到男性患者204人、女性患者27人的具体区域。计算得到总人数为231人并再次标出支持最终答案的表格区域。这样一来模型输出的不再只是一条文本推理链而是一条由“文字推理、页码、视觉区域”共同组成的证据链。从形式上看CoE需要模型同时生成三类结果• 文本推理步骤• 每个步骤对应的页面索引与边界框• 最终答案及其核心支持区域因此CoE的价值并不只是让输出“看起来更详细”而是把文档问答拆解为一系列可以逐步检查的证据单元。用户不仅能够核查最终答案也可以核查推理过程中的每一次信息引用。三、LAT框架用少量标注和强化学习教模型“边想边看”要让模型生成CoE一个直接方案是人工标注大量逐步推理过程并为每一步框选证据区域。但这种方法成本极高。标注者不仅要回答问题还需要编写完整推理过程定位页面并为多个中间步骤绘制边界框。为减少对人工标注的依赖论文提出了两阶段训练框架Look As You Think。两阶段训练框架第一阶段是冷启动监督微调研究团队从每个训练数据集中抽取1000个样本利用Gemini 2.5 Pro生成带有推理步骤、页码和边界框的CoE轨迹。生成结果先根据答案召回率进行过滤再由人工检查和修正错误的边界框及输出格式。经过筛选后大约30%的高质量样本被保留下来用于对Qwen2.5-VL-7B-Instruct进行LoRA监督微调。这一阶段的主要目标不是获得最终性能而是让模型先学会CoE的基本输出方式。第二阶段采用GRPO强化学习LAT从原始数据中抽取5%的问答样本让模型自主生成多条CoE轨迹再通过四类规则奖励判断哪些轨迹值得强化。答案准确性奖励LAT结合软精确匹配与词语召回率评估答案。完全匹配的答案可以获得较高奖励表达略有差异但包含关键信息的答案也可以获得部分奖励。逐步证据归因奖励对于每个带边界框的推理步骤系统会从原始文档中裁剪对应区域再使用ColQwen2计算该区域与推理文本之间的语义相似度。只有当推理内容与框选证据相匹配时模型才能获得奖励。LAT还计算不同步骤边界框之间的重叠程度防止模型在每一步都框选同一个大区域。该约束鼓励模型从较大的相关区域逐渐定位到更具体的内容。最终证据定位奖励模型不仅需要给出正确答案还需要正确选择答案所在的页面。预测边界框与真实证据区域的IoU超过0.5时模型才能获得最终定位奖励。格式奖励模型需要按照规定格式分别输出推理过程和最终答案。格式错误会得到负奖励从而提升生成结果的稳定性和可解析性。四种奖励分别约束答案、过程、最终证据和输出形式。更重要的是逐步证据奖励受到答案正确性的限制。也就是说只有最终答案足够准确时证据一致的中间推理才会得到强化。这一设计避免模型只学会“框选与文字看起来相关的区域”却无法生成正确答案。四、实验结果论文在Wiki-VISA和Paper-VISA上进行实验分别评估单图像与多图像场景。单图像场景直接向模型提供包含答案的页面。多图像场景则向模型提供三个候选页面模型需要先判断哪个页面包含答案再完成推理和证据定位。实验使用三个主要指标EM衡量最终答案是否正确。IoU0.5衡量最终证据区域是否定位准确。SA衡量每个中间推理步骤与对应视觉证据是否一致。表1与原始Qwen2.5-VL-7B相比LAT在四个实验设置中的软EM平均提升8.23个百分点IoU0.5平均提升47个百分点。证据定位能力的提升尤其明显。在Wiki-VISA单图像场景中LAT-Ind.的IoU0.5达到53.7而原始模型只有2.2。在Paper-VISA单图像场景中IoU0.5由3.8提升至49.9。在Wiki-VISA多图像场景中EM由54.9提升至64.5IoU0.5由11.0提升至38.0。在Paper-VISA多图像场景中EM由39.6提升至51.2IoU0.5由16.2提升至46.9。这些结果说明原始模型虽然具备一定的文档问答能力却很难精确指出答案所在区域。LAT在保持和提升答案准确性的同时显著改善了视觉证据定位。论文还单独评估了完整CoE推理过程。表2仅在提示词中加入一个CoE示例只能有限地改善模型表现。经过LAT训练后模型不仅能遵循CoE格式还能准确地将不同推理步骤绑定到相关证据区域。论文报告LAT生成的CoE轨迹平均SA达到57.1%表明模型已经能够在较大比例的推理步骤中实现文本内容与视觉证据的一致。图3五、过程与结果共同优化论文的消融实验揭示了LAT性能提升的核心原因。表4第一阶段监督微调得到的Mdist已经明显优于原始模型说明少量经过验证的CoE数据能够帮助模型掌握证据链格式并初步改善视觉定位。但从Mdist进入LAT强化学习阶段后IoU0.5和SA仍然获得了大幅提升。这表明仅仅模仿人工生成的CoE轨迹还不够模型还需要通过强化学习不断探索和筛选更可靠的推理路径。移除逐步证据奖励后模型的SA平均下降约15.5个百分点最终证据定位性能也随之降低。这一结果说明中间步骤的证据质量会直接影响模型最终能否找到正确答案区域。另一方面如果仅优化推理文本与视觉区域之间的相似度却取消答案准确性对过程奖励的约束模型可能生成“局部合理但整体错误”的证据链。因此LAT最重要的设计并不是某一个独立奖励而是将两类目标连接起来过程层面要求每一步推理都能找到对应证据结果层面要求整条证据链最终导向正确答案。这一思路也体现了论文的核心价值。传统文档RAG更关注模型有没有答对LAT则进一步追问六、总结LAT的核心价值不只是提升文档问答的答案准确率更在于把推理过程与视觉证据统一起来。通过Chain-of-Evidence模型需要在生成每一步推理时同步指出对应的页面和文档区域使用户能够沿着证据链逐步核查答案的来源。当然LAT仍有一定局限。图文语义相似度只能衡量推理文本与局部区域是否相关尚不能完全证明二者具有严格的逻辑支持关系。边界框形式也更适合单一区域定位在跨页面、多区域信息整合等复杂任务中仍显不足。尽管如此这项工作推动文档RAG从“给出答案”进一步走向“展示依据”。未来更可靠的文档智能系统不仅需要回答正确还需要说明答案来自哪里、经过了怎样的推理以及每一步是否能够回到原始文档中验证。当模型能够在思考过程中同步展示自己正在查看的证据文档RAG才真正从黑箱生成迈向可追溯、可核查的推理。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

如何快速入门clusterd?5分钟掌握应用服务器攻击工具的核心功能

如何快速入门clusterd?5分钟掌握应用服务器攻击工具的核心功能

如何快速入门clusterd?5分钟掌握应用服务器攻击工具的核心功能 【免费下载链接】clusterd application server attack toolkit 项目地址: https://gitcode.com/gh_mirrors/cl/clusterd clusterd是一款开源的应用服务器攻击工具包,旨在自动化指纹识…

2026/8/3 22:53:51 阅读更多 →
微信小程序Skyline渲染模式实战:从原理到迁移与样式兼容性优化

微信小程序Skyline渲染模式实战:从原理到迁移与样式兼容性优化

1. 初识Skyline:从WebView到原生渲染的范式跃迁 如果你最近在折腾微信小程序,尤其是关注性能优化或者想尝试一些更炫酷的交互效果,那么“Skyline渲染模式”这个词大概率已经出现在你的视野里了。我第一次接触它,是在一个宠物社交小…

2026/8/3 22:52:51 阅读更多 →
微信小程序Skyline渲染引擎实战:从原理到样式兼容性解决方案

微信小程序Skyline渲染引擎实战:从原理到样式兼容性解决方案

1. 项目概述:初探Skyline渲染引擎 最近在折腾微信小程序开发,发现官方文档里悄悄上线了一个叫“Skyline”的渲染模式。这玩意儿听起来挺玄乎,什么“高性能渲染架构”、“更接近Web体验”,对于我这种常年和 scroll-view 的卡顿、…

2026/8/3 22:52:51 阅读更多 →

最新新闻

VideoDownloadHelper:简单高效的浏览器视频下载插件完整指南

VideoDownloadHelper:简单高效的浏览器视频下载插件完整指南

VideoDownloadHelper:简单高效的浏览器视频下载插件完整指南 【免费下载链接】VideoDownloadHelper Chrome Extension to Help Download Video for Some Video Sites. 项目地址: https://gitcode.com/gh_mirrors/vi/VideoDownloadHelper 还在为无法保存网页视…

2026/8/3 23:25:23 阅读更多 →
阿里云天池免费GPU实战:30分钟搭建PyTorch深度学习训练环境

阿里云天池免费GPU实战:30分钟搭建PyTorch深度学习训练环境

1. 项目概述:为什么选择天池免费GPU?如果你正在入门深度学习,或者手头有个小项目想跑起来,但苦于没有一块像样的显卡,那“算力焦虑”绝对是第一道坎。自己买卡?动辄上万的RTX 4090不是谁都舍得。用自己笔记…

2026/8/3 23:25:23 阅读更多 →
打造高效函数式代码:Ramda Adjunct的函数组合技巧

打造高效函数式代码:Ramda Adjunct的函数组合技巧

打造高效函数式代码:Ramda Adjunct的函数组合技巧 【免费下载链接】ramda-adjunct Ramda Adjunct is the most popular and most comprehensive set of functional utilities for use with Ramda, providing a variety of useful, well tested functions with excel…

2026/8/3 23:25:23 阅读更多 →
KTRW与LLDB完美结合:iOS内核调试的7个实用技巧

KTRW与LLDB完美结合:iOS内核调试的7个实用技巧

KTRW与LLDB完美结合:iOS内核调试的7个实用技巧 【免费下载链接】ktrw An iOS kernel debugger based on a KTRR bypass for A11 iPhones; works with LLDB and IDA Pro. 项目地址: https://gitcode.com/gh_mirrors/kt/ktrw KTRW是一款基于KTRR绕过技术的iOS内…

2026/8/3 23:25:23 阅读更多 →
ttl.sh常见问题解答:解决你使用临时镜像仓库的所有疑惑

ttl.sh常见问题解答:解决你使用临时镜像仓库的所有疑惑

ttl.sh常见问题解答:解决你使用临时镜像仓库的所有疑惑 【免费下载链接】ttl.sh An anonymous & ephemeral Docker image registry 项目地址: https://gitcode.com/gh_mirrors/tt/ttl.sh ttl.sh是一个基于zot构建的匿名、临时容器镜像仓库,专…

2026/8/3 23:25:23 阅读更多 →
重新定义Windows体验:用ExplorerPatcher找回熟悉的桌面环境

重新定义Windows体验:用ExplorerPatcher找回熟悉的桌面环境

重新定义Windows体验:用ExplorerPatcher找回熟悉的桌面环境 【免费下载链接】ExplorerPatcher This project aims to enhance the working environment on Windows 项目地址: https://gitcode.com/GitHub_Trending/ex/ExplorerPatcher 你是否曾为Windows 11的…

2026/8/3 23:24:22 阅读更多 →

日新闻

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南 【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。…

2026/8/3 0:00:47 阅读更多 →
[具身智能-181]:PC+服务器+具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构

[具身智能-181]:PC+服务器+具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构

PC服务器具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构一、前言:具身智能需要“混合算力闭环系统”传统人工智能依赖云端静态数据集训练,不具备物理交互能力,无法适应真实世界的不确定性。具身智能(Embodied…

2026/8/3 0:00:47 阅读更多 →
[具身智能-181]:大分布式通信模型对比:看懂为什么 DDS 是 ROS2 底层通信最优解

[具身智能-181]:大分布式通信模型对比:看懂为什么 DDS 是 ROS2 底层通信最优解

前言构建机器人、具身智能这类分布式实时系统,通信底座直接决定整套系统的实时性、容错性、组网能力。分布式领域长期存在 4 类经典通信架构:点对点模式、Broker 中间代理模式、广播模式、以数据为中心(DDS)模式。很多开发者疑惑&…

2026/8/3 0:00:47 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/3 4:58:13 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/3 1:53:31 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/3 4:36:35 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/3 13:07:03 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/3 5:19:38 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/3 8:27:36 阅读更多 →