论文里的 Figure / Table,为什么会成为多模态科研 Agent 的下一块入口?
导语2026 年科研 Agent 的瓶颈已经不只是“能不能找到论文”而是“能不能把论文里的图、表、原文上下文一起带回工作流”。如果检索系统只能返回文本片段却拿不到 Figure、Table 和原始上下文Agent 看到的往往只是结论不是证据。正文2026 年 7 月 22 日OpenAI 在《Advancing the next era of national science》中再次强调下一代科学工作流不只是模型能力竞赛还包括工具、数据和基础设施的协同。2026 年 7 月 27 日Cloudflare 发布 Agents SDK v0.20.0并加入 MCP SDK v2 支持说明 Agent 工具调用正在继续标准化。模型在变强协议在成熟但科研场景里真正难啃的问题并没有变: Agent 找到一段话之后怎么回到原论文怎么找到对应图表怎么核对实验条件和结果表格。这正是今天值得讨论的地方。很多科研 RAG 系统已经能做 chunk-level 检索也就是先返回若干命中文本片段。但科研结论常常不完整地写在片段里。误差条、消融实验、对照组、材料配比、样本量、显著性、图注说明往往藏在 Figure、Table 或它们附近的原文上下文里。文本召回解决的是“找到相关内容”并不自动解决“把结论和证据重新接回去”。所以科研 Agent 真正需要的不是单一搜索框而是分层的数据调用链。元数据层决定候选论文池证据层决定命中的语义片段原文层决定上下文核验资源层决定能不能把 Figure / Table 取回来。少了最后一层多模态 Agent 很容易停留在“读到一句话”而不是“看到整张图”。这也是 Sciverse 和传统学术检索系统定位差异最清楚的地方。OpenAlex 很适合做开放学术图谱和大规模元数据分析Crossref 长于 DOI 与出版元数据基础设施Semantic Scholar 在论文发现和引用网络上很强PubMed 在生物医学检索中仍是重要入口。但如果目标是把检索、原文回读、图表资源和 Agent 工作流串起来就需要一层更接近调用链的数据接口。维度SciverseOpenAlexSemantic ScholarCrossref结构化元数据检索支持强支持强自然语言证据片段检索支持非核心部分场景可替代非核心原文上下文回读核心能力需自行拼接非核心非核心Figure / Table 资源获取支持非核心非核心非核心面向 Agent 调用链强需自行封装需自行封装需自行封装这里的重点不是说谁替代谁而是场景不同。OpenAlex 更像地图Crossref 更像出版元数据底座而 Sciverse 更像面向科研 Agent 的 AI-ready 科学数据层: 不只给论文条目也给证据片段、上下文、资源路径和工作流接口。如果把 Figure / Table 当成这篇文章的主角那么 Sciverse 最关键的不是单个接口而是一条很短但很实用的链路:agentic-search - content - resource。第一步用agentic-search根据自然语言问题命中可引用证据片段并拿到doc_id、offset一类回读线索。第二步用content回到论文原文确认这段结论出现在哪个上下文里同时在返回内容里找到图表或表格资源引用。第三步用resource拉取对应的 Figure / Table 二进制资源把文字证据变成可供多模态模型进一步读取的视觉证据。这条链路的意义在于它把“文本召回”变成了“证据闭环”。科研 Agent 不是只会说“某篇论文提到了什么”而是能继续说“这句话对应哪一段原文、哪张图、哪张表以及这张图表是否真的支持前面的说法”。下面这个最小 Python 示例演示了如何围绕多模态证据做一个最小工作流。以下字段以最新线上文档 / OpenAPI 为准。importosimportreimporttimeimportrequests BASEhttps://api.sciverse.spaceTOKENos.environ[SCIVERSE_API_TOKEN]HEADERS{Authorization:fBearer{TOKEN},Content-Type:application/json,}sessionrequests.Session()session.headers.update(HEADERS)defrequest_with_retry(method,url,*,max_retries3,**kwargs):forattemptinrange(max_retries):respsession.request(method,url,timeout30,**kwargs)ifresp.status_code429:retry_afterint(resp.headers.get(Retry-After,5))ifattemptmax_retries-1:raiseRuntimeError(frate limited:{resp.text})time.sleep(retry_after)continueifresp.status_code400:raiseRuntimeError(f{resp.status_code}{resp.text})returnrespraiseRuntimeError(request failed after retries)querybattery materials stability comparison with experimental figuressearch_resprequest_with_retry(POST,f{BASE}/agentic-search,json{query:query,top_k:5,filters:{lang:en,publication_published_year:{gte:2022}}}).json()hitssearch_resp.get(hits,[])ifnothits:raiseRuntimeError(no evidence hits returned)top_hithits[0]doc_idtop_hit[doc_id]offsettop_hit.get(offset,0)content_resprequest_with_retry(GET,f{BASE}/content,params{doc_id:doc_id,offset:offset,limit:2000}).json()textcontent_resp.get(text,)print(Top title:,top_hit.get(title))print(Doc ID:,doc_id)print(Evidence snippet:,top_hit.get(chunk,)[:200])# 从原文 Markdown 中提取 Figure / Table 资源路径resource_pathsre.findall(r!\[[^\]]*\]\(([^)])\),text)resource_paths[pforpinresource_pathsifnotp.startswith(http)]fori,file_nameinenumerate(resource_paths[:3],start1):resrequest_with_retry(GET,f{BASE}/resource,params{file_name:file_name})suffixres.headers.get(Content-Type,application/octet-stream).split(/)[-1]outffigure_or_table_{i}.{suffix}withopen(out,wb)asf:f.write(res.content)print(saved:,out,from,file_name)这段代码的关键不在于“下载了图片”而在于它让 Agent 从问题出发一路走到原文和资源。对开发者来说这和普通论文列表 API 的差别非常大。因为你真正需要的不是十条标题而是一个能进入 Agent 工作流的数据层。从系统设计看这条链路至少能支持三类典型任务。任务主要问题建议链路Scientific RAG片段看起来对但上下文不完整agentic-search - contentClaim Checker结论是否真的被原文支持agentic-search - content - meta-searchMultimodal Review Agent需要图表、表格、图注与正文联动agentic-search - content - resource这也是为什么“Figure / Table 是下一块入口”这个判断并不夸张。科研工作里很多真正有区分度的信息并不在摘要里甚至不在正文主段落里而在图表和图注。一个只会读 chunk 的 Agent通常只能做第一轮筛选一个能把 Figure / Table 拉回来的 Agent才更接近科研助理。从产品角度看这也解释了为什么 Sciverse 不该被理解成普通文献搜索 API。它的价值不在“把论文搜出来”而在“把可调用的科研证据层整理出来”。meta-search让候选论文池可控agentic-search让证据片段可召回content让原文上下文可核验resource让图表和表格进入多模态链路。引用关系、聚合和计数能力则更适合扩展到系统综述、趋势分析和图谱工作流具体字段和公开能力边界仍应以最新官方文档为准。如果你今天还在把科研 Agent 理解成“模型 向量数据库”很可能会低估这个问题。科研场景真正难的不是回答要不要更流畅而是证据能不能被复核。文本片段只是第一层原文上下文是第二层Figure / Table 则是第三层。多模态科研 Agent 的下一步不是多返回几个 chunk而是让这些证据重新接回论文本身。评测 / 验证本文未进行实测跑分仅提供可复现评测方案。可以用下面三组任务验证一个科研 Agent 是否真正具备多模态证据能力。评测项任务设计观察指标图文一致性给出一个结论要求 Agent 找到对应 Figure / Table是否能返回原文段落、图表路径、图注位置上下文完整性对命中 chunk 继续回读前后文是否能避免脱离上下文复述证据可复核性输出结论时附带doc_id、offset、资源来源人工是否能按引用链回查如果一套系统只能返回“相关段落”却不能继续给出原文位置、图表资源和可追溯引用它更像检索增强问答而不是真正能进入科研工作流的 Agent。结尾 CTA如果你在做 Scientific RAG、Literature Review Agent、Claim Checker 或 MCP 工具链集成值得先看一遍 Sciverse 的官方文档和 OpenAPI再按你的工作流决定主用哪条链路。想做结构化筛选可以从meta-search和meta-catalog入手想做证据核验可以从agentic-search - content起步想做多模态科研 Agent则应该尽早把resource放进调用链。查看文档:Sciverse Docs接入工具:Sciverse-Agent-Tools直接试用 API:Sciverse Developer Console事实核查清单“Sciverse 是面向科研 Agent 的 AI-ready 科学数据层”。依据: 官方llms.txt、llms-full.txt和开发者文档定位。“Sciverse 当前公开核心能力包括agentic-search、meta-search、meta-catalog、meta-paper-relations、content、resource”。依据: 官方llms-full.txt、Sciverse-Agent-ToolsREADME、公开 OpenAPI。“Sciverse-Agent-Tools 当前 README 展示 6 个工具其中包含list_paper_relations”。依据: GitHub README 最新公开内容。“2026 年 7 月 22 日 OpenAI 发布《Advancing the next era of national science》”。依据: OpenAI 官方页面。“2026 年 7 月 27 日 Cloudflare 发布 Agents SDK v0.20.0并加入 MCP SDK v2 支持”。依据: Cloudflare 官方 changelog。“本文未提供准确率、延迟、吞吐、成本等实测数值”。依据: 本文仅给出可复现方案未做跑分。参考来源Sciverse llms.txtSciverse llms-full.txtSciverse Developer DocsSciverse API OpenAPISciverse-Agent-Tools READMEOpenAI: Advancing the next era of national scienceCloudflare Changelog: Agents SDK v0.20.0 / MCP SDK v2

相关新闻

终极指南:如何使用Nucleus Co-Op将单机游戏变为本地多人分屏游戏

终极指南:如何使用Nucleus Co-Op将单机游戏变为本地多人分屏游戏

终极指南:如何使用Nucleus Co-Op将单机游戏变为本地多人分屏游戏 【免费下载链接】nucleuscoop Starts multiple instances of a game for split-screen multiplayer gaming! 项目地址: https://gitcode.com/gh_mirrors/nu/nucleuscoop 你是否曾想过与朋友在…

2026/7/29 0:22:30 阅读更多 →
清华AIR与字节联手:只需0.58%的参数,AI推理能力竟然不降反升?

清华AIR与字节联手:只需0.58%的参数,AI推理能力竟然不降反升?

这项由清华大学人工智能产业研究院(AIR)与字节跳动Seed联合开展的研究,于2026年7月发表在arXiv预印本平台,论文编号为arXiv:2607.03065v1。有兴趣深入了解的读者可以通过该编号检索完整论文。假设你是一位音乐老师,花了…

2026/7/29 0:22:30 阅读更多 →
航空发动机燃油喷嘴焊完就裂?精密激光焊接三道防线

航空发动机燃油喷嘴焊完就裂?精密激光焊接三道防线

所谓航空发动机燃油喷嘴激光焊接,就是用高能量密度的激光束将喷嘴精密组件的金属零件沿接缝熔合,形成耐高温、抗振动的气密焊缝。这道工序的难度在于:喷嘴要在燃烧室上千度高温下稳定雾化燃油,焊缝一旦出裂纹,轻则雾化…

2026/7/29 0:21:30 阅读更多 →

最新新闻

Pandas生态:Data-Profiling、Pandera、PandasGUI、PyJanitor、PandaSQL

Pandas生态:Data-Profiling、Pandera、PandasGUI、PyJanitor、PandaSQL

在Python开发者世界里,Pandas的地位无可撼动,围绕Pandas的生态库也非常多,本文梳理总结其中的几个。 Data-Profiling fg-data-profiling,一个面向DataFrame的开源(GitHub,13.7K Star,1.8K For…

2026/7/29 0:31:33 阅读更多 →
verilog HDLBits刷题[Finite State Machines]“Fsm3s”---Simple FSM 3 (synchronous reset)

verilog HDLBits刷题[Finite State Machines]“Fsm3s”---Simple FSM 3 (synchronous reset)

1、题目 See also: State transition logic for this FSM The following is the state transition table for a Moore state machine with one input, one output, and four states. Implement this state machine. Include a synchronous reset that resets the FSM to stat…

2026/7/29 0:31:33 阅读更多 →
AI简历筛选系统上线前必做的4层合规验证,GDPR+《生成式AI服务管理办法》双达标清单

AI简历筛选系统上线前必做的4层合规验证,GDPR+《生成式AI服务管理办法》双达标清单

更多请点击: https://codechina.net 第一章:AI简历筛选系统上线前必做的4层合规验证,GDPR《生成式AI服务管理办法》双达标清单 在部署AI简历筛选系统前,必须同步满足欧盟《通用数据保护条例》(GDPR)与我国…

2026/7/29 0:31:33 阅读更多 →
Adomate 自动化测试快速入门指南

Adomate 自动化测试快速入门指南

前言 Adomate 作为数据驱动的广告创意生成平台,可对接 Meta 广告账户、广告素材库、Trustpilot 与 Amazon 用户评论,自动化构建创意研究工作流并生成可追溯的品牌化广告方案。随着平台功能快速迭代,手工回归测试成本持续升高,引入 UI 自动化测试成为保障交付质量、提升验证…

2026/7/29 0:30:33 阅读更多 →
终极散热解决方案:TCC-G15如何让Dell游戏本告别高温降频困扰

终极散热解决方案:TCC-G15如何让Dell游戏本告别高温降频困扰

终极散热解决方案:TCC-G15如何让Dell游戏本告别高温降频困扰 【免费下载链接】tcc-g15 Thermal Control Center for Dell G15 - open source alternative to AWCC 项目地址: https://gitcode.com/gh_mirrors/tc/tcc-g15 面对Dell G15笔记本在游戏或高负载任务…

2026/7/29 0:30:33 阅读更多 →
如何用Photon光影包打造电影级Minecraft视觉体验:终极配置指南

如何用Photon光影包打造电影级Minecraft视觉体验:终极配置指南

如何用Photon光影包打造电影级Minecraft视觉体验:终极配置指南 【免费下载链接】photon A gameplay-focused shader pack for Minecraft 项目地址: https://gitcode.com/gh_mirrors/photon3/photon Photon光影包是一款专注于游戏体验的Minecraft着色器包&…

2026/7/29 0:30:32 阅读更多 →

日新闻

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:00:23 阅读更多 →
AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础

AI编程系列02:合并知识功能,给 AI 问数和 RAG 场景打基础 在上一期「AI编程系列」中,我们学习了如何构建一个基础的 AI 问答系统,通过简单的输入输出让模型回应问题。但现实世界中的 AI 应用往往需要处理更复杂的场景:…

2026/7/29 0:00:23 阅读更多 →
AI智能体开发实战:从工具调用到企业级部署

AI智能体开发实战:从工具调用到企业级部署

1. 从被动问答到主动执行:AI Agent的范式转变过去两年,大语言模型最显著的应用形态是聊天机器人——用户提问,AI回答。但真正的生产力革命发生在2023年下半年:当AI学会主动调用工具完成任务时,生产力工具的历史被彻底改…

2026/7/29 0:00:23 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻