AI Agent的检索税:多跳搜索为何让token成本暴增4倍
Andrej Karpathy曾把大模型比作患有“顺行性遗忘症”的同事——它保留旧记忆却无法形成新记忆。对Agent来说这种遗忘体现在两个层面跨对话不记得用户以及训练截止后发生的一切它一无所知。Memory机制能缓解第一种遗忘而第二种遗忘的修复主要靠实时Web检索。市场波动、人员变动、价格更新、突发新闻……Agent要想处理当下问题检索质量几乎决定了整个系统的可用性。很多人给Agent接上搜索工具后就以为“它现在能看到互联网了”。实际跑几轮trace后却发现绝大多数token都花在了处理原始网页文本上只有极小一部分用于真正回答问题。每次搜索循环都在支付“检索税”问题不在Agent搜索能力差而在于标准搜索API返回的格式。典型搜索调用只返回链接 30字左右的snippet。Agent拿到后必须自己抓取完整页面、剥离HTML、提取正文才能开始真正工作。单次查询时这个开销还不明显。但在需要多次搜索的研究型任务或简报生成 pipeline 中每一跳都要重复支付这笔“检索税”——抓取、清洗、塞进上下文。我们把同一个问题用三种检索方式跑通并统计token消耗。问题选了“What was Y2K?”因为模型训练时已经知道答案这样能把思考成本控制一致额外token几乎全部来自检索过程。纯记忆回答约600 tokens基准预建索引提前爬取并清洗好的owned index约6,900 tokens标准Web搜索单跳约3,750 tokens标准Web搜索三跳循环约28,700 tokens是预建索引的4倍以上三跳循环的成本之所以暴增是因为每一跳都要把之前已经读过的页面内容重新塞进不断增长的上下文窗口。Agent其实在为“已经知道的内容”重复付费。预建索引则完全跳过了这个过程完整文档在查询到达前就已经准备好一次调用直接返回可用内容。好的检索应该返回文档而不是方向检索税的根源在于返回格式。SERP标准搜索结果页只给URL列表让Agent自己去读网页。普通抓取工具返回原始HTML或MarkdownAgent仍需清洗。预建owned index提前完成所有清洗和结构化一次调用返回可直接推理的完整文档。同一个查询在三种方式下的体验差异极大。以搜索“Christoph Molnar”《Interpretable Machine Learning》作者为例SERP返回一堆标签页Agent几乎得不到答案。神经搜索能定位到人但只返回高亮片段仍需额外调用拿完整记录。预建索引一次返回完整结构化记录Agent直接进入推理阶段。像Seltz这类为Agent设计的索引会提前把网页处理成结构化文档并提供不同scopePeople scope返回完整职业档案角色、时间、公司、教育等News scope返回日期窗口内的完整文章正文Wiki scope返回干净的维基百科文档这些都不是简单替换开放搜索而是针对“需要深度内容”的查询场景。有些答案只存在于记录的交叉中全文档检索带来的不止是成本降低还解锁了snippet无法回答的问题类型。考虑一个GTM团队真实会问的问题“过去一个季度里哪些目标账户新聘用了数据或AI领导角色”回答需要同时满足两个条件完整角色历史判断何时入职 近期新闻确认触发事件。snippet或单次搜索做不到跨记录join。正确做法是先用People scope找出近期入职相关角色的人再用News scope交叉验证触发事件最终输出带上下文的warm account列表并附上可用于首封邮件的个性化切入点。这种答案在网上不存在单一页面它只存在于多条记录的交集里。而只有持有完整记录时join才可能发生。发现与深度检索的合理链式使用开放Web搜索适合发现类问题谁当前担任某个职位、上周刚发布的新闻、今天刚上线的页面。一旦知道要找什么owned index就能一跳返回完整记录而不是标题链接。很多pipeline对所有查询都用同一种搜索工具结果发现类和深度类查询都支付了不必要的检索税。把两者链起来使用发现阶段用开放搜索深度阶段切换到预建索引每一轮迭代的成本都会显著下降。这才是Agent循环成本的真正杠杆点——不是模型本身而是每次搜索调用返回的内容形态。当你构建的研究型、简报型或需要跨记录推理的Agent循环时检索返回“完整文档”而非“指向文档的指针”是目前降低token消耗最直接有效的手段。在你当前构建的Agent循环里研究或信息收集类任务占多大比例你是否已经测量过多跳检索带来的实际token开销本文基于Akshay Pachaar的技术分享重构致敬他对Agent检索效率的系统性拆解。我是紫微AI在做一个「人格操作系统ZPF」。后面会持续分享AI Agent和系统实验。感兴趣可以关注我们下期见。

相关新闻

【AI搜索SEO关键词研究终极指南】:2024年谷歌BERT+Ranking AI时代下,3步锁定高转化长尾词的实战方法论

【AI搜索SEO关键词研究终极指南】:2024年谷歌BERT+Ranking AI时代下,3步锁定高转化长尾词的实战方法论

更多请点击: https://codechina.net 第一章:AI搜索SEO关键词研究的范式迁移与本质重构 传统关键词研究依赖人工词频统计、竞争度估算与搜索量预测,其底层逻辑建立在“用户输入即意图”的静态假设之上。而AI搜索(如Perplexity、Mi…

2026/9/23 19:54:19 阅读更多 →
AI重金投入后,企业PL为何依然沉默

AI重金投入后,企业PL为何依然沉默

在过去一年里,与数百位成功企业的CEO交流后,一个反复出现的情景是:他们支付顶级模型费用、组建AI团队、启动多个试点、组织全员培训,却在私下里问同一个问题——“我们这样投入AI,到底对不对?” 当被追问利…

2026/9/23 8:28:30 阅读更多 →
C++通讯录管理系统:从面向对象设计到文件持久化的完整实践

C++通讯录管理系统:从面向对象设计到文件持久化的完整实践

1. 项目概述与核心价值最近在整理一些老项目,翻到了当年用C手搓的第一个像模像样的“大作业”——通讯录管理系统。这几乎是每个C初学者在掌握基础语法和面向对象思想后,第一个会想到去实践的练手项目。它不像“Hello World”那样简单,也不像…

2026/9/22 10:58:21 阅读更多 →

最新新闻

软件需求四层建模:从业务目标到可测契约的实战方法

软件需求四层建模:从业务目标到可测契约的实战方法

简介:本资源是一份面向高校计算机专业本科生及软件工程初学者的《软件需求分析》教学课件,系统讲解需求工程核心流程与关键概念,助力学习者夯实软件开发前期基础。课件以PPT格式呈现,共1个文件,大小3.03MB,…

2026/9/23 20:26:44 阅读更多 →
抖音运营手册思维导图拆解:从账号定位到数据复盘的可执行清单

抖音运营手册思维导图拆解:从账号定位到数据复盘的可执行清单

简介:这份《抖音官方运营手册:思维导图》面向抖音创作者、账号运营者及电商从业者,系统梳理了平台官方学习路径与运营指导,帮助读者快速建立从入门到进阶的运营知识框架。资源为单个PDF文件,压缩包约400KB,…

2026/9/23 20:26:44 阅读更多 →
2024产品经理实战知识地图:从需求分析到迭代的完整工作法

2024产品经理实战知识地图:从需求分析到迭代的完整工作法

简介:这是一份面向产品经理岗位的实战知识地图,围绕岗位认知、产品生命周期、需求分析、商业分析等核心模块展开,系统梳理了SMART目标设定、马斯洛需求层次、KANO模型、5WHY追问、PRD框架等关键方法,并为原型、流程图绘制列举了Ax…

2026/9/23 20:26:44 阅读更多 →
3个底层原理搞懂预防脱发完整示例

3个底层原理搞懂预防脱发完整示例

3个底层原理搞懂预防脱发完整示例 看了一堆教程还是不会写项目?别慌,这就像你背了所有菜谱却做不出一道菜,缺的是把“预防脱发”这个抽象概念拆解成可执行代码的 完整示例…

2026/9/23 20:26:44 阅读更多 →
InstructBLIP 指令微调视觉语言模型实战指南:基于 LAVIS 的通用多模态理解与生成

InstructBLIP 指令微调视觉语言模型实战指南:基于 LAVIS 的通用多模态理解与生成

InstructBLIP 指令微调视觉语言模型实战指南:基于 LAVIS 的通用多模态理解与生成 【免费下载链接】LAVIS LAVIS - A One-stop Library for Language-Vision Intelligence 项目地址: https://gitcode.com/gh_mirrors/la/LAVIS InstructBLIP 是 LAVIS 仓库中官…

2026/9/23 20:26:44 阅读更多 →
Dopamine 连续控制域实验运行器 ContinuousRunner 完全指南:JAX/Flax Agent 的训练调度、参数配置与源码剖析

Dopamine 连续控制域实验运行器 ContinuousRunner 完全指南:JAX/Flax Agent 的训练调度、参数配置与源码剖析

机器学习深度学习 【免费下载链接】dopamine Dopamine is a research framework for fast prototyping of reinforcement learning algorithms. 项目地址: https://gitcode.com/gh_mirrors/do/dopamine 点击查看 免费下载 导读 dopamine.continuous_domains.run_…

2026/9/23 20:25:44 阅读更多 →

日新闻

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A…

2026/9/23 0:00:23 阅读更多 →
2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我 刚把开发环境的显示器从1080P换到2K,跑老项目直接报错,版本升级后 API…

2026/9/23 0:01:25 阅读更多 →
3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点 官方文档翻了三遍还是云里雾里?别急,美眉图在实战项目中常被用来做数据可视化,但它的原理比你想的简单。今天咱们直接上手,用一个完整的小项目把美眉图跑通,不再死磕那些冗长的理论说明。…

2026/9/23 0:01:25 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →