AI Agent的检索税:多跳搜索为何让token成本暴增4倍
Andrej Karpathy曾把大模型比作患有“顺行性遗忘症”的同事——它保留旧记忆却无法形成新记忆。对Agent来说这种遗忘体现在两个层面跨对话不记得用户以及训练截止后发生的一切它一无所知。Memory机制能缓解第一种遗忘而第二种遗忘的修复主要靠实时Web检索。市场波动、人员变动、价格更新、突发新闻……Agent要想处理当下问题检索质量几乎决定了整个系统的可用性。很多人给Agent接上搜索工具后就以为“它现在能看到互联网了”。实际跑几轮trace后却发现绝大多数token都花在了处理原始网页文本上只有极小一部分用于真正回答问题。每次搜索循环都在支付“检索税”问题不在Agent搜索能力差而在于标准搜索API返回的格式。典型搜索调用只返回链接 30字左右的snippet。Agent拿到后必须自己抓取完整页面、剥离HTML、提取正文才能开始真正工作。单次查询时这个开销还不明显。但在需要多次搜索的研究型任务或简报生成 pipeline 中每一跳都要重复支付这笔“检索税”——抓取、清洗、塞进上下文。我们把同一个问题用三种检索方式跑通并统计token消耗。问题选了“What was Y2K?”因为模型训练时已经知道答案这样能把思考成本控制一致额外token几乎全部来自检索过程。纯记忆回答约600 tokens基准预建索引提前爬取并清洗好的owned index约6,900 tokens标准Web搜索单跳约3,750 tokens标准Web搜索三跳循环约28,700 tokens是预建索引的4倍以上三跳循环的成本之所以暴增是因为每一跳都要把之前已经读过的页面内容重新塞进不断增长的上下文窗口。Agent其实在为“已经知道的内容”重复付费。预建索引则完全跳过了这个过程完整文档在查询到达前就已经准备好一次调用直接返回可用内容。好的检索应该返回文档而不是方向检索税的根源在于返回格式。SERP标准搜索结果页只给URL列表让Agent自己去读网页。普通抓取工具返回原始HTML或MarkdownAgent仍需清洗。预建owned index提前完成所有清洗和结构化一次调用返回可直接推理的完整文档。同一个查询在三种方式下的体验差异极大。以搜索“Christoph Molnar”《Interpretable Machine Learning》作者为例SERP返回一堆标签页Agent几乎得不到答案。神经搜索能定位到人但只返回高亮片段仍需额外调用拿完整记录。预建索引一次返回完整结构化记录Agent直接进入推理阶段。像Seltz这类为Agent设计的索引会提前把网页处理成结构化文档并提供不同scopePeople scope返回完整职业档案角色、时间、公司、教育等News scope返回日期窗口内的完整文章正文Wiki scope返回干净的维基百科文档这些都不是简单替换开放搜索而是针对“需要深度内容”的查询场景。有些答案只存在于记录的交叉中全文档检索带来的不止是成本降低还解锁了snippet无法回答的问题类型。考虑一个GTM团队真实会问的问题“过去一个季度里哪些目标账户新聘用了数据或AI领导角色”回答需要同时满足两个条件完整角色历史判断何时入职 近期新闻确认触发事件。snippet或单次搜索做不到跨记录join。正确做法是先用People scope找出近期入职相关角色的人再用News scope交叉验证触发事件最终输出带上下文的warm account列表并附上可用于首封邮件的个性化切入点。这种答案在网上不存在单一页面它只存在于多条记录的交集里。而只有持有完整记录时join才可能发生。发现与深度检索的合理链式使用开放Web搜索适合发现类问题谁当前担任某个职位、上周刚发布的新闻、今天刚上线的页面。一旦知道要找什么owned index就能一跳返回完整记录而不是标题链接。很多pipeline对所有查询都用同一种搜索工具结果发现类和深度类查询都支付了不必要的检索税。把两者链起来使用发现阶段用开放搜索深度阶段切换到预建索引每一轮迭代的成本都会显著下降。这才是Agent循环成本的真正杠杆点——不是模型本身而是每次搜索调用返回的内容形态。当你构建的研究型、简报型或需要跨记录推理的Agent循环时检索返回“完整文档”而非“指向文档的指针”是目前降低token消耗最直接有效的手段。在你当前构建的Agent循环里研究或信息收集类任务占多大比例你是否已经测量过多跳检索带来的实际token开销本文基于Akshay Pachaar的技术分享重构致敬他对Agent检索效率的系统性拆解。我是紫微AI在做一个「人格操作系统ZPF」。后面会持续分享AI Agent和系统实验。感兴趣可以关注我们下期见。

相关新闻

【AI搜索SEO关键词研究终极指南】:2024年谷歌BERT+Ranking AI时代下,3步锁定高转化长尾词的实战方法论

【AI搜索SEO关键词研究终极指南】:2024年谷歌BERT+Ranking AI时代下,3步锁定高转化长尾词的实战方法论

更多请点击: https://codechina.net 第一章:AI搜索SEO关键词研究的范式迁移与本质重构 传统关键词研究依赖人工词频统计、竞争度估算与搜索量预测,其底层逻辑建立在“用户输入即意图”的静态假设之上。而AI搜索(如Perplexity、Mi…

2026/7/23 3:10:53 阅读更多 →
AI重金投入后,企业PL为何依然沉默

AI重金投入后,企业PL为何依然沉默

在过去一年里,与数百位成功企业的CEO交流后,一个反复出现的情景是:他们支付顶级模型费用、组建AI团队、启动多个试点、组织全员培训,却在私下里问同一个问题——“我们这样投入AI,到底对不对?” 当被追问利…

2026/7/23 4:21:14 阅读更多 →
C++通讯录管理系统:从面向对象设计到文件持久化的完整实践

C++通讯录管理系统:从面向对象设计到文件持久化的完整实践

1. 项目概述与核心价值最近在整理一些老项目,翻到了当年用C手搓的第一个像模像样的“大作业”——通讯录管理系统。这几乎是每个C初学者在掌握基础语法和面向对象思想后,第一个会想到去实践的练手项目。它不像“Hello World”那样简单,也不像…

2026/7/23 2:13:38 阅读更多 →

最新新闻

如何让文心一言写出“不像AI”的文章?——20年编辑总监压箱底的4层语义注入法(含未公开训练语料逻辑)

如何让文心一言写出“不像AI”的文章?——20年编辑总监压箱底的4层语义注入法(含未公开训练语料逻辑)

更多请点击: https://codechina.net 第一章:文心一言写作的“类人化”本质认知 文心一言的写作能力并非简单地匹配词频或堆砌模板,其核心在于对人类语言生成机制的深度模拟——它通过大规模语义理解、上下文因果建模与风格一致性约束&#x…

2026/7/23 16:25:51 阅读更多 →
WebGL与WebGPU实战案例合集:43期完整技术栈解析

WebGL与WebGPU实战案例合集:43期完整技术栈解析

这次我们来看一个WebGL/WebGPU案例合集项目,这个资源对于前端图形开发者来说是个宝藏库。WebGL和WebGPU作为现代浏览器中的图形API,已经成为3D可视化、游戏、数据展示等领域的核心技术。这个案例合集收录了43期实战示例,覆盖从基础渲染到高级…

2026/7/23 16:25:51 阅读更多 →
CDN共建机房的技术内幕与商业陷阱解析

CDN共建机房的技术内幕与商业陷阱解析

1. CDN共建机房的商业本质 CDN共建机房这个概念最早出现在2015年前后,当时国内云计算市场正处于爆发期。所谓"共建",通常是指CDN服务商与地方IDC运营商合作,由IDC提供机房场地和基础网络,CDN厂商提供服务器设备和软件技…

2026/7/23 16:25:51 阅读更多 →
CentOS 7下KVM虚拟化平台搭建与优化指南

CentOS 7下KVM虚拟化平台搭建与优化指南

1. CentOS 7环境下KVM虚拟化平台搭建全指南在物理服务器资源利用率普遍不足30%的现状下,KVM作为Linux内核原生支持的虚拟化解决方案,凭借其接近原生性能的表现和开源特性,已成为企业级虚拟化部署的主流选择。本指南将基于CentOS 7系统&#x…

2026/7/23 16:25:51 阅读更多 →
胃圈2026实干家走进米粉阵,共探新疆特色餐饮连锁发展之路

胃圈2026实干家走进米粉阵,共探新疆特色餐饮连锁发展之路

7月20日至23日,“胃圈2026实干家——探秘西域餐饮标杆深度研学之旅”新疆站正式启程。来自全国各地的餐饮品牌创始人、经营者及行业伙伴走进新疆非遗米粉连锁标杆——米粉阵,通过实地参访、主题分享、产品体验和交流研讨,共同探索特色餐饮的产…

2026/7/23 16:25:51 阅读更多 →
宝鸡收表老炮儿掏心窝子:战斧进过水修过机芯到底还能卖多少钱?别被中介忽悠了

宝鸡收表老炮儿掏心窝子:战斧进过水修过机芯到底还能卖多少钱?别被中介忽悠了

宝鸡收表老炮儿掏心窝子:战斧进过水修过机芯到底还能卖多少钱?别被中介忽悠了

2026/7/23 16:24:51 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻