AI Agent的检索税:多跳搜索为何让token成本暴增4倍
Andrej Karpathy曾把大模型比作患有“顺行性遗忘症”的同事——它保留旧记忆却无法形成新记忆。对Agent来说这种遗忘体现在两个层面跨对话不记得用户以及训练截止后发生的一切它一无所知。Memory机制能缓解第一种遗忘而第二种遗忘的修复主要靠实时Web检索。市场波动、人员变动、价格更新、突发新闻……Agent要想处理当下问题检索质量几乎决定了整个系统的可用性。很多人给Agent接上搜索工具后就以为“它现在能看到互联网了”。实际跑几轮trace后却发现绝大多数token都花在了处理原始网页文本上只有极小一部分用于真正回答问题。每次搜索循环都在支付“检索税”问题不在Agent搜索能力差而在于标准搜索API返回的格式。典型搜索调用只返回链接 30字左右的snippet。Agent拿到后必须自己抓取完整页面、剥离HTML、提取正文才能开始真正工作。单次查询时这个开销还不明显。但在需要多次搜索的研究型任务或简报生成 pipeline 中每一跳都要重复支付这笔“检索税”——抓取、清洗、塞进上下文。我们把同一个问题用三种检索方式跑通并统计token消耗。问题选了“What was Y2K?”因为模型训练时已经知道答案这样能把思考成本控制一致额外token几乎全部来自检索过程。纯记忆回答约600 tokens基准预建索引提前爬取并清洗好的owned index约6,900 tokens标准Web搜索单跳约3,750 tokens标准Web搜索三跳循环约28,700 tokens是预建索引的4倍以上三跳循环的成本之所以暴增是因为每一跳都要把之前已经读过的页面内容重新塞进不断增长的上下文窗口。Agent其实在为“已经知道的内容”重复付费。预建索引则完全跳过了这个过程完整文档在查询到达前就已经准备好一次调用直接返回可用内容。好的检索应该返回文档而不是方向检索税的根源在于返回格式。SERP标准搜索结果页只给URL列表让Agent自己去读网页。普通抓取工具返回原始HTML或MarkdownAgent仍需清洗。预建owned index提前完成所有清洗和结构化一次调用返回可直接推理的完整文档。同一个查询在三种方式下的体验差异极大。以搜索“Christoph Molnar”《Interpretable Machine Learning》作者为例SERP返回一堆标签页Agent几乎得不到答案。神经搜索能定位到人但只返回高亮片段仍需额外调用拿完整记录。预建索引一次返回完整结构化记录Agent直接进入推理阶段。像Seltz这类为Agent设计的索引会提前把网页处理成结构化文档并提供不同scopePeople scope返回完整职业档案角色、时间、公司、教育等News scope返回日期窗口内的完整文章正文Wiki scope返回干净的维基百科文档这些都不是简单替换开放搜索而是针对“需要深度内容”的查询场景。有些答案只存在于记录的交叉中全文档检索带来的不止是成本降低还解锁了snippet无法回答的问题类型。考虑一个GTM团队真实会问的问题“过去一个季度里哪些目标账户新聘用了数据或AI领导角色”回答需要同时满足两个条件完整角色历史判断何时入职 近期新闻确认触发事件。snippet或单次搜索做不到跨记录join。正确做法是先用People scope找出近期入职相关角色的人再用News scope交叉验证触发事件最终输出带上下文的warm account列表并附上可用于首封邮件的个性化切入点。这种答案在网上不存在单一页面它只存在于多条记录的交集里。而只有持有完整记录时join才可能发生。发现与深度检索的合理链式使用开放Web搜索适合发现类问题谁当前担任某个职位、上周刚发布的新闻、今天刚上线的页面。一旦知道要找什么owned index就能一跳返回完整记录而不是标题链接。很多pipeline对所有查询都用同一种搜索工具结果发现类和深度类查询都支付了不必要的检索税。把两者链起来使用发现阶段用开放搜索深度阶段切换到预建索引每一轮迭代的成本都会显著下降。这才是Agent循环成本的真正杠杆点——不是模型本身而是每次搜索调用返回的内容形态。当你构建的研究型、简报型或需要跨记录推理的Agent循环时检索返回“完整文档”而非“指向文档的指针”是目前降低token消耗最直接有效的手段。在你当前构建的Agent循环里研究或信息收集类任务占多大比例你是否已经测量过多跳检索带来的实际token开销本文基于Akshay Pachaar的技术分享重构致敬他对Agent检索效率的系统性拆解。我是紫微AI在做一个「人格操作系统ZPF」。后面会持续分享AI Agent和系统实验。感兴趣可以关注我们下期见。

相关新闻

【AI搜索SEO关键词研究终极指南】:2024年谷歌BERT+Ranking AI时代下,3步锁定高转化长尾词的实战方法论

【AI搜索SEO关键词研究终极指南】:2024年谷歌BERT+Ranking AI时代下,3步锁定高转化长尾词的实战方法论

更多请点击: https://codechina.net 第一章:AI搜索SEO关键词研究的范式迁移与本质重构 传统关键词研究依赖人工词频统计、竞争度估算与搜索量预测,其底层逻辑建立在“用户输入即意图”的静态假设之上。而AI搜索(如Perplexity、Mi…

2026/8/26 13:32:35 阅读更多 →
AI重金投入后,企业PL为何依然沉默

AI重金投入后,企业PL为何依然沉默

在过去一年里,与数百位成功企业的CEO交流后,一个反复出现的情景是:他们支付顶级模型费用、组建AI团队、启动多个试点、组织全员培训,却在私下里问同一个问题——“我们这样投入AI,到底对不对?” 当被追问利…

2026/8/25 8:54:34 阅读更多 →
C++通讯录管理系统:从面向对象设计到文件持久化的完整实践

C++通讯录管理系统:从面向对象设计到文件持久化的完整实践

1. 项目概述与核心价值最近在整理一些老项目,翻到了当年用C手搓的第一个像模像样的“大作业”——通讯录管理系统。这几乎是每个C初学者在掌握基础语法和面向对象思想后,第一个会想到去实践的练手项目。它不像“Hello World”那样简单,也不像…

2026/8/23 22:01:30 阅读更多 →

最新新闻

Python+Demucs实战:仅凭贝斯声轨识别BEYOND歌曲

Python+Demucs实战:仅凭贝斯声轨识别BEYOND歌曲

之前在整理音频素材时,我冒出一个有点挑战性的想法:把BEYOND的经典歌曲做一次“去人声、去吉他、去鼓”,只保留贝斯轨,然后不看任何提示,只听贝斯声音猜歌。结果发现,这个玩法比想象中难,也比想…

2026/8/26 13:31:55 阅读更多 →
Mysql学习(一)-- 索引

Mysql学习(一)-- 索引

1.索引概述: 索引是一种特殊的文件(InnoDB数据表上的索引是表空间的一个组成部分),它们包含着对数据表里所有记录的引用指针。 索引是一种数据结构。数据库索引,是数据库管理系统中一个排序的数据结构,以协助快速查询、更新数据…

2026/8/26 13:31:55 阅读更多 →
Mysql学习(二)-- 事务和锁

Mysql学习(二)-- 事务和锁

1. 事务: 1.1 什么是数据库事务? 事务是一个不可分割的数据库操作序列,也是数据库并发控制的基本单位,其执行的结果必须使数据库从一种一致性状态变到另一种一致性状态。事务是逻辑上的一组操作,要么都执行&#xff0c…

2026/8/26 13:31:55 阅读更多 →
XPath路径解析器实战:从基础语法到安全防护

XPath路径解析器实战:从基础语法到安全防护

提到 XPath,很多人的第一反应是“它不就是爬虫里用来提取数据的一种语法吗?”这个印象不算错,但会低估它。真正写爬虫的人会知道,解析 HTML 远比发送请求更影响开发效率:层级嵌套深、标签结构乱、class 名频繁变动、文…

2026/8/26 13:31:55 阅读更多 →
贝斯轨猜歌实验:音频分离技术如何改变听歌方式

贝斯轨猜歌实验:音频分离技术如何改变听歌方式

前阵子我把 BEYOND 的几首歌拆成了分轨,随手点开一条只有贝斯的声音,让一个自称老歌迷的朋友猜歌名。第一首放了《海阔天空》,他听完前二十秒,皱眉说:“这谁啊?”我觉得不太可能,切回原曲一对比…

2026/8/26 13:31:55 阅读更多 →
Beyond Compare 图片对比、文件合并与目录同步实践指南

Beyond Compare 图片对比、文件合并与目录同步实践指南

Beyond Compare 最值得聊的不是它能把两张图片放到一起对比,而是它能同时承担文件比较、文件夹对比、内容合并、目录同步这几件事。很多人在网上搜索“什么软件能把两张图片放到一起对比”,多半是为了快速看两张图哪里不一样;真正用起来之后就…

2026/8/26 13:30:54 阅读更多 →

日新闻

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 0:00:40 阅读更多 →
《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》索引目录: 《Microsoft Sql server 2008 Internals》读书笔记--目录索引 在上篇文章中,主要介绍了创建数据库的基本语法和FileGroup的初步知识。需要注意的是: 关于FileGroup 如果你的系统是用Raid设备直接存…

2026/8/26 1:18:18 阅读更多 →
政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体已经从概念试点阶段,转入了政务服务的常态化落地应用;在实际使用过程中,它能自主理解办事需求、辅助完成填报申报、开展材料预审,并联动多个系统协同作业,真正嵌入到政务办理的全流程当中。但在落地推进过…

2026/8/26 1:18:18 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 3:38:12 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 3:38:18 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/25 3:38:23 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/26 3:50:20 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/25 10:31:12 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/26 1:24:05 阅读更多 →