Claude Tool Search 深度拆解:延迟加载、工具引用和与 Codex 对比
Claude Tool Search 解决的不是一个小开关问题而是 Agent 工具规模化后的上下文管理问题。导语Agent 接的工具越多能力看起来越强。但过了某个点工具本身会变成噪音。一个 coding agent 同时接 GitHub、Slack、Jira、Sentry、Grafana、PagerDuty再加几个内部 MCP server很容易暴露上百个工具。传统做法是启动会话时把所有工具 schema 全塞进上下文。这当然直接但代价也很硬工具描述吃掉大量 token。工具越多模型越容易选错。每一轮对话都背着一堆没用到的 schema 走。Tool Search 要解决的就是这个问题。它不是让 Agent 变聪明的魔法而是把工具组织方式从“全量塞进上下文”改成“先建索引再按需加载”。图工具上下文从全量堆叠变成可检索目录Upfront Loading 的问题工具列表会挤占思考空间没有 Tool Search 时工具调用的机制很朴素请求里带上所有工具定义模型在上下文里直接看到它们。工具少时没问题。十几个工具以内模型通常还能稳定选择。到了几十个甚至上百个工具schema 本身就会变成负担。{ tools: [ { name: get_weather, description: Get current weather for a location, input_schema: { type: object, properties: { location: { type: string } } } }, { name: search_github_issues, description: Search GitHub issues by keyword and repository, input_schema: { ...: ... } } ] }这类 upfront loading 有两个隐藏成本。第一是 token 成本。工具定义越详细消耗越明显。第二是选择成本。模型在一堆相似工具之间做决策错误率会上升。很多 MCP server 的工具名还很接近例如 list、get、search、create、update 一组一组出现语义差异全靠 description 解释。所以问题不是“模型不知道怎么调用工具”而是它一开始看到的工具太多。API 层机制defer_loading只是入口Tool Search 的第一步是给工具加defer_loading: true。{ name: search_github_issues, description: Search GitHub issues by keyword and repository, input_schema: { ...: ... }, defer_loading: true }这个字段经常被误解。它不是说客户端不用发送完整工具定义。相反请求里的tools数组仍然要包含完整定义因为 API 后面需要用它展开引用。defer_loading控制的是另一件事这个工具的完整 schema 是否进入模型初始可见的工具上下文。也就是说状态客户端请求里有没有完整定义模型初始上下文里有没有完整 schema普通工具有有defer 工具有没有搜索命中后有被展开注入这个设计保留了协议完整性也避免模型一开始被大量工具淹没。搜索链路从server_tool_use到tool_reference当 Claude 判断当前任务需要某个延迟加载的工具时它不会直接发普通tool_use。它会先发起一次服务端工具搜索也就是server_tool_use。{ type: server_tool_use, id: srvtoolu_01ABC123, name: tool_search_tool_regex, input: { pattern: weather } }这不是客户端自己的 MCP tool也不应该由客户端返回普通tool_result。它是 Anthropic API 侧的 server-side tool。搜索完成后响应里会出现tool_search_tool_result里面放的是tool_reference{ type: tool_search_tool_result, tool_use_id: srvtoolu_01ABC123, content: { type: tool_search_tool_search_result, tool_references: [ { type: tool_reference, tool_name: get_weather } ] } }注意这里返回的不是完整 schema而是指针。API 会拿这个指针去请求里的tools数组里找同名定义然后自动展开。展开之后Claude 才能发正式的普通tool_use。完整流程可以概括为图Tool Search 先返回工具引用再展开完整 schema 发起正式调用这套链路的关键是工具 schema 仍然存在但不再默认占据模型注意力。图延迟加载的关键不是丢掉 schema而是把 schema 放到需要时再展开Claude Code 层ENABLE_TOOL_SEARCH控制策略API 层提供机制Claude Code 决定什么时候用。实际使用中最常见的控制入口是ENABLE_TOOL_SEARCH值行为未设置官方 endpoint 上默认启用代理或部分平台可能回退为 upfronttrue强制启用 Tool Searchfalse禁用所有工具 upfront 加载auto工具定义超过上下文窗口一定比例时启用auto:N自定义阈值例如auto:5工具少时禁用 Tool Search 可能更快因为少了一轮搜索。工具多时延迟加载更有价值。还有一个容易被忽略的配置是alwaysLoad。它允许某个 MCP server 的工具始终 upfront 加载{ mcpServers: { essential-tools: { type: stdio, command: npx, args: [-y, org/essential-mcp], alwaysLoad: true } } }这个配置适合少量高频工具。用多了就会把 Tool Search 的收益抵消掉。代理兼容性协议化能力的代价Claude 的方案很协议化。server_tool_use、tool_reference、tool_search_tool_result都是特殊 block。好处是行为清晰API 可以统一展开引用。坏处也明显中间代理必须认识这些 block。如果ANTHROPIC_BASE_URL指向 one-api、LiteLLM 或公司内部网关而代理只支持text、tool_use、tool_result这些常见类型就可能出现unknown content block type代理把未知 block 丢掉转 OpenAI 格式时无法表达下一轮上下文断裂这也是很多配置工具提供“启用 Tool Search”开关的原因。它本质上是在“更省上下文”和“更兼容代理”之间做选择。工具描述怎么写决定能不能被搜到Tool Search 让工具变成索引但索引质量取决于工具名和描述。模糊描述很危险{ name: mcp__github__tool1, description: Does GitHub stuff }这类工具很难在 issue、PR、workflow、release 等具体任务里被正确召回。更好的描述要包含领域、动作、触发场景和关键参数{ name: mcp__github__create_issue, description: Create a new issue in a GitHub repository. Use this when the user wants to report a bug, request a feature, or track a task. Requires owner, repo, title, and optional body, labels, assignees. }写工具描述时可以抓住五点工具名带领域和动作例如github_create_issue。description 说明触发场景而不只是动作。input_schema 的字段也写清楚含义。一个工具只做一件事避免万能工具。高频工具少量alwaysLoad长尾工具交给搜索。未来工具描述会越来越像搜索文档。写得越具体Agent 越容易在正确任务里找到它。Codex 也在走同一条路Tool Search 不是 Claude 独有方向。OpenAI Codex CLI 和 OpenAI Agents SDK 也在解决同一个问题工具 schema 太多不能全部塞进上下文。差别在实现层级。维度Claude Tool SearchOpenAI Codex / Agents SDK延迟加载字段defer_loading: truedefer_loading: true搜索能力tool_search_tool_regex/tool_search_tool_bm25tool_search/ToolSearchTool()实现位置Messages API 协议层Responses API / SDK / CLI 层特殊结构server_tool_use、tool_reference、tool_search_tool_result主要沿 function calling 体系组织方式MCP server alwaysLoadtool_namespaceClaude 把能力下沉到 API block。只要客户端和代理支持这些 block不同客户端可以获得较一致的行为。OpenAI 更像框架层能力。它对现有 function calling 基础设施侵入更小但一致性更多依赖 SDK 和运行时实现。所以正确结论不是“Claude 有OpenAI 没有”而是当工具数量超过上下文舒适承载范围时延迟加载加运行时搜索正在成为共识。更大的趋势能力不该全塞进上下文Tool Search 只是工具层的一个实现。往上看skills、agents、memory 也会遇到同样的问题。当一个 Agent 拥有几十个 skills每个 skill 都有 system prompt、examples、专属工具和约束时全部 upfront 加载同样会把上下文挤满。更合理的架构是用户需求 - 意图识别 / 搜索 - 加载相关能力 - 执行任务工具层叫 Tool Search技能层可能叫 progressive skill loading记忆层可能叫 memory retrieval。本质都是同一句话能力规模超过上下文容量后能力必须被组织成索引而不是全部放进模型短期记忆里。结语Tool Search 的核心价值不是省几个 token也不是多一个环境变量。它把 Agent 的工具上下文从仓库模式改成索引模式。仓库模式要求模型一开始看见所有工具索引模式允许模型先理解任务再按需找到工具。MCP 生态越膨胀这个差异越关键。未来写工具的人不只是写函数接口也是在写可被 Agent 搜到、选对、调用稳的能力说明。这会成为 Agent 工程里很基础的一门手艺。推荐阅读Agent 评测别把「调优 Loop」 跑成「刷题 Loop」代码不是 AI 编程的最终资产AI Coding 真正该存的是 Checkpoint长程 Agent 的三类硬约束企业 Agent 为什么难落地组织、数据和流程才是真卡点Agent Memory 架构拆解别再把向量库当唯一记忆系统

相关新闻

嵌入式RTC日历模式实战:从寄存器配置到低功耗驱动开发

嵌入式RTC日历模式实战:从寄存器配置到低功耗驱动开发

1. 项目概述:从芯片手册到可运行的代码 在嵌入式开发中,实时时钟(RTC)模块是构建任何需要时间戳、定时唤醒或日历功能系统的基石。它远不止是一个简单的“计时器”,而是一个由精密硬件逻辑构成的独立时间引擎。很多开发…

2026/9/23 16:25:20 阅读更多 →
卷积扰动认证训练:原理、实现与鲁棒性保障

卷积扰动认证训练:原理、实现与鲁棒性保障

1. 先搞清楚“卷积扰动认证训练”到底解决什么问题 如果你在机器学习安全或鲁棒性优化领域工作,大概率遇到过这种场景:模型在干净数据上表现很好,但遇到稍微改动过的输入——比如加了点噪声、平移了几个像素、或者做了个模糊处理——性能就大…

2026/9/24 14:04:21 阅读更多 →
ECS架构与Boids算法结合:30行代码实现高性能千鱼群游模拟

ECS架构与Boids算法结合:30行代码实现高性能千鱼群游模拟

1. 项目概述:从“千鱼群游”到ECS架构的必然选择几年前,当我第一次尝试在屏幕上模拟鱼群时,面对几百条鱼就开始卡顿的场景还历历在目。传统的面向对象(OOP)写法,每条鱼都是一个独立的GameObject&#xff0c…

2026/9/23 16:37:30 阅读更多 →

最新新闻

mformat实战指南:U盘启动盘损坏与无法访问的底层修复方案

mformat实战指南:U盘启动盘损坏与无法访问的底层修复方案

如果你的U盘做启动盘做到一半断电、被UltraISO写入镜像后插进电脑提示“需要格式化”、或者在Windows下面明明看得到盘符和容量却死活打不开……这篇文章就是干这个用的。mformat是Linux下mtools工具集里的底层格式化命令,它可以在系统已经“放弃”这个U盘的时候&am…

2026/9/24 21:36:34 阅读更多 →
Linux下用mformat修复U盘?重建FAT文件系统实战指南

Linux下用mformat修复U盘?重建FAT文件系统实战指南

插上U盘,系统弹出一句“使用驱动器D:中的光盘之前需要将其格式化”,这大概是Windows用户最不想看到的提示之一。文件明明之前还在里面,突然就打不开、读不出,连正常的右键格式化都可能走到一半就报错。在Linux环境下,这…

2026/9/24 21:36:34 阅读更多 →
构建稳定的AI代码安全审计Skill:从规则库到Agent实践

构建稳定的AI代码安全审计Skill:从规则库到Agent实践

前阵子有朋友问我:你那个 security-audit-skill 到底怎么写的?为什么我自己折腾了一个,让 AI 做代码安全审计,结果不是漏报就是误报,最后还得人工全部重看一遍?这个问题其实问到点子上了。我自己也经历过这…

2026/9/24 21:36:34 阅读更多 →
Qwen Coder Mac本地部署实战:从模型选型到IDE集成

Qwen Coder Mac本地部署实战:从模型选型到IDE集成

1. “coder”这个词,现在到底指什么如果你在技术社区里待得够久,会发现“coder”这个词最近变得有点微妙。以前它就是个简称,泛指写代码的人,跟 programmer、developer 基本可以互换。大家说“我是个 coder”,意思是“…

2026/9/24 21:36:33 阅读更多 →
独立游戏开发全流程:从验证到运营的实战避坑指南

独立游戏开发全流程:从验证到运营的实战避坑指南

1. 独立游戏不是“做个小游戏”,而是跑通一个完整商业闭环很多人看到“独立游戏开发流程指南”这个标题,第一反应是:“哦,教怎么用Unity拖几个按钮、写几行C#脚本、导出个exe就完事了?”——这恰恰是90%想入行的人踩进…

2026/9/24 21:36:33 阅读更多 →
虚拟电厂广域聚合为何必须用Zonotope建模

虚拟电厂广域聚合为何必须用Zonotope建模

简介:本资源是一份面向电力系统研究人员与Python开发者的技术实践资料,聚焦虚拟电厂(VPP)中空调负荷、储能设备和柴油发电机三类分布式资源的广域聚合与鲁棒调控问题,采用前沿的Zonotope(奇诺多面体&#x…

2026/9/24 21:35:33 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →