微软开源FastContext:4B 小模型专管找代码,Coding Agent Token 直降60%、修复率升5.5%
一句话讲清楚微软提出 FastContext 把仓库探索从主 Agent 解耦为按需调用的 4B–30B 专用 subagent 并行搜索后只返回文件路径与行号接入 Mini-SWE-Agent 后端到端修复率最高提升 5.5%主模型 Token 消耗最高减少 60%。论文标题FastContext: Training Efficient Repository Explorer for Coding Agents论文链接https://arxiv.org/abs/2606.14066Github 链接https://github.com/microsoft/fastcontext46% 的 Token 花在「找代码」上Claude Code 、 Codex 、 Cursor 这类 Coding Agent 已经能修 Bug 、答仓库级问题但有一个隐性成本长期被低估在动手改代码之前 Agent 要花大量 Token 在仓库里「迷路」。微软与上海交通大学联合团队对 GPT-5.4-high 在 SWE-bench Multilingual 上的 300 条完整轨迹做了拆解数字相当刺眼■读取 Read 搜索 Search 合计占全部 tool-use 轮次的56.2%平均 9.96 / 17.72 轮■两类操作消耗主 Agent 总 Token 的46.5%■在 284 条可识别首次编辑的轨迹中 Agent 平均要到第8.47 轮才开始改代码■即便开启并行 tool call 中位轨迹在首次编辑前仍需6 轮顺序探索、15.5 次探索性 tool callGPT-5.4-high Mini-SWE-Agent 轨迹分析读取与搜索主导 tool 轮次与 Token 消耗首次编辑前存在大量顺序探索轮次。更麻烦的是探索与解题共用同一个主模型。每次grep、每次读文件的内容都会堆进 solver 的对话历史。搜偏了、读多了后面几轮都在噪声 context 里纠偏 Token 账单和失败率一起涨。这和 SWE-Pruner 等近期工作的观察一致 Coding Agent 的 context 膨胀很大一部分来自 read/search 阶段。 FastContext 的思路很直接——把「找代码」拆出去交给一个便宜、专训的小模型干。FastContext 是什么FastContext 是一个按需调用的仓库探索 subagent与主 Agent main agent 职责分离角色职责Main Agent理解 issue 、复现、编辑、测试、提交 patchFastContext只负责在仓库里搜索返回精简的「文件路径 行号范围」主 Agent 通过命令行调用fastcontext -q “find S3 certificate download logic” --format conciseFastContext 在独立对话里完成多轮探索只把最终证据块回传给主 Agent——中间的 tool 观测、推理过程不会污染主 Agent 的 context 。FastContext 整体架构主 Agent 委托探索任务 FastContext 并行调用工具后返回 file-line 证据。三个只读工具语言无关FastContext 刻意保持极简只暴露三个与编程语言无关的只读工具■Read带行号的文件内容读取支持 offset/limit■Glob路径模式匹配如**/*.py■Grep基于 ripgrep 的正则搜索每一轮探索模型要么并行发出多个 tool call 要么停止并输出最终证据。同一轮内的多个 tool call并行执行可以同时覆盖路径模式、符号名、入口点等不同假设。输出契约final_answer块FastContext 的输出格式被严格约束典型示例如下final_answer/src/router.py:42-58 (Router definition)/tests/test_router.py:101-119/final_answer主 Agent 拿到的是可直接消费的「定位摘要」而非一长串探索日志。这种非对称接口的设计很关键 explorer 在外面广搜 solver 里面窄读。怎么训练一个「找代码专家」FastContext 背后是一组4B–30B 参数的专用探索模型基于 Qwen3-4B-Instruct 与 Qwen3-Coder-30B 训练分两阶段SFT 初始化行为 → RL 对齐任务目标。阶段一 SFT 从 Sonnet 4.6 轨迹蒸馏团队从 Sonnet 4.6 的探索轨迹中筛选出2,954 条SFT 样本按运行时行为拆成三类数据源数量训练目标parallel_toolcalls990首轮广搜并行发出互补的 tool callmultiturn_traj983多轮证据收集完整轨迹含 tool 观测linerange981精确引用只输出final_answer行号块SFT 目标函数只对 assistant token 计算 loss 同时覆盖普通文本与结构化 tool call 参数其中 掩码非 assistant token 为可见对话前缀 为参考 assistant 续写。SFT 训练 loss 曲线策略初始化阶段 loss 稳步下降。阶段二 RL 用 patch 位置当奖励信号SFT 模仿 teacher 轨迹并不直接优化「最终引用是否覆盖了解题所需代码」。因此第二阶段用400 条带 reference patch 的 prompt 做 task-grounded RL 1.从 reference patch 解析目标 file-line 范围作为 label2.模型以真实 FastContext subagent 身份 rollout 最多 8 轮 Read/Glob/Grep 交互3.用确定性 reward 打分 GRPO 优化Reward 由三部分组成■Task outcome预测引用与 patch 诱导目标的 file-level / line-level F1 之和路径归一化后■单轮并行 tool call 数在 3–6 之间给小 bonus 鼓励高效并行探索■惩罚空输出、过长引用、格式错误或 fan-out 过大RL 阶段 recall 提升明显说明模型学会了覆盖 patch 相关位置同时保持输出紧凑。RL reward 曲线 task-grounded refinement 阶段 reward 持续上升。实验三个 Benchmark 两种评估视角端到端接 Mini-SWE-Agent 看「能不能修好 花多少 Token 」三个 benchmark ■SWE-bench Multilingual 300 个多语言 issue 修复任务■SWE-bench Pro 200 个更难的长程任务固定子集■SWE-QA仓库级问答需定位并推理相关代码主 Agent 选用 GPT-5.4 、 GLM-5.1 、 Kimi-K2.6 对比三种设置直接解题、同模型探索 frontier 模型兼做 explorer 、 FastContext 训练模型 FC-30B-SFT / FC-4B-SFT / FC-4B-RL 。GPT-5.4 核心结果相对 w/o Explore 基线Benchmark最佳 SubagentScore 变化Token 变化SWE-bench MultilingualFC-30B-SFT71.7→75.0(3.3)457k→356k(-22.1%)SWE-bench ProGPT-5.4 同模型46.0→51.5(5.5)818k→703k (-14.1%)SWE-QAGPT-5.4 同模型81.3→81.4 (0.1)418k→166k(-60.3%)几个值得单独拎出来的点■SWE-bench Pro 涨幅最大 GPT-5.4 从 46.0 拉到 51.5 5.5 个百分点 GLM-5.1 配合 FC-4B-RL 从 17.5 到 22.5 同样是 5.0■SWE-QA Token 省得最狠 GPT-5.4 从 418k 降到 166k 60.3%的削减问答任务几乎不需要编辑探索阶段占 Token 大头 FastContext 的价值在这里最直观■4B-RL 经常打平或超过 30B-SFT GLM-5.1 FC-4B-RL 在 SWE-bench Pro 上 22.5 vs 30B-SFT 的 20.0 Token 还更少——task-grounded RL 让小模型探索器具备了实用竞争力Score vs Token 散点图 FastContext 将 Coding Agent 推向更高的 score–token 性价比。SWE-bench Multilingual 上 GPT-5.4 每实例 Token 分布各 FastContext 变体整体左移说明节省具有普遍性而非个别 outlier 拉动。Token 省在哪里 Sankey 图说清楚了论文用 Sankey 图按 action 类别拆解主 Agent Token 流向。接入 FC-4B-RL 后file reading 和 code search 两大块的占比显著收缩 FastContext 自身 invocation 开销只占很小一条。GPT-5.4 主 Agent Token 流向对比 FastContext 大幅削减读取与搜索消耗自身开销边际。独立探索质量 patch 位置能找多准在 SWE-bench Verified 上用 patch 衍生的 file/module/function 位置作 ground truth 评估 standalone 探索质量。FastContext 训练模型在 file/module 粒度上形成最强组■FC-30B-SFT file-level F173.71 module-level F160.35■最佳非 FastContext 基线 CodeScout-14B 68.57 / 50.88■FC-4B-RL 71.48 / 56.26 4B 体量已接近 frontier 模型探索器SFT 把 4B 基座 file-level F1 从 62.57 拉到 70.55 RL 再推到 71.48 增益主要来自recall 提升——与 reward 设计「覆盖 patch 相关位置」完全吻合。独立评估的 scoring 公式成本账 4B 本地部署主模型 API 费省 $69论文对 GPT-5.4 SWE-bench Multilingual 做了详细 cost audit 300 任务组件Token估算 API 成本直接主 Agent457k/任务$282.47主 Agent 4B-RL338k/任务$208.924B-RL explorer 合计22.58M$4.52*增强后总计–$213.44净节省–$69.034B explorer 按 Fireworks 4B–16B 档 $0.20/1M token 估算实际部署为**本地 serving*该 API 成本并不发生。300 个任务中主 Agent 共调用 4B-RL explorer162 次 explorer 成本仅占增强后总成本的2.1%。GPT-5.4 SWE-bench Multilingual 成本审计 4B explorer 开销极小主模型 API 费大幅下降。案例三个真实轨迹案例 1 基线失败 → FastContext 救场fastlane__fastlane-20975 S3 下载证书时报目录打开错误 Ruby 侧 sysopen 异常。■直接 GPT-5.4未解决■** FC-4B-RL**一次 FastContext 调用返回 3 个精准范围 S3 storage 、 importer 、 openssl 三个 Ruby 源文件主 Agent 快速定位 S3 目录 marker 问题并修复■Token 560.8k →302.8k read/search 命令 27 → 24案例 2 基线能过 FastContext 仍大幅省 Tokensharkdp__bat-2201短分页 flag 无法覆盖 config 中的--pagingalways。■两个系统最终都修好了■FastContext 返回 5 个 clap/config 相关范围主 Agent 更快到达 precedence 逻辑■Token 856.7k →230.4k-73% API 调用 30 → 17案例 3 证据太宽主 Agent 不信任gohugoio__hugo-12448 FastContext 返回的证据包含大量 hugoreleaser 路径跟 live reload 关系不大。主 Agent prompt 要求「 trust the listing 」但证据明显过宽于是它选择继续自行 grep 验证——read/search 从 83 次涨到 170 次 Token 反增。这个反例说明explorer 输出质量仍是瓶颈——引用过宽时主 Agent 会在自己的轨迹里重做探索 delegation 的 Token 优势会被抵消。与相关工作的位置FastContext 处在 Coding Agent 生态里一个越来越清晰的分层上下文选择 / 压缩方向 RepoCoder 、 LongCodeZip 、 CodeOCR 、 SWE-Pruner 等侧重检索、压缩已有 context 。结构化定位方向 AutoCodeRover 、 LocAgent 、 CoSIL 、 CGM 等用程序图/结构信息辅助定位。专用搜索 Agent 方向 CodeScout 、 SWE-grep 等训练 code-search agent 做快速 context 检索。FastContext 和 RepoCoder 、 CodeScout 等工作的最大差异在工程姿态它不改主 Agent 框架就是一个命令行 helper call 它就行。 SFT 数据、 RL reward 设计、评估协议全部公开——Claude Code 和 Codex 内部也有 subagent 但那是黑盒。 FastContext 把「仓库探索 subagent 怎么训、怎么评」这条链路完整开放了社区能跟着复现和改造这比论文里的数字更有持续价值。我的判断 Coding Agent 的下一个模块化接口读完这篇论文有个直观感受 46% Token 花在找代码上这个数字本身就很说明问题微软团队的切入点选得很准。下面是我更关心的几个工程问题1. 4B 探索器 frontier 解题器的组合有工程落地空间4B 模型本地 serving 成本极低 frontier 模型只在窄 context 里推理。论文数据已经证明主模型 Token 降 20%–60% API 账单可省 $69/300 任务量级。对于高频调用场景 CI 自动修 Bug 、批量 code review ROI 很可观。2. RL reward 设计是可复用的模板用 patch 衍生的 file-line 范围作 label 、 F1 并行 bonus 格式惩罚的组合不依赖人工标注直接对齐「给 solver 有用的证据」。这套 recipe 可以迁移到其他 context 选择任务如 test selection 、 dependency tracing 。3. 输出契约final_answer是关键工程细节强制 explorer 输出结构化引用而非自由文本让主 Agent prompt 可以写死「 trust the listing, read narrowly, don’t re-grep 」。 GPT-5.4 的 prompt 里甚至规定了B-A 80的行窗口上限和 parallel batch read 策略——context 管理从「希望模型自觉」变成「接口约束 prompt 规则」。4. 仍有明显短板■只在 Mini-SWE-Agent 上验证其他框架 OpenHands 、 SWE-agent 的集成待测■4B 是最小 explorer 1.7B/0.6B 能否保持质量未知■证据过宽时主 Agent 会「不信任 重搜」反例已出现■独立评估用 patch 位置作 proxy 可能低估 tests/callers/config 等辅助证据的价值局限与未来方向论文坦诚列出局限■端到端评估目前仅集成 Mini-SWE-Agent■主 Agent 实验聚焦 GPT-5.4 / GLM-5.1 / Kimi-K2.6 三档强模型 30B 级主模型组合待验证■最小 explorer 为 4B 更小模型 1.7B 、 0.6B 是下一步方向■公共 benchmark 可能与 frontier 模型预训练数据重叠结果应视为 controlled benchmark 证据伦理方面 FastContext 本身是只读探索 subagent 不直接改代码但增强探索能力可能间接强化自动修 Bug 的风险仍需配合 patch review 和测试执行。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

如何快速掌握SingleFile:从入门到精通的完整网页归档指南

如何快速掌握SingleFile:从入门到精通的完整网页归档指南

如何快速掌握SingleFile:从入门到精通的完整网页归档指南 【免费下载链接】SingleFile Web Extension for saving a faithful copy of a complete web page in a single HTML file 项目地址: https://gitcode.com/gh_mirrors/si/SingleFile SingleFile是一款…

2026/8/4 0:46:58 阅读更多 →
【YOLOv11模型改进系列】17 YOLOv11模型剪枝实战:用结构化剪枝+知识蒸馏把参数量砍掉一半

【YOLOv11模型改进系列】17 YOLOv11模型剪枝实战:用结构化剪枝+知识蒸馏把参数量砍掉一半

17 YOLOv11模型剪枝实战:用结构化剪枝+知识蒸馏把参数量砍掉一半 老伙计们,上周我们聊了RT部署,把模型跑到了3ms级。但有个做安防的哥们儿给我发了条消息:“模型在Jetson Nano上推理要120ms,帧率不到10,客户说要退货。” 我一看,他的模型参数有70M,边缘设备根本扛不住…

2026/8/4 0:45:58 阅读更多 →
黑客工具与漏洞原理,新手入门必学的核心技能清单

黑客工具与漏洞原理,新手入门必学的核心技能清单

从信息收集开始:构建你的安全视野 很多新手在接触网络安全时,容易陷入一个误区:急着去跑工具、挖漏洞,却忽略了最基础也最重要的第一步——信息收集。在真实的攻防对抗或渗透测试中,谁掌握的信息更全面、更准确&#x…

2026/8/4 0:42:57 阅读更多 →

最新新闻

网盘直链解析技术:重新思考云存储文件获取的本地化解决方案

网盘直链解析技术:重新思考云存储文件获取的本地化解决方案

网盘直链解析技术:重新思考云存储文件获取的本地化解决方案 【免费下载链接】Online-disk-direct-link-download-assistant 一个基于 JavaScript 的网盘文件下载地址获取工具。基于【网盘直链下载助手】修改 ,支持 百度网盘 / 阿里云盘 / 中国移动云盘 /…

2026/8/4 1:23:12 阅读更多 →
AI基础设施选型避坑指南:传统公有云 vs 自建智算中心 vs 出海一体化算力平台,到底该选哪个?

AI基础设施选型避坑指南:传统公有云 vs 自建智算中心 vs 出海一体化算力平台,到底该选哪个?

AI基础设施的选择,打个比方:传统公有云像租现成的写字楼,拎包入住但租金按小时算、还得按它的规矩来;自建智算中心像自己买地盖厂房,自主可控但投入以亿计、周期按年算;而出海一体化算力平台像提供"厂…

2026/8/4 1:23:12 阅读更多 →
CNN 、DNN、FCN 、GOTURN、 MobileNet、 SSD、 GoogleNet概念介绍

CNN 、DNN、FCN 、GOTURN、 MobileNet、 SSD、 GoogleNet概念介绍

概念前置梳理(必分清) DNN、CNN 是网络大类名称(概念),不是具体模型 FCN / GoogleNet / MobileNet / SSD / GOTURN 是具体 CNN 网络模型 cv::dnn 是 OpenCV推理模块(引擎),不属于网络模型层级从属:DNN深度神经网络 ⊃ CNN卷积神经网络 ⊃ FCN/GoogleNet/MobileNet/SSD…

2026/8/4 1:23:12 阅读更多 →
打破限制:Wand-Enhancer如何为你解锁完整的游戏修改体验

打破限制:Wand-Enhancer如何为你解锁完整的游戏修改体验

打破限制:Wand-Enhancer如何为你解锁完整的游戏修改体验 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer 厌倦了游戏修改工具Wand&#…

2026/8/4 1:23:12 阅读更多 →
量化分析实战:30DMA-15指标计算、Python实现与策略应用

量化分析实战:30DMA-15指标计算、Python实现与策略应用

最近在量化策略回测和指标分析时,经常遇到需要计算不同周期的移动平均线(MA)并进行交叉判断的场景。其中,30 DMA和30DMA-15这类指标组合,对于识别中期趋势的强弱转换和潜在买卖点非常关键。然而,很多资料对…

2026/8/4 1:23:12 阅读更多 →
Ros2 学习六:spin的作用

Ros2 学习六:spin的作用

你可以把 spin 的底层原理想象成一个“智能的、会休眠的调度中心”: 它进入一个无限循环,但每次循环都会先“闭上眼睛睡觉”(wait_for_work 阻塞等待)。只有当底层网络(DDS)拍一拍它说“有新消息来了”&…

2026/8/4 1:22:11 阅读更多 →

日新闻

AI Agent白手起家26: 使用标准事件驱动大模型实践

AI Agent白手起家26: 使用标准事件驱动大模型实践

纲要 练习目标:掌握大模型标准事件的调用回顾 LangChain 中的核心标准事件 invokestreambatchastream_eventswith_structured_output 环境准备实战代码:多种事件调用对比 同步调用与流式输出批量处理异步事件流监听结构化输出 运行说明与预期结果总结与扩…

2026/8/4 0:00:40 阅读更多 →
dealsea是什么?跨境卖家必知的美国deal站入门指南

dealsea是什么?跨境卖家必知的美国deal站入门指南

说实话,第一次听说美国这个老牌折扣网站的跨境卖家,十个有八个会问同一个问题:这个平台到底是干嘛的?我见过一个做家居出口的朋友,他在亚马逊上月销二十万美金,却从来没用过它。我给他看了首页——一屏一屏…

2026/8/4 0:01:40 阅读更多 →
清华大学重磅EST:植物自导电闪蒸焦耳热600°C/2600°C两步法!稀土超积累植物秒级转化为CeO₂-石墨烯电催化剂!

清华大学重磅EST:植物自导电闪蒸焦耳热600°C/2600°C两步法!稀土超积累植物秒级转化为CeO₂-石墨烯电催化剂!

通讯作者:邓兵、刘建国通讯单位:清华大学DOI:https://doi.org/10.1021/acs.est.6c00603研究背景稀土元素(REEs)是清洁能源技术与电子器件不可或缺的核心原料,然而传统提取方式依赖能耗高、排放大的采矿与强…

2026/8/4 0:01:40 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/3 4:58:13 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/3 1:53:31 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/3 4:36:35 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/3 13:07:03 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/3 5:19:38 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/3 8:27:36 阅读更多 →