Self-GC:多轮Agent上下文管理的降本增效方案
本文整理自 AICon 上海分享「Self-GC一种结合前缀缓存约束的多轮 Agent 上下文治理方案」演讲者郝栩彬通过AI音视频总结工具Ai好记转录整理以下为视频转文字精炼整理后的内容。白领Agent的成本困境Agent正在从演示原型走向企业级部署。但当面向白领的Agent如处理PPT、PDF、浏览器的办公助手在1000人规模的公司内推广时成本会呈指数级增长——一个粗略估算每月成本可能达到千万级别。核心成本卡点在哪不是推理计算的单价而是长上下文带来的高Token消耗。一个典型的白领Agent工作流用户提问 → Agent理解指令 → 调用工具浏览器/文档编辑器→ 获取结果 → 继续交互。每轮交互都会往上下文里塞入新的内容而白领任务的工具调用频繁、产物不可重复执行不像代码可以git checkout上下文长度迅速膨胀到平均80K输入Token。北极星指标AvgInputTokens团队选择了一个核心指标来衡量成本——AvgInputTokens平均每次模型请求的输入Token数。指标优点缺点总Token消耗直观反映总成本受用户量波动大缓存命中率能看出优化效率达到85%后提升空间有限AvgInputTokens抹平用量波动直接反映成本密度需要精细统计这个指标比总Token数或缓存命中率更能稳定地反映成本趋势成为降本的主攻方向。传统的上下文裁剪为什么容易「翻车」最直接的降本思路就是给上下文「瘦身」——把不重要的内容剪掉。但白领任务和Coding任务完全不同维度Coding任务白领任务环境一致性Git仓库可复现浏览器数据每次不同产物管理可版本化PPT/PDF不可版本化失败恢复可回溯历史无法重复执行工具鲁棒性高Git/Shell稳定低浏览器/Office不稳定基于规则或固定模式的裁剪一旦错误地移除了关键上下文比如载入的BI数据模型无法像在Coding环境中那样通过查看Git或重跑单测来恢复结果就是任务彻底失败用户体验极差。Self-GC让模型自主管理上下文Self-GC的核心思想是让模型自己决定哪些上下文可以回收而不是靠外部规则去硬裁。第一步上下文对象化通过turn_id为用户的每次输入和每个工具的执行结果打上「户口」使其可被索引和管理。这样上下文不再是混沌的一大段文本而是带有标签的数据对象。对象标识内容用户输入turn_001用户的问题和指令工具结果turn_002工具执行的返回数据Agent思考turn_003模型的推理过程第二步旁路Fork规划机制在对话过程中通过一个低成本的旁路Fork让模型自己回顾对话历史生成一份针对性的垃圾回收计划GC Plan哪些上下文可以折叠压缩为摘要哪些上下文可以归档移到外部存储哪些上下文可以删除不再需要整个GC过程不由外部规则驱动而是模型基于当前任务状态自省判断。第三步延迟提交 增量GC为了不伤害用户体验Self-GC有两个保护策略延迟提交生成的GC计划不立即执行而是延迟几轮再执行。避免刚刚生成的最新上下文被误伤保护最新的用户意图。增量GC每次只对未被裁剪过的新增上下文尾部进行操作保护已处理过的、处于KV Cache热缓存状态的前缀部分。这样最小化对推理性能的破坏。效果指标效果大盘Input Token下降15-20%总成本下降5-10%任务成功率持平或微升KV Cache命中率保持降成本的工程策略全景Self-GC只是降本策略中的一环。从执行难度和副作用来看有三种策略策略方法副作用实施难度优化工具设计减少工具调用的上下文增长斜率几乎无低周期裁剪/折叠执行中定期剪裁中等误伤风险中激进压缩大幅压缩上下文大用户体验差高三者应在成本与效果之间找到平衡点逐级实施。价值超越降本Self-GC还有一个意想不到的价值它产出的「干净」任务轨迹——经过GC后不带冗余噪音的交互历史——能反哺到AI系统的多个环节记忆检索干净的历史记录更容易被检索系统命中经验沉淀成功的任务轨迹可以作为最佳实践被复用数据飞轮高质量的任务数据可以用于模型微调这比简单的「谁便宜用谁」的策略更有长期价值。选择模型的关键Toplay性能在成本优化中有一个容易被忽视的原则不要一味追求低价模型。策略效果用廉价模型反复试错任务失败率高总成本反升用一次做对能力强的模型单次贵但总体成本更低模型的「一次做对」能力Toplay性能和稳定性往往比便宜的模型带来更低的整体成本。结合Self-GC这样的上下文管理方案才是从架构层面真正降本的路径。FAQQSelf-GC会增加多少额外的推理成本A旁路Fork规划的Token消耗很小远小于裁剪后节省的Token量。实际验证中总成本下降5-10%。Q上下文折叠后信息丢失怎么办A折叠不是删除原始内容可归档存储。模型在需要时可以通过检索回溯到原始信息。QSelf-GC适用于Coding Agent吗A可以但对Coding Agent来说传统规则裁剪已经效果不错。Self-GC在不可回溯的通用任务场景白领、办公优势更明显。以上内容由 Ai好记 转录整理。Ai好记 是一款音视频转图文笔记的AI音视频转录总结工具支持解析B站、抖音、小红书、小宇宙等平台链接及本地/网盘音视频文件转录后自动视频转文字生成精华速览、思维导图和结构化笔记等内容形式帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

相关新闻

虚幻引擎像素流送实战:从零实现网页与UE应用双向通信

虚幻引擎像素流送实战:从零实现网页与UE应用双向通信

1. 这篇文章真正要解决的问题 你是否遇到过这样的困境:一个用虚幻引擎(Unreal Engine)开发的酷炫3D应用,比如一个产品展示、一个培训模拟器,或者一个游戏Demo,你希望它能像网页一样被轻松分享和访问?传统的方案是打包成独立的PC或移动端应用,分发困难,更新繁琐,用户…

2026/7/25 22:57:03 阅读更多 →
ObjectivePGP源码解析:深入理解OpenPGP协议的实现细节

ObjectivePGP源码解析:深入理解OpenPGP协议的实现细节

ObjectivePGP源码解析:深入理解OpenPGP协议的实现细节 【免费下载链接】ObjectivePGP ObjectivePGP is an open-source library for iOS and macOS that provides developers with tools for implementing OpenPGP encryption and decryption, digital signing, and…

2026/7/25 22:57:03 阅读更多 →
【面试】一篇文章帮你彻底搞清楚“I/O多路复用”和“异步I/O”的前世今生

【面试】一篇文章帮你彻底搞清楚“I/O多路复用”和“异步I/O”的前世今生

【面试】一篇文章帮你彻底搞清楚“I/O多路复用”和“异步I/O”的前世今生 引言:为什么需要理解I/O模型?在编程面试中,“I/O多路复用”和“异步I/O”几乎是必考的高频主题。很多同学能背出select、epoll、回调函数等概念,但一旦被问…

2026/7/25 22:57:03 阅读更多 →

最新新闻

Breadcrumbs V4版本新特性:向后兼容的同时带来哪些革命性改进?

Breadcrumbs V4版本新特性:向后兼容的同时带来哪些革命性改进?

Breadcrumbs V4版本新特性:向后兼容的同时带来哪些革命性改进? 【免费下载链接】breadcrumbs Add typed-links to your Obsidian notes 项目地址: https://gitcode.com/gh_mirrors/br/breadcrumbs Breadcrumbs 是一款为 Obsidian 笔记添加类型化链…

2026/7/25 23:03:06 阅读更多 →
Nota:革新浏览器文档体验的21世纪文档语言完全指南

Nota:革新浏览器文档体验的21世纪文档语言完全指南

Nota:革新浏览器文档体验的21世纪文档语言完全指南 【免费下载链接】nota A document language for the browser 项目地址: https://gitcode.com/gh_mirrors/no/nota Nota 是一种专为浏览器设计的文档语言(A document language for the browser&a…

2026/7/25 23:03:06 阅读更多 →
大模型RL训练新发现:仅优化Transformer中间层可超越全参数效果

大模型RL训练新发现:仅优化Transformer中间层可超越全参数效果

如果你正在使用强化学习(RL)对大语言模型进行后训练,可能会默认认为所有参数都需要参与更新才能获得最佳效果。但最新研究揭示了一个反直觉的事实:RL训练的大部分收益可能只来自Transformer架构中的某一个中间层,单层训…

2026/7/25 23:03:06 阅读更多 →
全局工作空间机制:提升LLM推理稳定性的关键技术解析

全局工作空间机制:提升LLM推理稳定性的关键技术解析

如果你正在研究大语言模型(LLM)的内部工作机制,可能会发现一个有趣的现象:为什么有些模型在复杂推理任务上表现稳定,而另一些却容易"跑偏"?Anthropic 最近的一篇论文给出了一个关键答案——全局工…

2026/7/25 23:03:06 阅读更多 →
为什么92%的开发者本地大模型部署失败?——揭秘模型加载崩溃、tokenizer错配、CUDA版本冲突三大致命坑

为什么92%的开发者本地大模型部署失败?——揭秘模型加载崩溃、tokenizer错配、CUDA版本冲突三大致命坑

更多请点击: https://kaifayun.com 第一章:本地大模型部署失败的宏观归因分析 本地大模型部署失败往往并非单一技术点的崩溃,而是多维度系统性约束叠加的结果。硬件资源瓶颈、软件环境错配、模型格式兼容性缺失以及推理框架配置偏差&#xf…

2026/7/25 23:03:06 阅读更多 →
Miden VM高级特性:自定义Host与Precompiles如何扩展零知识应用边界

Miden VM高级特性:自定义Host与Precompiles如何扩展零知识应用边界

Miden VM高级特性:自定义Host与Precompiles如何扩展零知识应用边界 【免费下载链接】miden-vm STARK-based virtual machine 项目地址: https://gitcode.com/gh_mirrors/mi/miden Miden VM作为基于STARK的虚拟机,通过自定义Host和Precompiles两大…

2026/7/25 23:02:05 阅读更多 →

日新闻

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您的…

2026/7/25 0:00:35 阅读更多 →
C++ string类模拟实现:从深拷贝到内存管理的完整指南

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:00:35 阅读更多 →
三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:00:35 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/25 5:08:22 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/25 5:13:53 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/24 18:52:18 阅读更多 →

月新闻