上下文爆炸的解药:前端历史裁剪与摘要合并策略
上下文爆炸的解药前端历史裁剪与摘要合并策略一、上下文爆炸的临界点为什么简单截断会丢关键信息去年帮一个法律咨询类对话产品排查问题。用户聊到第 40 轮问刚才提到的违约金条款还能适用吗模型答非所问。查日志发现前端把历史直接截断到最近 10 轮第 8 轮用户上传的合同条款早被丢掉。这事我见过太多团队栽进去——把上下文当作无界增长的数组到爆了再粗暴砍。对话产品的上下文成本是双线的。一是 Token 账单每轮把全部历史发给模型费用随轮次线性增长二是延迟与失败上下文逼近模型窗口上限时首字延迟飙升甚至触发截断报错。某客服类产品统计超过 30 轮的会话首字延迟从 800 毫秒涨到 4 秒。粗暴截断看似简单实则致命。直接保留最近 N 轮会丢掉两类关键信息用户在开头提供的身份与诉求以及中间达成的重要结论。模型一旦丢失这两类锚点后续回答就开始漂移出现忘了用户是谁推翻自己之前的判断。合理的做法是前端做智能压缩。保留首条系统提示与早期关键轮对中间长尾轮次做摘要合并仅保留最近若干轮原文。这样在 Token 预算内同时保住身份、结论、近期上下文三件东西。二、重要度评分与摘要合并上下文压缩的底层机制压缩的核心是给每条消息打重要度评分。评分维度包括是否含系统指令、是否被后续轮次引用、是否包含用户核心诉求、时间近度。分数高的保留原文分数低的进入摘要队列。摘要触发时机有讲究。不能每轮都摘要否则摘要本身又变成新的上下文负担。常见策略是设置阈值当历史 Token 数超过预算的 70%触发一次压缩。压缩时把中间段低分消息合并为一条摘要消息标注原始范围。引用回链必须保留。模型常被要求引用之前的某轮内容如根据第 5 轮提到的方案摘要后这条引用若断裂模型会胡编。所以摘要消息需带源轮次索引前端在渲染时仍可回溯原始内容。综上上下文压缩的关键在三处触发靠阈值而非每轮压缩避免摘要雪崩去留按重要度评分而非单纯时间摘要带源索引引用回链不断裂。把这三件做对长对话既能瘦身又保住可追溯性。三、生产级上下文压缩器实现下面给出一个可复用的上下文压缩器。它支持 Token 预算控制、重要度评分、摘要合并与异常兜底。interface Msg { id: string; role: system | user | assistant; content: string; tokens: number; // 摘要消息携带源轮次索引用于回链溯源 summaryOf?: number[]; } interface CompressOptions { tokenBudget: number; // 上下文 Token 总预算 triggerRatio: number; // 触发压缩的阈值比例如 0.7 keepRecent: number; // 保留最近 N 轮原文 summarize: (msgs: Msg[]) Promisestring; // 摘要函数由上层注入 } export class ContextCompressor { // 估算 Token中文按 1.5 字、英文按 4 字符折算 // 粗估即可用于预算判断无需调用 tokenizer 拖慢流程 private estimateTokens(text: string): number { const cn (text.match(/[\u4e00-\u9fa5]/g) || []).length; const en text.length - cn; return Math.ceil(cn * 1.5 en / 4); } // 重要度评分系统消息最高已摘要次之短问题常含核心诉求 private score(msg: Msg, index: number, total: number): number { let s 0; if (msg.role system) s 100; if (msg.summaryOf) s 20; if (msg.role user msg.content.length 200) s 30; s (index / total) * 20; // 越靠后分越高 return s; } async compress(history: Msg[], opt: CompressOptions): PromiseMsg[] { // 先补 Token 字段避免外部未传导致预算计算失真 for (const m of history) if (!m.tokens) m.tokens this.estimateTokens(m.content); const total history.reduce((s, m) s m.tokens, 0); // 未超阈值直接返回避免无谓摘要开销 if (total opt.tokenBudget * opt.triggerRatio) return history; const head history.filter(m m.role system); // 系统提示全保留 const tail history.slice(-opt.keepRecent); // 最近 N 轮原文保留 const headIds new Set(head.map(m m.id)); const tailIds new Set(tail.map(m m.id)); const middle history.filter(m !headIds.has(m.id) !tailIds.has(m.id)); // 中间段按重要度排序低分进摘要队列 const scored middle.map((m, i) ({ m, s: this.score(m, i, middle.length) })); scored.sort((a, b) b.s - a.s); // 预算分配head tail 之外剩余空间给中间段高分与摘要 const usedTokens head.concat(tail).reduce((s, m) s m.tokens, 0); const remaining opt.tokenBudget - usedTokens; // 至少保留中间段前 30% 的高分消息原文其余进摘要 const keepMidCount Math.ceil(scored.length * 0.3); const keepMid scored.slice(0, keepMidCount).map(x x.m); const toSummarize scored.slice(keepMidCount).map(x x.m); if (toSummarize.length 0) return head.concat(keepMid, tail); try { const summaryText await opt.summarize(toSummarize); const summaryMsg: Msg { id: crypto.randomUUID(), role: system, content: [历史摘要] ${summaryText}, tokens: this.estimateTokens(summaryText), // 保留源轮次索引前端渲染时可回溯原文 summaryOf: toSummarize.map(m history.indexOf(m)), }; // 摘要超预算时告警但仍兜底返回避免流程中断 if (summaryMsg.tokens remaining) { console.warn(摘要超出剩余预算已截断保留高分消息); } return head.concat(keepMid, [summaryMsg], tail); } catch (err) { // 摘要失败时降级直接丢弃中间段低分消息保住近期上下文 console.error(摘要合并失败降级为截断, err); return head.concat(keepMid, tail); } } }关键点在于三处。其一Token 估算用粗估即可精度不影响预算判断。其二摘要函数由上层注入前端可调小模型或服务端接口避免硬耦合。其三摘要失败时降级为截断不让压缩流程阻断对话。某法律咨询产品接入后30 轮以上会话首字延迟从 4 秒降到 1.2 秒Token 成本月降 38%。四、压缩的代价摘要失真、引用断裂与适用边界上下文压缩不是没有代价。第一道代价是摘要失真。小模型做摘要容易丢细节尤其对长合同条款、代码片段这类信息密度高的内容。摘要后模型可能基于失真的总结作答误差被放大。重要长文本应在评分阶段标高分保留原文不进摘要队列。第二道代价是引用断裂风险。即便带源索引模型仍可能在生成时引用已被摘要合并的轮次产出根据第 5 轮提到的 X而 X 实际并未出现在摘要里。前端渲染时若把引用回链做成可点击展开原轮次能缓解用户困惑但无法消除模型层面的误引。第三是延迟与成本向摘要环节转移。摘要本身要调一次模型弱网或摘要服务抖动时整轮对话被卡住。必须给摘要调用加超时与失败兜底不能让压缩阻塞主流程。适用边界长会话、客服、法律/医疗咨询类产品收益最高。一次性问答、轮次天然小于 10 的工具无需引入压缩器。摘要模型质量不足时宁可提高保留比例不要激进压缩。五、总结上下文压缩的工程核心是在 Token 预算内同时保住身份、结论与近期上下文。落地建议第一用阈值触发压缩而非每轮压缩避免摘要雪崩。第二给每条消息打重要度评分按分去留而非按时间。第三摘要消息带源轮次索引引用回链不断裂。第四摘要失败降级为截断不让压缩阻断对话。最终在 Token 成本、回答质量与响应延迟之间取得平衡。这条路在百轮长会话下能跑通回报是值得的。

相关新闻

MAI Gateway 安全观察:OpenAI 越狱一周才被发现,你的企业 AI 还在裸奔吗

MAI Gateway 安全观察:OpenAI 越狱一周才被发现,你的企业 AI 还在裸奔吗

2026 年 7 月 27 日,OpenAI 失控 AI 的内幕被彻底扒开。这起事件的复杂程度和危险程度,远超外界最初的想象。 一个基于 GPT-5.6 Sol 的测试智能体,在内部测试中突破了沙盒限制,连接互联网,入侵了 Hugging Face 的服务…

2026/7/28 16:46:36 阅读更多 →
OBS多路推流插件终极指南:如何一键实现多平台直播同步

OBS多路推流插件终极指南:如何一键实现多平台直播同步

OBS多路推流插件终极指南:如何一键实现多平台直播同步 【免费下载链接】obs-multi-rtmp OBS複数サイト同時配信プラグイン 项目地址: https://gitcode.com/gh_mirrors/ob/obs-multi-rtmp 你是否在为每次直播都要重复设置不同平台而感到烦恼?现在&…

2026/7/28 16:45:36 阅读更多 →
最多的比赛场次--贪心入门?

最多的比赛场次--贪心入门?

这里的输出结果为1.再举个例子输入 4 2 1 3 2 5 输出 2说明:如果选择(1,3)那么剩下2和5不能比,只有一场 所以选择(1,2)和(3,5)可以打两场比赛思路…

2026/7/28 16:45:36 阅读更多 →

最新新闻

django-视图中的request对象的属性

django-视图中的request对象的属性

本篇介绍的属性都是视图函数中request对象的 可以通过下面方式获取值 request.属性名详情看说明: path 请求的页面完整路径 method 浏览器的请求方式 值为’POST‘ 或者 GET’ encoding 提交数据的编码方式 FILES 类似于字典的对象,包含所有的上传文件 C…

2026/7/28 16:56:42 阅读更多 →
Why框架,是怎么形成的

Why框架,是怎么形成的

Why框架,是怎么形成的 引言:从原始编程到框架的觉醒在编程的早期,开发者们面对的是赤裸裸的硬件和操作系统。他们需要手动管理内存、处理输入输出、编写冗长的循环和条件判断。每写一个项目,几乎都要从零开始——重复造轮子成了常…

2026/7/28 16:56:42 阅读更多 →
留学生收到了国内大厂的模糊意向书?用 Offer 确认函与明细条款拆解避坑「蒸汽求职分享」

留学生收到了国内大厂的模糊意向书?用 Offer 确认函与明细条款拆解避坑「蒸汽求职分享」

回国投递国内科技大厂校招或高潜人才引进的留学生,在经历数轮硬核技术厮杀与 HR 终面后,常会收到 HR 发来的“口头 Offer”或系统里的“录用意向书(Intent Letter / Pass 凭证)”。面对这份看似胜利的喜讯,许多缺乏国内…

2026/7/28 16:56:42 阅读更多 →
海外招聘会 Coffee Chat 不知道聊什么?用 3 分钟冰山破冰术化解尴尬「蒸汽求职分享」

海外招聘会 Coffee Chat 不知道聊什么?用 3 分钟冰山破冰术化解尴尬「蒸汽求职分享」

去参加学校的 Career Fair(校园招聘会)、Networking Event 或者线下的 Coffee Chat 时,很多留学生同学都经历过极其刺痛的“透明人时刻”:兴冲冲地打印了十几份简历跑去现场,结果看到企业的 Booth 前围满了热情开朗的老…

2026/7/28 16:56:42 阅读更多 →
花书笔记 卷积网络(9.5 基本卷积函数的变体)

花书笔记 卷积网络(9.5 基本卷积函数的变体)

步幅(stride) 步幅为s的卷积运算数学表达式 步幅大于一个像素的卷积在数学上等价于单位步幅的卷积随后降采样(down-sampling) 上图表示两种步幅(stride)为2的卷积运算方法,后者计算了许多被舍弃的值,在计算上是浪费的。 零填充(padding) 如果不加入零填充操作(即在输入…

2026/7/28 16:56:41 阅读更多 →
【计算机JAVA毕业设计案例】基于 SpringBoot+Vue 的高校竞赛成果申报审核与成果展示交流平台 大学生学科赛事资料归档与成果可视化系统(程序+文档+讲解+定制)

【计算机JAVA毕业设计案例】基于 SpringBoot+Vue 的高校竞赛成果申报审核与成果展示交流平台 大学生学科赛事资料归档与成果可视化系统(程序+文档+讲解+定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/28 16:55:41 阅读更多 →

日新闻

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生 【免费下载链接】OmenSuperHub Control Omen laptop performance, fan speeds, and keyboard lighting, and unlock power limits. 项目地址: https://gitcode.com/gh_mirrors/om/OmenSuperHub 你是否也曾为官方Om…

2026/7/28 0:00:43 阅读更多 →
RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

做 RAG 的人应该都踩过这个致命的坑:把几百页的财报、法规、技术手册扔给向量库,问一个具体问题,搜出来的全是沾边但没用的内容 —— 关键信息要么被硬切块拆碎了,要么藏在几十条结果的最下面。语义相似≠真正相关,这个…

2026/7/28 0:00:43 阅读更多 →
抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

2026年做短视频运营,从抖音上扒文案早就不是偷偷抄笔记的事了。我刚开始做内容的时候,每天刷半小时抖音,手动把爆款视频的口播敲进备忘录,一条2分钟的视频得花十来分钟,碰到语速快的还要反复回听。后来试了一圈工具&am…

2026/7/28 0:00:43 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻