摘要面向大模型智能体LLM Agent的技能自进化方法目标是把智能体的执行轨迹trajectory变成可复用的技能文档。但目前的主流流水线有三个通病只从单条轨迹里学经验、补丁还没验证就合并、推理时一股脑加载整个技能库。为此文章提出SkillCAT——一个把整个流程拆成三个阶段的免训练框架。对比因果抽取为每个任务采样多条轨迹把“同任务的成功 vs 失败”配成对照组专门去找解释结果差异的那处证据评估增强进化在“源任务克隆体”上回放每个候选补丁只保留那些能改善或至少维持任务结果的补丁再做分层合并拓扑感知任务执行则把进化后的技能编译成一张可路由的子技能拓扑图推理时只加载与当前任务相关的能力节点。在常见智能体基准以及跨模型、分布外OOD泛化测试中SkillCAT 相比基线平均分最高提升 40.40%证明了在不训练模型的前提下也能实现可靠的技能进化。论文标题: SkillCAT: Contrastive Assessment and Topology-Aware Skill Self-Evolution for LLM Agents作者: Kunfeng Chen, Qihuang Zhong, Juhua Liu发表年份: 2026原文链接: https://arxiv.org/abs/2606.13317关键词: [LLM Agent, 技能自进化 , 对比学习 , 免训练, 上下文路由]研究背景为什么“技能自进化”这件事重要大模型智能体在干活时越来越依赖外挂的技能文档结构化的操作说明、工具使用规则、踩过坑攒下来的任务经验这些东西在运行时被注入到上下文里帮智能体完成那些一步到位做不完的长程任务——关键是全程不用动模型权重。早期的技能库基本靠人手写。但人写技能又贵又难规模化于是社区开始研究怎么从智能体自己的执行轨迹里自动抽取和打磨技能这就是所谓的技能自进化。听起来很美但真正落地时现有方法卡在三个地方。下面逐条拆解下面这张图是全文的“总纲”左上 (a) 是最早的“一条轨迹改一次技能”的串行更新右上 (b) 是 Trace2Skill 那类“先批量抽补丁再 Map-Reduce 合并”的并行蒸馏下半 © 才是本文的核心——把三大痛点和 SkillCAT 的三剂解药一一对上。Trace2Skill 类方法的三大局限以及 SkillCAT 对应的解决方案痛点一单轨迹偏见Single-Trace Bias主流方法通常一个任务只看一条轨迹就总结经验。问题是单条轨迹提供的证据太弱• 一条成功的轨迹可能只是“蒙对了”——它走的某条侥幸路线被误当成了通用技能• 一条失败的轨迹往往说不清到底是哪一步把事情搞砸的抓不住根因root cause。结果就是要么错过真正的因果要么把噪声当经验写进技能库。痛点二未经验证的合并很多方法把从轨迹里抽出来的候选补丁不做任何独立检验就直接合并进技能库。这意味着低质量、甚至有害的补丁会偷偷溜进来。论文在 DocVQA 上给了一个扎心的反例Trace2Skill 的 Error 变体由于放进了未验证的补丁ANLS 反而掉到了 0.6223比“完全不用技能”还低 0.0620——技能越“进化”越糟。痛点三上下文过载合并后的技能文档会越长越臃肿。推理时把整个技能库一股脑塞进上下文等于给智能体喂了一堆和当前任务无关、甚至互相打架的规则既拉长了 prompt又把模型的注意力从真正相关的内容上带偏。换句话说“懂得多”不等于“用得好”。方法总览SkillCAT 的整体思路可以用一句话概括别再把技能进化当成“写一篇越来越长的攻略”而要把它拆成三个可观测、可单独消融的决策环节——证据可不可靠补丁该不该进库测试时该加载哪部分对应到三个模块┌──────────── 离线学习Offline────────────┐ ┌─ 在线部署Online─┐ 多 seed 轨迹 → CCE 对比因果抽取 → AAE 评估增强进化 → S* → TTE 拓扑感知任务执行 → 执行 (成功/失败配对) (找因果分水岭) (回放验证分层合并) 进化技能 (按任务只加载相关节点)•CCE用多个随机种子seed为同一任务跑出多条轨迹把“成功 vs 失败”配成对照组只在二者第一次分叉的那个点上抽经验•AAE把每个候选补丁当成“待验证的假设”在源任务克隆体上回放一遍按结果是否变好打分只有达标的才合并•TTE把进化后的技能编译成一张能力节点拓扑图推理时由路由器只挑相关节点加载。下面这张 pipeline 总览图把三个阶段串了起来左侧 CCE 抽“同任务对比证据”中间 AAE 验证候选补丁、按分数从低到高分层合并右侧 TTE 在线时只路由与任务相关的技能节点。注意底部那条分割线——CCE、AAE 在离线学习阶段完成TTE 在在线部署阶段工作。SkillCAT 流水线总览核心思想把“技能进化”从一次性的文本生成重构成“证据—验证—投放”三段可控的工程流程——每一步都能被检验、被消融、被解释。关键结论• 对比找因而非单轨迹总结CCE 用“同任务成功/失败对照组”定位因果分水岭causal watershed只在结果开始分叉处抽经验。消融实验里去掉 CCE 后 Vrf 从 55.50% 掉到32.50%证明对比证据是技能编辑的“硬通货”。• 先验证后合并杜绝“有害补丁”AAE 在源任务克隆体上回放补丁并打分F→S3 分最高S→F0 分直接拒阈值 θ2.0 卡门。去掉 AAE 后 Vrf 掉到26.00%甚至低于 Trace2Skill 基线29.67%——说明不验证就合并比不进化还危险。• 按需加载省 41.6% 上下文还更准TTE 把技能编译成可路由拓扑LLM 图路由器top_k7在削减 41.6% 上下文的同时把 Vrf 做到55.50%反而比“全量加载”的 46.50% 更高。证明“给得少而准” “给得多而杂”。深度拆解SkillCAT 把技能自进化拆成三段CCE 和 AAE 在离线技能学习阶段跑TTE 在在线任务部署阶段跑。下面按模块逐个啃。问题形式化到底在优化什么先把符号理一理。设 X {x₁, …, x_N} 是用来进化技能的任务集合Z {z₁, …, z_K} 是一组随机种子。给定一个基础技能 S₀让智能体在任务 xᵢ 上用种子 z 跑一遍就得到一条轨迹 τ 和一个由官方评测器给出的二值结果 y ∈ {0,1}成功/失败。技能自进化的输入是 (S₀, 全部轨迹 T)输出是进化后的技能 S*以及测试时为每个任务路由出来的精简技能 Sc。目标有两层既要在没见过的任务上提升官方评测分又要控制每个任务注入上下文的技能体量。所以这道题不是“把文档写得更长”而是要回答三个决策哪些证据可靠、哪些补丁该进库、测试时该加载哪部分。这三个问题正好对应 CCE / AAE / TTE。模块一对比因果抽取 CCE —— 用“对照实验”找根因CCE 的精髓在于控制变量。它从多种子运行里为同一个任务 xᵢ 凑出成功轨迹集合 T⁺ 和失败轨迹集合 T⁻当两边都非空时各随机抽一条组成对照对 (τ⁺, τ⁻)。为什么必须是“同任务”因为同一个任务共享相同的输入、工具和评测器这样就能排除任务难度、输入内容的干扰——两条轨迹结局不同那差异大概率出在“执行选择”上而不是“题目本身有难易”。接着CCE 定位因果分水岭 wᵢ成功轨迹和失败轨迹的动作序列第一次出现分叉的那一步形式上 wᵢ min{t : α⁺_t ≠ α⁻_t}。抽取器只围绕这个点写一条候选经验记录包含三样东西局部证据、推断出的失败原因、以及一条可写入技能的教训。划重点CCE不总结整条轨迹它只盯着“胜负开始分野”的那个关键动作。这正是它比“单轨迹全文总结”更精准的原因。兜底机制如果某个任务的 K 条轨迹全成功或全失败凑不出严格的成功/失败对照对。这时若开启 fallback就退化用单轨迹抽取器 E₁ 处理否则干脆跳过该任务以严守“对比证据”的定义。模块二评估增强进化 AAE —— 补丁先“灰度回放”再合并AAE 的核心理念是把每个候选补丁当成“待证伪的假设”而不是“直接照搬的规则”。源任务回放评估对候选补丁 pⱼAAE 找到产生它的那些源任务的“克隆体”集合 Xⱼ先记录不打补丁的基线结果 yⱼ再记录打上临时补丁后的回放结果 ŷⱼ。注意 AAE不估计连续奖励而是直接给四种“结果跃迁”排序打分结果跃迁基线→回放含义得分处理失败 → 成功 (F→S)修好了一个原本失败的源任务3.0最强证据✅ 强力保留成功 → 成功 (S→S)保住了已知的成功行为2.0✅ 保留失败 → 失败 (F→F)没解决问题1.0❌ 降权/淘汰成功 → 失败 (S→F)把原本对的搞砸了0.0最差❌ 直接拒绝阈值筛选只有得分 aⱼ ≥ θ论文设θ 2.0的补丁才能进入合并阶段。也就是说留下来的补丁要么修好了一个源任务的失败要么至少保住了一个已知的成功那些“留着失败不管”或“把成功变失败”的补丁统统被挡在门外。分层分级合并Hierarchical tiered merge通过阈值的补丁按分数分层从低分层往高分层依次合并S⁽ˡ⁾ µ(S⁽ˡ⁻¹⁾, Pθ⁽ˡ⁾)S⁽⁰⁾ S₀最终 S* S⁽ᴸ⁾。这样高分补丁在后期合并中拥有更高优先级同时也允许低分但已验证的补丁贡献不冲突的规则。合并算子本身复用了 Trace2Skill 的技能编辑过程——AAE 改变的不是“怎么合”而是“哪些补丁能进来、按什么顺序合”。模块三拓扑感知任务执行 TTE —— 把“加载技能”变成“上下文选择”TTE 把测试时的技能使用重新定义为一个上下文选择问题离线时把进化后的技能 S* 编译成一张可路由拓扑在线时为每个任务只拼装一份更小的精简技能 Sc从而避开“全量加载”带来的成本和干扰。拓扑构建离线编译器解析 AAE 产出的 S* 的 Markdown 层级结构——一级标题内容作为“常驻核心技能 S°”always-on二级章节作为“可路由节点集 V”。每个节点 v 保留原始正文 Bv注入时用同时抽出标题、关键词、摘要、依赖关系作为路由元数据。于是路由时只读紧凑摘要拼装时用未改动的节点正文——routing 读摘要assembly 用原文互不干扰。LLM 路由与技能拼装给定任务描述 c 和路由预算 kLLM 路由器 ρ 从拓扑摘要里挑出最多 k 个相关主节点运行时再做一轮确定性的“扩展”Expand校验节点 ID、加上召回与任务意图锚点、展开依赖边、补上基础节点。最后把核心技能 S° 与选中节点的原始正文拼接Sc S° ⊕ ⊕Bv。TTE 不重新生成任何技能文本所以完整保留了 AAE 产出的规则它只改变“测试时加载哪些规则”。最终配置用的是基于 prompt 的llm_graph_routertop_k7外加运行时节点校验、依赖扩展、基础节点注入。实验结果RQ1SkillCAT 能否同时提升表格任务和 OOD 表格泛化先看主结果大表。这张 Table 1 信息量极大建议重点看SkillCAT (Ours)行的加粗数字和右下角箭头标注相对匹配基线的涨跌主要实验结果在 35B 同模型 Deepening 下SkillCAT 的 Vrf 达到55.50%比 Trace2Skill 高 25.83 个百分点、比人工技能高足足 45.83 个百分点约 5.7 倍。在 122B 上SkillCAT 的 Vrf69.50%虽然和 Trace2Skill69.83%几乎打平、略低 0.33但在 Soft、Hard、WikiTQ 和总平均分上全面反超。最值得玩味的是Skill Creation从一个很弱的基础技能起步Trace2Skill 几乎纹丝不动−0.17 / 0.16而 SkillCAT 直接做到 54.50% / 64.50%——这说明它不依赖一个好的人工起点能“从弱到强”地把技能养出来。RQ2在多模态 DocVQA 上“验证补丁”到底有多关键下图是全文最有戏剧性的一张图上半是 ANLS、下半是 Accuracy三根柱子分别是 No-Skill灰、Trace2Skill Error红、SkillCAT Full蓝。DocVQA 多模态评测。SkillCAT Full蓝柱在两个使用者上都是最高的——35B 拿到0.9159 ANLS比 No-Skill 0.2316、93.3% Acc18.1122B 拿到 0.7200 ANLS、79.0% Acc。而红柱 Trace2Skill Error 在 35B 上 ANLS 只有0.6223比“完全不用技能”还低 0.0620。RQ3每个模块到底贡献了多少组件消融实验三个模块缺一不可但“掉法”各不相同。去掉 CCE分数跌到 32.50%——对比证据是技能编辑的关键弹药去掉 AAE直接崩到 26.00%比基线还低坐实了“不验证就合并比不进化更糟”去掉 TTE还能有 46.50%但仍比全量低 9 个点说明再好的技能也得配上“按需投放”。反观Only TTE 只有 27.50%还低于基线——光有路由、没有高质量技能内容纯属空转。收敛性与边际效应再加种子/再加预算就一定更好吗CCE 的种子预算文章扫了 1/3/5/7/9 个种子。留出 Vrf 从 1 个种子的 32.50% 升到 5 个种子的55.50%然后不升反降——7 个种子 46.00%、9 个种子 41.50%。而采样时间从 1 个种子的 22 分 56 秒一路涨到 9 个种子的 4 小时 41 分 49 秒CCE 证据预算5 个种子是准确率—成本的最佳平衡点再加种子只增加采样成本并不能换来更好的泛化典型的边际效应递减甚至出现性能回落。这是个非常实用的工程结论。AAE 打分校准文章把 197 个候选补丁按回放结果跃迁分桶每桶单独评测并把各桶补丁数对齐到最小桶以公平比较AAE 打分校准分桶 Vrf 完美按 AAE 设计的顺序单调排列——F→S 桶 51.0%21.3pp、S→S 桶 41.0%11.3pp、F→F 桶 32.0%2.3pp、S→F 桶 23.5%−6.2pp。TTE 路由的“省 token 不掉点”上图是 Vrf、下图是上下文削减比例对比 Embedding 检索和 LLM 图路由两种路由器虚线是“全量加载不用 TTE”的 46.50%TTE 路由器对比两种路由器在大多数预算下都高于“全量加载”的参照线且用更少 token。Embedding 检索在 top_k3 时峰值 57.00%论文最终选用的 LLM 图路由器在 top_k7 时做到55.50% Vrf同时削减 41.6% 上下文。作者选它的理由是有竞争力、省 token、还能利用 TTE 的依赖拓扑且不需要额外的 embedding 模型。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】