SkillEvolver:让 Agent 学会“自己写技能”的元技能框架
一、一句话概述SkillEvolver 的核心想法很直接与其让人手写 Agent skill或者让模型一次性“凭记忆”生成 skill不如给 Agent 一个meta-skill让它在少量训练任务试错中自动探索、编写、部署、审计并迭代出一个可复用的领域 skill。这篇论文把 skill learning 从“写一段提示词”推进到“部署后看真实使用效果再修 skill 文档和代码”的在线学习流程。学习对象不是模型权重而是可以被 Claude Code、Codex 等 CLI-agent 直接加载的 skill artifact。二、研究背景与动机现在的 Agent skill 大多是静态资产要么由人类专家整理要么由模型根据预训练知识一次性生成。问题在于真实工作流往往很长尾某个 Excel 模板怎么填、某个项目 schema 怎么遵守、某个脆弱工具接口怎么调用这些知识很难完全靠模型参数记住。已有的自动化 skill 方法也有明显限制。Self-Gen 这类方法通常是“看任务说明一次性生成 skill”缺少真实反馈Trace2Skill、SkillRL 等方法虽然能从大量轨迹或跨任务经验中蒸馏技能但往往需要预先收集很多轨迹、搭建离线流水线成本更高。SkillEvolver瞄准的是一个更贴近部署的场景一个新任务来了只有少量训练变体可探索能不能在不微调模型的情况下把这些试错经验压缩成一个可移植的 skill三、核心方法详解SkillEvolver 不是一个新 Agent 框架而是一个meta-skill。它被普通 CLI-agent 加载之后不直接解决目标任务而是指导这个 Agent 去生成另一个领域专用 skill。图1 SkillEvolver meta-skill 部署结构图1SkillEvolver 的部署结构。左侧是被 CLI-agent 加载的 meta-skill中间是 SkillEvolver Agent 负责生成和优化领域 skill右侧是新的 Domain-Skill Agent 在验证任务中加载最终 skill。这个设计里有两个角色SkillEvolver Agent负责理解任务、设计探索策略、分析轨迹、修改 skill。Domain-Skill Agent像未来真实用户一样只拿到候选 skill 和任务然后实际执行。论文最关键的判断是skill 的质量不能只看作者 Agent 自己怎么想而要看另一个 fresh agent 真的加载它之后会怎么用。很多失败只会在“部署交接”时暴露例如 skill 写得看似完整但调用入口不明显导致使用者根本没有触发它或者文档里保留了训练样例里的常量验证集一换文件名就失败。图2 SkillEvolver 迭代循环图2SkillEvolver 的一次迭代。流程包括策略多样化探索、成功/失败轨迹对比、局部 patch skill、独立审计最后把通过审计的候选 skill 进入下一轮。具体来看一轮 SkillEvolver loop 包含四个关键步骤。1. 策略多样化探索每轮开始前SkillEvolver Agent 不只是调高采样温度而是显式写出 K 个不同高层策略。论文实验中 K4。策略差异可以体现在库选择、算法路线、参数推断方式、任务说明解释等维度。这样做的目的是避免四次 rollout 只是措辞不同、底层方案其实一样。2. 部署候选 skill 给 fresh agent 使用在第一轮还没有领域 skill 时系统会使用一个最小 skill 来分发策略。后续轮次中已有的候选 skill 会作为真实依赖交给 Domain-Skill Agent让它在训练任务上执行。也就是说SkillEvolver 不是在作者视角里自我反思而是在观察“别人用我写的 skill 会踩什么坑”。3. 成功/失败轨迹对比并局部更新系统比较高奖励和低奖励轨迹成功轨迹知道了什么、失败轨迹漏掉了什么在二值任务里就是 pass/fail 对比在 KernelBench 这类连续奖励任务里则比较 top 和 bottom 轨迹。得到的差异会被写成 skill 文档或辅助脚本的局部 patch而不是改模型参数。4. 独立 Auditor 审计候选 skill 生成后会交给一个干净上下文的 Auditor。Auditor 只看到候选 skill、任务说明、训练数据和带标签轨迹看不到验证集也看不到 SkillEvolver Agent 的私有推理。它检查 self-contained、是否硬编码训练常量、是否抽象出参数轴、主入口是否明显、是否存在 silent-bypass 等问题。这个 Auditor 很重要因为它把“会不会过拟合训练实例”和“会不会在真实部署时根本没被用上”放在同一个门控里。四、数据集与任务设置论文主要在两个 benchmark 上评估。SkillsBench原始包含 87 个任务论文使用其中 83 个有完整 no-skill 与 human-curated baseline 的任务覆盖 15 专业领域包括 Web development、data science、DevOps、chemistry、quantum computing、finance、document processing、security、scheduling 等。评价指标是 avg5即每个任务跑 5 次成功比例作为该任务分数。KernelBench论文选取 3 个 GPU kernel optimization 任务deepnarrowmlp、shufflenet、gru。这里不看 pass rate而看 correctness-weighted speedup错误 kernel 得 0正确 kernel 按相对 PyTorch 的加速比计分硬件为 NVIDIA H100。对比条件包括 No skill、Human-curated skill、Self-Gen、SkillCreator-SkillsBench、SkillEvolver R1 以及 SkillEvolver R2。R1 是没有第二轮 refinement 的消融版本R2 是完整的“部署后再观察再修正”版本。五、实验与评估先看主结果。图3 SkillEvolver 主实验结果图3主实验表。SkillEvolver R2 在 SkillsBench 83 个任务上达到56.9% avg5高于 No skill 的29.9%和 human-curated skill 的43.6%。最显眼的结果是SkillEvolver R2 的总体 avg5 为56.87%比 no-skill 高27.0 个百分点比人工 curated skill 高13.3 个百分点。R1 已经达到48.2%说明单轮探索和蒸馏已经有价值但第二轮 refinement 又带来约8.7 个百分点把领先人工 skill 的幅度从 4.6 扩大到 13.3。这说明论文的核心设计不是“让模型写一个更长的 skill”这么简单。真正贡献来自部署闭环先把候选 skill 交给 fresh agent 用再从使用失败中修正 skill。在 KernelBench 上SkillEvolver 也有正向迁移。R2 将三项任务的平均 speedup 从1.16提升到1.51。其中gru从1.326提升到2.226说明生成的 skill 不只是适用于二值 workflow也能捕捉到一些 GPU kernel 优化的程序性经验。再看成本和效率。图4 SkillEvolver 成本与效率图4成本与效率表。SkillEvolver R2 每任务成本为$3.92只比 R1 多8%但带来明显精度增益部署到验证侧时还减少 token、turn 和耗时。SkillEvolver R2 的每任务 authoring 成本约$3.92而 SkillCreator-SkillsBench 为$6.97。更有意思的是evolved skill 在验证侧让下游 agent 更省token 降低19.4%turn 降低15.3%wall-clock 降低23.8%。这代表 skill 不只是“增加一段上下文”而是在压缩任务执行路径。相反SkillCreator-SkillsBench 在验证侧 token 和 turn 反而增加说明一个自动写出来的 skill 如果没有部署反馈可能只是把额外文字塞给 agent并没有真正减少工作量。六、案例与可解释性分析论文把 SkillsBench 任务按 skill utility taxonomy 分成不同类别A 表示 no-skill 已经能做B1/B2/B3 表示 curated skill 分别有帮助、无明显影响、反而伤害C1/C2 表示 curated skill 强/弱解锁任务D 表示 no-skill 和 curated skill 都解决不了。图5 SkillEvolver 分类别表现图5按 skill utility 类别拆解。SkillEvolver 的最大收益集中在 curated skill 失效或伤害表现的区域例如 B3、C1 和 D。这个拆解很关键SkillEvolver 不是在所有任务上均匀提升而是在“人工 skill 不够好”的区域提升最明显。比如 D 类从 0 基线提升到0.40C1 类达到0.78B3 类也能在 curated skill 反而伤害表现时找回收益。附录中的任务级热图进一步说明了这种不均匀性。图6 SkillEvolver 任务级 Pass5 热图图683 个任务的 Pass5 热图。四列分别对应 No-Skill、Human Curated、SkillEvolver R1 和 SkillEvolver R2可以看到 R2 在大量低基线任务中打开了新的可解空间。论文还给出了一些代表性 case。正向案例包括✅manufacturing-fjsp-optimizationv1 skill 有子任务 recipe但没有把“一次性主操作”提升到最醒目的入口v2 通过 refinement 把 primary action hoist 到 skill 顶部任务从 0.2 提升到 1.0。✅paper-anonymizerv1 的 prose 方法对但辅助发现脚本没有打包进scripts/导致 agent 无法执行策略v2 保留 helper实现端到端完成。✅virtualhome-agent-planningv1 主体代码正确但 description 没有触发 Claude Code 的 skill 调用v2 改写 description显式命名任务和异常陷阱skill 调用率提升到 5/5。这些例子都指向同一件事Agent skill 的失败不一定是“知识错了”也可能是入口不明显、脚本没有暴露、训练常量没有抽象、或者文档结构让使用者绕过了关键步骤。SkillEvolver 的优势正是在这些部署层 failure mode 上有反馈闭环。七、总结SkillEvolver 的主要贡献可以概括为三点⭐把 skill learning 形式化为 artifact-level adaptation学习目标是 skill 文档、脚本和参考资料而不是模型权重。⭐提出部署驱动的 refinement loop候选 skill 必须被 fresh Domain-Skill Agent 实际使用失败轨迹再反过来修 skill。⭐引入独立 Auditor同时检查过拟合、硬编码、抽象不足、主入口缺失、silent-bypass 等内容级和部署级风险。从结果看SkillEvolver 在 83 个 SkillsBench 任务上超过 human-curated baseline并且在小规模 KernelBench probe 上也带来加速收益。更重要的是它展示了一种很实用的方向未来 Agent 的“经验”未必只能藏在模型参数里也可以沉淀成可检查、可版本化、可迁移的技能资产。八、不足与未来方向8.1 当前不足单一主模型配置主实验主要基于 Claude Opus 4.6 Claude Code。论文提到 GPT Codex spot test 能端到端运行但没有做大规模跨模型 sweep因此“agent-agnostic”更多是接口设计属性而非充分实验结论。迭代深度没有系统刻画论文只比较 R1 和 R2。第二轮贡献很大但 R3 或更深是否继续提升、是否会过拟合、成本曲线如何都还没有展开。benchmark 覆盖仍有限SkillsBench 是 83 个二值 workflow 任务KernelBench 只测了 3 个连续奖励任务。对于更复杂的多模态、长时程 web、企业软件环境结论还需要验证。单任务 skill 生命周期尚未解决SkillEvolver 每次面向一个新任务生成一个 skill但没有处理 skill library 的组织、去重、继承、版本管理以及跨任务迁移。8.2 未来研究方向更丰富的过程信号除了 pass/fail、token、turn、耗时还可以把 step-level verifier、intermediate grounding、关键路径延迟等信号纳入 contrastive update。跨任务 skill library如果多个任务生成了相似 skill如何合并、抽象父 skill、保留任务特化版本是自然的下一步。多 Agent / 多模型审计Auditor 当前是一个独立 fresh session未来可以研究多审计器投票、不同模型交叉审计降低单一模型盲点。从 skill 到软件工程资产既然 skill 包含 prose、scripts、references 和 examples它可以像代码一样被测试、lint、版本控制和持续集成。SkillEvolver 实际上把 Agent 经验管理推向了工程化。 延伸思考这篇论文最值得关注的地方不只是“自动写 skill 的效果更好”而是它把 Agent 能力增长从黑盒参数更新转成了白盒 artifact 演化。一个好的 skill 可以被人读、被审计、被 patch、被移植也可以在失败后精确定位责任。这可能会成为长尾企业工作流里比微调更轻、更快、更可控的一类适应方式。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

ADS8588S高精度同步ADC:多通道数据采集系统设计实战指南

ADS8588S高精度同步ADC:多通道数据采集系统设计实战指南

1. 项目概述:为什么我们需要ADS8588S这样的高精度同步ADC?在工业自动化、电力监控或者多相电机控制的项目里,我们工程师常常会遇到一个头疼的问题:如何同时、准确地捕捉多路快速变化的模拟信号?比如,你想监…

2026/7/24 11:20:49 阅读更多 →
AI驱动决策:企业智能体系统的架构与演进

AI驱动决策:企业智能体系统的架构与演进

1. 为什么企业决策正在从"经验主义"转向"AI驱动"去年参加行业峰会时,我注意到一个有趣现象:当讨论到市场策略时,传统企业高管们还在说"根据我20年经验...",而新兴企业的年轻CEO们已经在展示"我…

2026/7/24 11:20:49 阅读更多 →
Linux进程控制:从基础概念到高级实践

Linux进程控制:从基础概念到高级实践

1. 进程控制基础概念 在Linux系统中,进程控制是系统管理的核心技能之一。作为一个长期使用Linux的老用户,我发现很多新手对进程的理解还停留在"运行中的程序"这个层面,其实进程控制远不止这么简单。 进程本质上是操作系统进行资源…

2026/7/24 11:19:48 阅读更多 →

最新新闻

昇腾NPU与MindSpore框架的AI训练优化实践

昇腾NPU与MindSpore框架的AI训练优化实践

1. 项目背景与核心价值 在AI模型训练领域,框架与硬件的协同优化一直是提升效率的关键路径。华为昇腾NPU(Neural Processing Unit)作为专为深度学习设计的处理器,与MindSpore框架的深度结合,为开发者提供了从算法设计到…

2026/7/24 11:27:51 阅读更多 →
LMK61E0M DCXO模式实战:从PLL原理到70.656MHz时钟的无毛刺调频

LMK61E0M DCXO模式实战:从PLL原理到70.656MHz时钟的无毛刺调频

1. 项目概述与核心价值在高速数字系统、通信设备乃至精密测量仪器中,一个稳定、纯净且可编程的时钟源是系统正常工作的基石。无论是FPGA的逻辑同步、ADC/DAC的采样时钟,还是网络设备的时钟恢复,对时钟信号频率精度、相位噪声和抖动性能的要求…

2026/7/24 11:27:51 阅读更多 →
C++高并发数据流水线五大核心法则:从无锁设计到性能调优实战

C++高并发数据流水线五大核心法则:从无锁设计到性能调优实战

1. 项目概述:为什么我们需要重新审视C高并发数据流水线?如果你正在用C处理海量数据,比如实时日志分析、高频交易撮合,或者视频流处理,你大概率已经感受到了单线程的力不从心。数据像潮水一样涌来,传统的串行…

2026/7/24 11:27:51 阅读更多 →
小熊猫Dev-C++实战指南:从零配置到多文件项目开发

小熊猫Dev-C++实战指南:从零配置到多文件项目开发

1. 项目概述:为什么今天还要聊Dev-C? 如果你是一位刚接触编程的C/C新手,或者是一位需要给学生准备教学环境的老师,那么“Dev-C”这个名字你一定不陌生。它可能不是你听说过的第一个IDE,但很可能是你最早接触、也最容易…

2026/7/24 11:27:51 阅读更多 →
非侵入、纳秒级、跨芯片——ISDT 让电控系统的实时性问题不用再靠猜

非侵入、纳秒级、跨芯片——ISDT 让电控系统的实时性问题不用再靠猜

嵌入式软件,尤其是电控系统,有个共同的难点:让代码跑起来不难,难的是搞清楚它到底跑得好不好——快在哪、慢在哪、稳不稳。系统偶尔卡顿、响应变慢,到底是哪个任务、哪段代码多花了时间,靠日志和经验很难查…

2026/7/24 11:27:51 阅读更多 →
Transformer自注意力机制原理与工程实践

Transformer自注意力机制原理与工程实践

1. Transformer架构中的自注意力机制解析 2017年那篇《Attention Is All You Need》论文扔进NLP领域就像往池塘里丢了块巨石。当时我在做机器翻译项目,第一次看到完全基于注意力机制的模型架构时,整个人都是懵的。传统RNN那套序列处理方式突然被颠覆&…

2026/7/24 11:26:50 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻