当 Agent 的 SOP 也能被训练:skill.md 的自进化方法
最近看到一篇很有意思的论文讨论的是如何把 skills 作为对象去训练以实现自进化的效果。论文把 skill.md 当成 frozen agent 的外部状态靠 rollout、反思、文本编辑、验证集 gate 来持续优化。个人感觉整个过程有点像 Gradient Descent只不过是在文本空间里做的最后的产出是一份优化好的best_skill.md思路很有趣。01从人工文档到可训练对象过去做 Agent大家手里多多少少都攒着一堆说明文档CLAUDE.md、AGENTS.md、skill.md、system prompt、tool usage guide、各种 domain SOP基本都靠人工经验写。写得好 Agent 就稳健一点写得差就会在同一个地方反复犯错然后继续手工调整打补丁。SkillOpt 的关键变化在于它把这类文档从人工经验产物变成了可以训练的对象。skill.md 在 Agent 系统里成为一个可优化、可验证、可迁移的工程 artifact。论文里的 skill 是一份自然语言策略文档。在 direct chat 场景下它会插进 system 或 developer instruction在 Codex、Claude Code 这类 harness 里更像一份持久的 procedural memory。SkillOpt 关心的说白了就是Agent 应该怎么干活。这篇论文很容易被误读成又一个 prompt optimization 方法但我觉得重点不在这儿。Prompt optimization 优化的是一段 promptSkillOpt 优化的是一份更稳定的 procedural artifact。这份 artifact 里沉淀的是 Agent 的执行经验比如做表格任务时先检查 workbook 结构和公式做文档问答时先定位视觉表格的行列字段这些规则是人类专家反复踩坑后总结出来的 SOP。所以 SkillOpt 优化的是 Agent 的外部 policy layer。论文也强调SkillOpt 部署出来的就是一份紧凑的best_skill.md大约 300 到 2000 tokens目标模型和 harness 都保持不变。02SkillOpt 是怎么工作的可以先看一个简化流程。是否当前 skill 文档冻结目标模型执行任务产生 rollout 轨迹记录成功、失败、工具调用、最终答案和评分Optimizer Model 分析轨迹提出 add / delete / replace 文本编辑根据 edit budget 限制修改幅度生成候选 skill验证集分数是否提升接受修改更新 best_skill.md拒绝修改写入 rejected-edit buffer整个过程有点像训练模型但训练对象是文本。论文把它叫text-space optimizer for agent skills。目标模型冻结不动另一个 optimizer model 看带分数的执行轨迹提出受控的 skill 编辑。只有候选 skill 在 held-out validation set 上严格提升修改才会被接受。里面有几个设计值得拆开看。修改是 bounded 的。Optimizer 不能随便重写整份 skill只能通过 add、delete、replace 这类结构化编辑来改。有一个 textual learning rate论文叫 edit budget控制每一步最多接受多少条编辑。这个挺重要——一次改太多skill 很容易被改坏把已经有效的规则覆盖掉。每次修改都要在验证集上跑分数没提升就拒绝。被拒的修改也不会直接扔掉会进入 rejected-edit buffer 当负反馈提醒 optimizer 哪些修改看起来合理但实际会伤。最后还有一个 epoch-wise 的 slow / meta update负责总结跨 epoch 的长期规律比如哪些编辑确实有用、哪些失败一直存在、哪些能力已经稳定了。这个 meta 信息只在训练阶段用不会跟着最终 skill 一起部署。整个过程停下来是不是很像 Gradient Descent?03实验效果与迁移能力论文在 6 个 benchmark、7 个 target model、3 种 harness 上做了实验。Benchmark 包括 SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench 和 ALFWorld执行方式包括 direct chat、Codex harness 和 Claude Code harness。作者论文中提到在论文设定的对齐评测协议下SkillOpt 相比 no-skill、human-skill、one-shot LLM skill、Trace2Skill、TextGrad、GEPA、EvoSkill 等 baseline取得 best 或 tied-best。总体而言GPT-5.5 direct chat 提升 23.5 个点Codex agentic loop 提升 24.8 个点Claude Code 提升 19.1 个点。单项任务上程序性越强的任务提升越明显。GPT-5.5 direct chat 下数据来自论文表格。SpreadsheetBench 和 OfficeQA 提升非常大这其实跟实际经验也对得上越是需要工具操作、状态管理、格式约束和多步验证的任务越依赖稳定的 procedural skill。不过我觉得 SkillOpt 最有应用价值的地方是它训出来的 skill 可以迁移。论文里做了三类迁移实验跨模型迁移。在 GPT-5.4 上训出的 SpreadsheetBench skill 迁到更小的 GPT 变体上仍然有收益。跨 harness 迁移。在 Codex loop 中训出的 spreadsheet skill 迁到 Claude Code 后带来 59.7 个点的提升。跨 benchmark 迁移。从 OlympiadBench 学到的数学 skill 迁到 Omni-MATH 上仍有正收益。这至少支持了论文的判断SkillOpt 学到的不只是单题答案而是一部分可复用的 procedural knowledge。这点对工程落地很重要因为企业内部经常有大量相似任务——不同部门的报表处理、不同格式的合同审阅、不同产品线的知识库问答。skill 能迁移就有机会先在一个相对标准化的环境里训出稳定 SOP再迁到相近场景做小规模验证和调整。04限制最直接的限制之一是它依赖可评分环境。SkillOpt 需要 validation gate也就是你得知道候选 skill 是不是真的变好了。在 SearchQA、SpreadsheetBench、OfficeQA 这类任务里可以用 exact match、hard score 或 benchmark-specific scorer——论文也明确说实验用的是各 benchmark 的 native hard score 或 exact-match accuracy。但开放任务里事情会复杂很多。写一篇文章、做一次市场研究、生成一个产品方案更好是什么这种场景不是不能做 SkillOpt但 validation gate 会成为真正的难点可能需要拼人工反馈、偏好模型、rubric、pairwise comparison甚至多层 verifier。训练成本也不低。部署时只要一份best_skill.md但训练阶段要大量 rolloutoptimizer model 也要反复分析轨迹和提出修改。论文也报告了不同任务的训练 token 开销差异。它目前主要优化单个 domain skill。如果未来 Agent 面对的是开放世界任务可能需要 skill library、skill routing、multi-skill composition。05工程影响与展望下面更多是我基于论文结果做的工程化思考和推断。很多 Agent 失败并不是因为模型完全不知道答案而是执行流程不稳定会忘记检查工具结果会在多步任务里重复访问已处理过的状态会输出看起来合理但没经过验证的答案。这类问题很难靠换更大的模型解决因为问题不在知识层而在执行层。企业 SOP 有了新的迭代路径。以前 SOP 是给员工看的操作手册以后可能要兼顾 Agent——甚至先给 Agent 训好再让人去 review。而且这不是一次性的可以跟着真实任务的反馈持续迭代不再依赖工程师手工打补丁。skill 会成为可审计的团队资产。模型权重很难审计但best_skill.md是一份文本——可以 review可以版本管理可以回滚也可以在团队之间共享。过去那些沉在个别工程师脑子里的调试经验有机会变成可传递的工程产物。模型升级时的执行能力保留。底层模型升级是常态每次换模型之前积累的调优经验往往要重新验证一遍。如果执行经验沉淀在 skill 文档里换模型时至少有一个明确起点而不是从零摸索。迁移实验也已经表明这条路是走得通的。受监管场景的合规价值。在金融、医疗、法律等受监管场景里这种文本化 skill 至少提供了一个更容易审计和版本追溯的入口。但它不能替代完整的合规验证仍需要任务级评测、人工审核和运行日志留痕。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

C++无锁环形队列实现:SPSC高性能并发数据结构详解

C++无锁环形队列实现:SPSC高性能并发数据结构详解

1. 项目概述:为什么我们需要无锁环形队列?在并发编程的世界里,数据共享和同步是永恒的主题。想象一下,你正在开发一个高性能的服务器程序,比如一个实时音视频流处理服务,或者一个高频交易系统。成千上万的请…

2026/7/24 7:16:24 阅读更多 →
嵌入式系统固件更新:基于I2C的TPS6598x PD控制器安全升级方案

嵌入式系统固件更新:基于I2C的TPS6598x PD控制器安全升级方案

1. 项目概述在硬件开发,尤其是涉及USB Type-C和Power Delivery(PD)的系统中,固件更新能力是产品生命力的核心。想象一下,你的产品已经出货到全球用户手中,这时USB-IF发布了新的PD协议规范,或者发…

2026/7/24 7:16:24 阅读更多 →
基于YOLOv8的道路坑洼实时检测系统开发指南

基于YOLOv8的道路坑洼实时检测系统开发指南

## 1. 项目概述:道路坑洼检测的AI解决方案道路坑洼检测一直是市政维护和交通安全领域的痛点问题。传统人工巡检方式效率低下且成本高昂,特别是在大面积路网中难以实现全覆盖监测。我们基于YOLOv8深度学习框架开发的这套系统,能够通过普通监控…

2026/7/24 7:16:24 阅读更多 →

最新新闻

智能理赔系统AegisAgent的技术架构与优化实践

智能理赔系统AegisAgent的技术架构与优化实践

1. 项目背景与核心价值在保险科技领域,理赔环节的效率和服务体验一直是行业痛点。传统理赔流程中,客户需要提交大量纸质材料,人工审核周期长,纠纷处理效率低下。AegisAgent正是为解决这些问题而生的智能理赔解决方案,它…

2026/7/24 7:24:27 阅读更多 →
AI如何破解学术审稿意见的潜台词

AI如何破解学术审稿意见的潜台词

1. 项目概述:AI如何破解审稿意见的"潜台词"科研论文投稿过程中,最让作者头疼的莫过于收到审稿人那些看似刁钻、充满潜台词的修改意见。传统应对方式往往依赖导师经验或同行讨论,但如今AI技术正在改变这一局面。我最近深度测试了一款…

2026/7/24 7:24:27 阅读更多 →
Agent Skills与传统API及低代码平台的技术对比与应用

Agent Skills与传统API及低代码平台的技术对比与应用

1. Agent Skills技术方案概述Agent Skills作为一种新兴的AI能力封装范式,正在重塑我们构建智能应用的方式。不同于传统API的刚性调用方式,Skills将特定领域的专业知识、工作流程和交互模式打包成可复用的功能模块。以Claude平台为例,开发者既…

2026/7/24 7:24:27 阅读更多 →
YOLOv11结合AKConv的轻量化目标检测实践

YOLOv11结合AKConv的轻量化目标检测实践

1. 项目概述:当YOLOv11遇上AKConv的轻量化革命在目标检测领域,YOLO系列算法始终保持着迭代速度与工程落地的双重优势。最新发布的YOLOv11在保持实时性的基础上,通过引入AKConv(Adaptive Kernel Convolution)变核卷积技…

2026/7/24 7:24:27 阅读更多 →
AI时代编程范式转型:从代码工人到智能架构师

AI时代编程范式转型:从代码工人到智能架构师

1. 从代码工人到智能架构师的范式转移2023年GitHub统计显示,Copilot等AI编程工具已帮助开发者完成46%的代码量。但真正的变革不在于辅助写代码,而在于编程范式的根本重构。当我在设计分布式AI系统时突然意识到:我们正在从"语法正确性检查…

2026/7/24 7:24:27 阅读更多 →
TPS65810/11 I2C通信与寄存器配置实战指南

TPS65810/11 I2C通信与寄存器配置实战指南

1. 项目概述与I2C协议基础在嵌入式硬件开发,尤其是涉及复杂电源管理的系统中,与电源管理芯片(PMIC)的可靠通信是项目成败的关键一环。TPS65810和TPS65811是德州仪器(TI)推出的两款高度集成的电源管理单元&a…

2026/7/24 7:23:26 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻