最近看到一篇很有意思的论文讨论的是如何把 skills 作为对象去训练以实现自进化的效果。论文把 skill.md 当成 frozen agent 的外部状态靠 rollout、反思、文本编辑、验证集 gate 来持续优化。个人感觉整个过程有点像 Gradient Descent只不过是在文本空间里做的最后的产出是一份优化好的best_skill.md思路很有趣。01从人工文档到可训练对象过去做 Agent大家手里多多少少都攒着一堆说明文档CLAUDE.md、AGENTS.md、skill.md、system prompt、tool usage guide、各种 domain SOP基本都靠人工经验写。写得好 Agent 就稳健一点写得差就会在同一个地方反复犯错然后继续手工调整打补丁。SkillOpt 的关键变化在于它把这类文档从人工经验产物变成了可以训练的对象。skill.md 在 Agent 系统里成为一个可优化、可验证、可迁移的工程 artifact。论文里的 skill 是一份自然语言策略文档。在 direct chat 场景下它会插进 system 或 developer instruction在 Codex、Claude Code 这类 harness 里更像一份持久的 procedural memory。SkillOpt 关心的说白了就是Agent 应该怎么干活。这篇论文很容易被误读成又一个 prompt optimization 方法但我觉得重点不在这儿。Prompt optimization 优化的是一段 promptSkillOpt 优化的是一份更稳定的 procedural artifact。这份 artifact 里沉淀的是 Agent 的执行经验比如做表格任务时先检查 workbook 结构和公式做文档问答时先定位视觉表格的行列字段这些规则是人类专家反复踩坑后总结出来的 SOP。所以 SkillOpt 优化的是 Agent 的外部 policy layer。论文也强调SkillOpt 部署出来的就是一份紧凑的best_skill.md大约 300 到 2000 tokens目标模型和 harness 都保持不变。02SkillOpt 是怎么工作的可以先看一个简化流程。是否当前 skill 文档冻结目标模型执行任务产生 rollout 轨迹记录成功、失败、工具调用、最终答案和评分Optimizer Model 分析轨迹提出 add / delete / replace 文本编辑根据 edit budget 限制修改幅度生成候选 skill验证集分数是否提升接受修改更新 best_skill.md拒绝修改写入 rejected-edit buffer整个过程有点像训练模型但训练对象是文本。论文把它叫text-space optimizer for agent skills。目标模型冻结不动另一个 optimizer model 看带分数的执行轨迹提出受控的 skill 编辑。只有候选 skill 在 held-out validation set 上严格提升修改才会被接受。里面有几个设计值得拆开看。修改是 bounded 的。Optimizer 不能随便重写整份 skill只能通过 add、delete、replace 这类结构化编辑来改。有一个 textual learning rate论文叫 edit budget控制每一步最多接受多少条编辑。这个挺重要——一次改太多skill 很容易被改坏把已经有效的规则覆盖掉。每次修改都要在验证集上跑分数没提升就拒绝。被拒的修改也不会直接扔掉会进入 rejected-edit buffer 当负反馈提醒 optimizer 哪些修改看起来合理但实际会伤。最后还有一个 epoch-wise 的 slow / meta update负责总结跨 epoch 的长期规律比如哪些编辑确实有用、哪些失败一直存在、哪些能力已经稳定了。这个 meta 信息只在训练阶段用不会跟着最终 skill 一起部署。整个过程停下来是不是很像 Gradient Descent?03实验效果与迁移能力论文在 6 个 benchmark、7 个 target model、3 种 harness 上做了实验。Benchmark 包括 SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench 和 ALFWorld执行方式包括 direct chat、Codex harness 和 Claude Code harness。作者论文中提到在论文设定的对齐评测协议下SkillOpt 相比 no-skill、human-skill、one-shot LLM skill、Trace2Skill、TextGrad、GEPA、EvoSkill 等 baseline取得 best 或 tied-best。总体而言GPT-5.5 direct chat 提升 23.5 个点Codex agentic loop 提升 24.8 个点Claude Code 提升 19.1 个点。单项任务上程序性越强的任务提升越明显。GPT-5.5 direct chat 下数据来自论文表格。SpreadsheetBench 和 OfficeQA 提升非常大这其实跟实际经验也对得上越是需要工具操作、状态管理、格式约束和多步验证的任务越依赖稳定的 procedural skill。不过我觉得 SkillOpt 最有应用价值的地方是它训出来的 skill 可以迁移。论文里做了三类迁移实验跨模型迁移。在 GPT-5.4 上训出的 SpreadsheetBench skill 迁到更小的 GPT 变体上仍然有收益。跨 harness 迁移。在 Codex loop 中训出的 spreadsheet skill 迁到 Claude Code 后带来 59.7 个点的提升。跨 benchmark 迁移。从 OlympiadBench 学到的数学 skill 迁到 Omni-MATH 上仍有正收益。这至少支持了论文的判断SkillOpt 学到的不只是单题答案而是一部分可复用的 procedural knowledge。这点对工程落地很重要因为企业内部经常有大量相似任务——不同部门的报表处理、不同格式的合同审阅、不同产品线的知识库问答。skill 能迁移就有机会先在一个相对标准化的环境里训出稳定 SOP再迁到相近场景做小规模验证和调整。04限制最直接的限制之一是它依赖可评分环境。SkillOpt 需要 validation gate也就是你得知道候选 skill 是不是真的变好了。在 SearchQA、SpreadsheetBench、OfficeQA 这类任务里可以用 exact match、hard score 或 benchmark-specific scorer——论文也明确说实验用的是各 benchmark 的 native hard score 或 exact-match accuracy。但开放任务里事情会复杂很多。写一篇文章、做一次市场研究、生成一个产品方案更好是什么这种场景不是不能做 SkillOpt但 validation gate 会成为真正的难点可能需要拼人工反馈、偏好模型、rubric、pairwise comparison甚至多层 verifier。训练成本也不低。部署时只要一份best_skill.md但训练阶段要大量 rolloutoptimizer model 也要反复分析轨迹和提出修改。论文也报告了不同任务的训练 token 开销差异。它目前主要优化单个 domain skill。如果未来 Agent 面对的是开放世界任务可能需要 skill library、skill routing、multi-skill composition。05工程影响与展望下面更多是我基于论文结果做的工程化思考和推断。很多 Agent 失败并不是因为模型完全不知道答案而是执行流程不稳定会忘记检查工具结果会在多步任务里重复访问已处理过的状态会输出看起来合理但没经过验证的答案。这类问题很难靠换更大的模型解决因为问题不在知识层而在执行层。企业 SOP 有了新的迭代路径。以前 SOP 是给员工看的操作手册以后可能要兼顾 Agent——甚至先给 Agent 训好再让人去 review。而且这不是一次性的可以跟着真实任务的反馈持续迭代不再依赖工程师手工打补丁。skill 会成为可审计的团队资产。模型权重很难审计但best_skill.md是一份文本——可以 review可以版本管理可以回滚也可以在团队之间共享。过去那些沉在个别工程师脑子里的调试经验有机会变成可传递的工程产物。模型升级时的执行能力保留。底层模型升级是常态每次换模型之前积累的调优经验往往要重新验证一遍。如果执行经验沉淀在 skill 文档里换模型时至少有一个明确起点而不是从零摸索。迁移实验也已经表明这条路是走得通的。受监管场景的合规价值。在金融、医疗、法律等受监管场景里这种文本化 skill 至少提供了一个更容易审计和版本追溯的入口。但它不能替代完整的合规验证仍需要任务级评测、人工审核和运行日志留痕。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】