Agent不只进化技能,还开始进化“如何进化”
许多自我改进 agent 会根据失败轨迹重写 task skill但诊断、检索、分配搜索预算和执行编辑的流程通常预先写死。MetaSkill-Evolve把这套“如何改进”的规则也做成可编辑的文件五个 agent 共用冻结的 Gemma-4 31B不做微调只在 task skill 与分支本地 meta-skill 两个时间尺度上迭代。OfficeQA 的留出测试准确率从无 skill 的 31.78% 升至 55.32%增加23.54 个百分点。这一结果来自三个 benchmark 的受控实验并不等于 agent 已具备无边界的自我进化能力。[图1agent skill 改进的四种模式]展示了从无 skill、静态 skill、单层进化到 MetaSkill-Evolve 的四种设置前三种要么不进化要么只进化 task skill 而固定改进方法MetaSkill-Evolve 则在分支层面配置包含五个组件的 meta-skill用同一个五 agent 流水线同时改写 task skill 和 meta-skill。瓶颈进化了半天进化的方式却没进化过在配备外部 skill 的 agent 系统中一个常见做法是闭环改进agent 执行任务记录失败轨迹再启动分析、提议、执行的流水线重写 skill 文件。EvoSkill、GEPA、SkillWeaver 等系统都沿用了这一路径让 task skill 从 s₀ 进化到 s₁、s₂。但深究这些系统会发现两个被混为一谈的量。第一个是当前技能的效用U(s)即这个skill在验证集上的得分。第二个是元生产力P(m|s)即沿着当前分支的改进策略m这个分支能多稳定地产生更强的后代。两者并不等价一个今天分数很高的skill可能在一个元策略已经枯竭的分支里存在后续迭代再也生不出更好的子代一个目前分数平平的skill却可能因为配了一套特别擅长处理逻辑错误的改进策略反而是一条更值得深入探索的路线。MetaSkill-Evolve 把只优化 U(s) 而不更新 P(m|s) 视为固定元流程的局限遇到反复出现、现有诊断方式处理不好的失败时分支无法调整自己的改进规则。这里是该方法的设计动机而非对所有既有系统实际表现的普遍判定。五个 Markdown 文件如何同时改 task skill 和 meta-skillMetaSkill-Evolve 为每个进化分支引入分支本地的 meta-skill m与 task skill s 共同构成状态 b(s,m,h)。m 不是模型配置而是五个 Markdown 文件m(ψ, σ, α, π, ε)分别约束改进流水线的一个环节ψ是诊断策略驱动Analyzer agent对失败轨迹打标签和写分析σ是共享策略决定Retriever agent如何跨分支检索有价值的灵感α是分配策略让Allocator agent根据近期进展动态决定每轮生成多少个子代候选π是编辑提案例策略为Proposer agent提供如何将诊断转化为具体文本编辑的规范ε是执行策略指导Evolver agent将提案写入磁盘并验证结果。这五个文件与 task skill 文件格式相同都是 agent 可读取的 SKILL.md 文档。因此驱动 task skill 进化的五个 agent即 Analyzer、Retriever、Allocator、Proposer、Evolver也可以用同一条流水线改写 meta-skill 文件。快速循环每轮选取一个前沿父分支用当前 meta-skill m 驱动 task skill s 的一次进化慢速循环每隔 H 轮才触发汇总最近 H 个后代的元生产力估计 P̂(m|s) 与失败标签构造“元失败轨迹”再将五 agent 流水线作用到五个 meta-skill 文件上。这是一层有界递归改进规则进入与 task skill 相同的迭代闭环但没有再引入“元-元 skill”五 agent 的角色和连接关系保持固定也没有增加模型或目标函数。更关键的是分支之间不是孤立进化的。当一个分支在诊断算术错误方面逐渐形成更精细的标签体系时另一个分支可以通过跨分支检索共享到这一经验。元技能并不全局统一每个分支携带亲系本地的改进策略只在灵感检索时相互渗透这让不同分支的“改进风格”可以分化——一个分支可能发展出针对表格抽取失败的大幅重写风格另一个则培养出针对算术推理的保守增量修改风格。[图2系统概览]展示了分支状态如何进入五 agent 流水线输出如何写回 SQLite 节点图以及前沿选择如何从图中提取下一个父节点。前沿选择不只选分数高的更选“还能继续变强”的如果只按当前任务技能分数选父分支搜索很快会锁死在得分高但后代已经停滞的节点上。MetaSkill-Evolve的前沿选择使用复合评分η₁Uᵥ η₂P̂ᵥ η₃Nᵥ。第一项是当前技能效用鼓励利用已验证的好方案第二项是元生产力估计值把计算资源引向那些还能稳定产出有效后代的分支即使其当前技能分数不是最高第三项Nᵥ 1/(1已选次数)是一个访问冷却项——一个被反复选中的节点必须比未被选中的同级节点表现显著更好才能再次被选这防止了预算被某个高分支垄断。三项平衡的结果是用质量-多样性的方式保持探索的广度而不依赖预设的谱系过滤规则。进入档案库的每个节点必须严格满足∆U 0——只有后代在验证集上比父代有净增益才具备作为未来父分支的资格。分数持平或退化的子代虽然不进入候选池但仍保留在进化DAG中供检索器读取这意味着一个失败的编辑仍然可以作为“反面教材”被未来的提案器引用。实验三个基准两次跃升单一模型撑起全局实验覆盖了OfficeQA、SealQA和ALFWorld三个能力取向不同的agent基准。所有五个流水线agent共用一个完全冻结的Gemma-4 31B骨干模型不存在任何微调或模型容量扩充。[表1主要结果]展示了四个条件下三个基准的留出测试准确率。单层进化和MetaSkill-Evolve在OfficeQA和SealQA上分别相对无技能基线大幅提升且元技能进化环节带来了额外的增益。在OfficeQA上四个条件——无技能、静态技能、单层进化、MetaSkill-Evolve——的留出测试准确率依次是31.78%、36.09%、48.94%、55.32%。每一步都是净增益配备静态skill提升了4.31个百分点单层进化在此基础上再提12.85个百分点而开启慢速循环进行元技能进化又追加了6.38个百分点。端到端相对无技能的提升幅度达到23.54个百分点。SealQA上的轨迹类似无技能29.17%、静态29.41%、单层37.21%、MetaSkill-Evolve45.26%。元技能进化环节单独贡献了8.05个百分点。三个评价点的单调递增表明从“有技能”到“进化技能”再到“进化进化方法”每个设计决策都产生了独立的收益。ALFWorld 呈现的是另一种情况。Gemma-4 31B 在无 skill 条件下已达到 92.31% 的成功率静态 skill 回落至 90.38%单层进化恢复到 92.31%MetaSkill-Evolve 达到94.23%。绝对增益只有 1.92 个百分点。该论文的消融中冻结慢速循环或移除跨分支检索都会回到 92.31%因此在这项任务和这组设置下慢速循环与跨分支共享解释了这部分增益这不能外推为接近性能上限时唯一有效的优化方式。[图3三个基准上的端到端留出测试准确率]柱状图对比了无技能、静态技能、单层进化和MetaSkill-Evolve在三个基准上的表现红色标注为相对于无技能的增益幅度OfficeQA和SealQA的增量最为突出。拿走一个组件暴露每种技能权重消融实验进一步揭示五个元技能组件的角色在不同领域间发生了明显转移。在OfficeQA上分配策略α是核心——移除α准确率从55.32%骤降到35.58%降幅接近20个百分点。OfficeQA的失败分布中包含关联的算术错误群α决定在经历过停滞时扩大每轮子代预算是产生一个成功候选孩子的先决条件。编辑提案策略π的贡献紧随其后移除π后降幅达17.7个百分点。在SealQA上核心却转移到了编辑提案策略π——去掉π使准确率从45.26%跌至36.84%降幅超过8个百分点。密封性问题的增益依赖于每一条编辑的具体内容和准确性而不在于候选数量的多寡。ALFWorld 上同样由 π 占主导移除后准确率从 94.23% 降至 86.54%仅移除跨分支检索则回到单层进化基线 92.31%。这组消融说明在该设置下跨分支共享是 MetaSkill-Evolve 相对单层进化的关键增益来源且其效果需要检索策略 σ 与提案策略 π 配合。[图4在两个QA基准上的组件消融]蓝色多边形展示了移除诊断策略ψ、检索策略σ、分配策略α或提案策略π后准确率的退化幅度虚线环为完整MetaSkill-Evolve和静态技能的参考水平。元更新频率的敏感性也值得注意。将慢速循环的触发间隔H从2扩大到4再到8保持元更新总次数不变OfficeQA的准确率从48.94%先跌到41.35%再滑落到39.84%对陈旧元策略的容忍度极低SealQA和ALFWorld在H2和4时基本持平直到H8才出现轻微下滑。每2轮触发一次慢循环是跨三个基准的最佳选择更宽的间隔容易让元技能的批量改写覆盖掉快速循环中已经自行修复的有效编辑。这套框架不是无界递归的通用自我改进引擎。它只进化一层 meta-skill不进化五 agent 流水线自身的角色分工和连接关系实验也只覆盖三个特定 benchmark。更开放、周期更长、反馈更嘈杂的真实任务是否仍能复现这些收益原文没有给出证据。ALFWorld 的 1.92 个百分点增益提示当基座模型在某任务上已接近该测试集的上限可供 skill 进化挖掘的空间会很小。价值在于把改进行为拆成两层agent 学会做什么与 agent 调整如何改进自己可以复用相同的数据结构、模型和流水线只是运行在不同时间尺度、使用不同的选择信号。对需要维护 skill 演化流程的工程团队而言更值得验证的是这套分层能否在自己的任务、预算与反馈噪声下稳定复现而不是把三个 benchmark 的结果直接当作通用结论。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

XPINN框架:物理信息神经网络的域分解优化实践

XPINN框架:物理信息神经网络的域分解优化实践

1. 项目概述:当神经网络遇上物理方程在科学计算领域,物理信息神经网络(PINN)近年来已成为解决偏微分方程的热门工具。但传统PINN面临一个致命瓶颈——当计算域复杂度升高或时空尺度跨度较大时,单个网络的表达能力会急剧…

2026/9/23 16:24:16 阅读更多 →
Sora 2 AI视频生成核心技术解析与实践指南

Sora 2 AI视频生成核心技术解析与实践指南

1. Sora 2 核心能力解析Sora 2作为新一代AI视频生成工具,其核心突破在于实现了三个维度的技术跃迁。首先是多模态理解能力,模型能够同时解析文本、图像甚至音频输入,构建统一的语义表征空间。我们实测发现,当输入"落日余晖下…

2026/9/24 15:16:50 阅读更多 →
链式思考与AI原生应用:下一代智能系统构建指南

链式思考与AI原生应用:下一代智能系统构建指南

1. 链式思考与AI原生应用的融合趋势最近半年,我观察到技术社区里关于"链式思考"(Chain-of-Thought)的讨论越来越多。这种让AI像人类一样逐步推理的思维方式,正在与AI原生应用产生奇妙的化学反应。作为在AI领域摸爬滚打多…

2026/9/22 2:12:49 阅读更多 →

最新新闻

本地私有RAG从零搭建全复盘:架构选型、文档切块与向量化实践

本地私有RAG从零搭建全复盘:架构选型、文档切块与向量化实践

1. 为什么做本地私有RAG,以及这篇复盘会讲什么最近我花了两周时间,从零搭了一套“本地私有RAG”出来。起因其实特别朴素:公司内部有一堆产品手册、FAQ、解决方案文档,散落在各个共享盘和协作工具里,业务同事每次找资料…

2026/9/24 20:11:33 阅读更多 →
CodeBuddy CLI实战:从安装到自动化编程的完整指南

CodeBuddy CLI实战:从安装到自动化编程的完整指南

这是你第一次在终端里敲下一个叫codebuddy的命令,然后看着整个屏幕被一个陌生又熟悉的对话界面接管。熟悉是因为它像极了这两年火起来的 Claude Code、Codex CLI 那一挂东西;陌生是因为你还没有真正让它在你的项目里干过活。我最初抱着"又一个套壳 …

2026/9/24 20:11:33 阅读更多 →
大模型推理性能基准测试实战:Prefill与Decode拆分评测指南

大模型推理性能基准测试实战:Prefill与Decode拆分评测指南

刚开始看到CS336HW2 - Part1 benchmark这个题目时,我第一反应是:这不就是跑个脚本测一下速度吗?但真正动手做下来才发现,一个看似常规的“benchmark”任务,背后牵扯到对整个推理流程的理解、性能指标的选取、甚至是对课…

2026/9/24 20:11:33 阅读更多 →
云原生数据仓库选型避坑指南:AnalyticDB、Redshift、Snowflake、ClickHouse实战对比

云原生数据仓库选型避坑指南:AnalyticDB、Redshift、Snowflake、ClickHouse实战对比

1. 云原生数据仓库选型:不是比谁功能多,而是看谁扛得住真实业务的“暴击”你手里的报表系统凌晨三点崩了,DBA被电话叫醒,发现是某张宽表JOIN耗尽内存;你刚上线的实时风控模型延迟飙升到8秒,下游告警邮件刷屏…

2026/9/24 20:11:33 阅读更多 →
MySQL入门必备:从关系模型到建库建表与SQL基础实操指南

MySQL入门必备:从关系模型到建库建表与SQL基础实操指南

1. 第一章前两节到底在学什么1.1 整体学习路径与章节安排这份笔记记于2026年3月2日,对应教材第一章的前两节内容。从标题就能看出,这是典型的MySQL入门第一课,目标群体是刚接触数据库的同学,或者工作中需要补数据库基础的开发人员…

2026/9/24 20:11:33 阅读更多 →
从设计到落地:手把手教你写一个好用的Agent Skill

从设计到落地:手把手教你写一个好用的Agent Skill

写 Agent Skill 这事儿,我从去年开始反复折腾。先说结论:好用的 Skill 不是“一段能跑的脚本”,而是一套把边界、输入输出、错误处理、提示词节奏都提前定义好的小系统。Model 再聪明,也扛不住糊里糊涂的调用方式,真正…

2026/9/24 20:10:32 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →