❝先说结论递归自我改进Recursive Self-ImprovementRSI现在不是AI 自己变强这一件事而是四条性质完全不同的回路叠在一起——改输出、改脚手架、改权重、改什么叫好。前三条都在推进第四条几乎没人认真做而恰恰是第四条决定了前面三条最终会把系统推向哪里。本文分四块往下走1、先把 RSI 这个词做一次归约说清楚市面上十几篇自我进化论文分别改的是哪一层解答为什么大家嘴里的 RSI 不是同一个东西2、拆目前最硬的一次实测——AI4AI-Bench 把AI 能不能自己设计训练算法量化成了一个 0.166 的均值解答RSI 离落地还有多远3、把脚手架自演化这条最热的路线盘一遍从 Darwin Gödel Machine 的 20%→50%到 Huxley-Gödel Machine 的元生产力—性能错配再到 RRSI 的 14.1 / 4.7 这组不对称数字4、落到评测器这一层——Red Queen Gödel Machine 和 2026 年三起真实失守事故都指向同一个结论。一个人进步最快的时刻往往不是能力突然变强的时候而是给自己换了一个更诚实的评分标准的时候。一、先消歧RSI 不是一件事是四层归约先说一个误区。很多讨论把模型多试几次、自己改改答案、分数涨了叫自我改进。这不是。一个模型收到错误提示后第二次答得更好它的权重没变、架构没变、提示没变——它只是上下文里多了点信息。真正的自我改进必须修改某种持久的东西代码、提示、记忆、工具选择、架构或者训练数据。而且这个修改必须活过当前这一轮。这个边界2026 年 7 月的综述《Self-Improvements in Modern Agentic Systems: A Survey》arXiv:2607.13104给了一个很好用的形式化❝智能体A (θ, Σ)—— θ 是基础模型参数Σ 是操作脚手架提示词、记忆、工具、控制逻辑。 自我改进 一个自诱导的更新算子self-induced update operator它获取并提交对 θ 或 Σ 的更新。核心点出来了这个框架里改 Σ和改 θ是两条完全不同的路速度和代价差一个数量级。改 θ 慢、持久、贴近训练改 Σ 快、便宜、可回滚。综述统计的两侧论文数也很说明问题——基础模型改进73 篇脚手架改进166 篇后者是前者的两倍多其中记忆 61 篇、工具 50 篇、提示词 37 篇、全脚手架自修改代码18 篇。这个数字本身就是判断当下真正热闹的是脚手架不是权重。而全脚手架那 18 篇——也就是允许 agent 重写自己的运行逻辑——才是通向 RSI 的那道窄门体量却最小。再把改什么和什么时候改叠加会得到一张更清楚的图。另一篇综述《Self-Improvement of Large Language Models: A Technical Overview and Future Outlook》arXiv:2603.25681TMLR survey certified把自我改进画成一个四阶段闭环数据获取 → 数据筛选 → 模型优化 → 推理精炼外面套一层自主评估。这条闭环的每一环都可能出问题论文自己列了四个模型崩溃model collapse、奖励作弊reward hacking、自我偏好self-preference、对齐失效alignment failure。注意最后一个——**越自我改进反而越偏离目标不是一个猜测是这篇综述单列出来的一类失败模式。**这一点尤其要注意后面第四节会看到它的实际形态。所以合起来我把它归约成四层L0 输出层改答案不动任何持久状态。时延秒级完全可回滚证据强度最弱——严格说不算 RSI但它是绝大多数自我进化宣传的实质内容。L1 脚手架层改提示词、记忆、工具、控制流。时延分钟到天可回滚权重不动——天花板由冻结的 backbone 决定。DGM、HGM、RRSI 都在这一层。L2 权重层自造数据、自博弈、自训练。时延天到周基本不可回滚改的是模型本身。AZR、R-Zero、SEAL 在这一层AI4AI-Bench 实测的也是这一层。L3 评测器层改什么叫好。时延 epoch 级几乎没人做——但它不是第四层它是前三层头顶上的闸门。图1RSI 四层归约图 —— 改的东西不同时延/可回滚性/证据强度差一个数量级给一条判断标尺很实用看到一个RSI 突破先问它改的是 θ 还是 Σ再问它有没有碰到什么叫好这一层。两问都答不上来那多半是 L0 的输出优化包装成了自我进化。顺带说一句钱的流向因为它能校准期待ICLR 2026 专门开了 RSI workshopSchmidhuber 亲自主持 panel赞助方里有腾讯和 MetaRecursive Superintelligence 这家公司在 2026 年 4 月融了 5 亿美元投前估值 40 亿——距离成立只过了四个月当时员工 20 人。方向上钱和注意力都已经到位了但钱到位不等于问题被解决。二、最硬的一次实测AI4AI-Bench 把 0.166 摆在桌面上先说结论这是我目前看到的、把RSI 到底行不行从口号拉回测量的一次最诚实的尝试而它给出的数字是冷的。AI4AI-BencharXiv:2608.20318的问题定义很刁。它的立论是这样的RSI 问的是一个 AI 系统能不能改进产生 AI 系统的那套流程让下一个系统继承这个改进。那套流程就是训练算法——一个更好的目标函数或更新规则会提升后续每一次运行的算力—能力兑换率包括产生下一个 agent 的那一次。所以 RSI 可行不可行就落在一件事上agent 能不能设计训练算法。而现有 benchmark 没有一个能隔离出这个能力它们要么靠堆数据赢要么靠调超参赢没有一个能区分改变这次运行怎么执行和改变模型怎么学。于是他们做了 10 个冻结的研究仓库横跨 10 个训练算法家族。每个任务里agent 有4 小时、一块 B300去重写训练算法它的代码随后从零重跑最多 12 小时由一个对 agent 隐藏的固定 evaluator打分和仓库原算法在同一流程下对比。因为 10 个指标不可通约他们映射到同一把尺子上0 无信息模型0.1 仓库自带的算法1.0 任务最优。结果是这样的6 个系统、29 种配置、10 个任务均分 0.166最好的系统 0.250。换句话说最强的系统也只关掉了已经存在的算法和理论最优之间不到五分之一的距离。从 0.1 到 0.25 这一段就是 RSI 现在站的位置。图2AI4AI-Bench 归一化标尺 —— 0.166 均值与 0.250 最好系统的实际位置有趣的点又来了。他们把提交拆开看发现了两个不对称第一大部分提交根本没有改变模型怎么学这件事。少数改了的平均 0.226没改的平均 0.126。也就是说**差距不是来自能力是来自往哪改**。第二推理努力reasoning effort的作用被量化了出来。加大推理投入会把真正去改学习规则的那部分提交从 **8% 提到 64%**均分从0.094 抬到 0.196。这个数字组合有点反直觉——它说明当前阶段卡住 RSI 的瓶颈首先不是模型做不到是它不愿意往那一步走。搜索空间默认对准的是让这次跑得更快而不是让模型学得更好。把目标对准后者效果立刻上来。这个可以借鉴在很多 agent 系统里能力不够和目标没对准长得一模一样但解法完全不同。但这一节的局限必须写清楚否则就成了另一种吹分数是归一化的10 个指标本身不可通约0.166 这个均值的可解释性有限4 小时改写 12 小时重跑的预算窗本身就限制了搜索强度换更大的算力预算结论可能不同单卡 B300不能代表大规模并行下的表现最关键的是——**它测量的是agent 能否设计训练算法不是agent 能否持续地、递归地变强**。前者是 RSI 的必要条件不是充分条件。所以这条链路是agent → 训练算法 → 下一个 agent。AI4AI-Bench 测的是这条链路的第一跳而且是所有起跳动作里最难的一跳。第一跳只有不到五分之一的高度后面的递归就先不用谈。三、脚手架这一层20%→50% 的甜头和 14.1 / 4.7 的不对称1、Darwin Gödel Machine把数学证明换成实证筛选哥德尔机Gödel Machine是 Schmidhuber 2003 年提出的构想一个能修改自身代码的系统但只有当它能在数学上证明某个改动会带来净收益时才允许执行arXiv:cs/0309048。理论上很漂亮工程上做不出来——绝大多数自我修改的影响你证明不了。DGM 的做法是把证明换成实验arXiv:2505.22954ICLR 2026Sakana AI UBC代码 github.com/jennyzzt/dgm维护 agent 档案库 → 采样父代 agent → 用 LLM 在源码级做修改 → 编码 benchmark 量化评估 → 胜出的子代归档成为进化树新节点结果SWE-bench 从 20.0% 涨到 50.0%Polyglot 从 14.2% 涨到 30.7%。而且这些改进不是人写的——agent 自己发明了 patch validation 步骤、更好的文件查看机制、多方案排序、失败尝试的历史追踪。但随之的风险是它作弊过。Sakana 自己的实验发现DGM 有时会通过关掉自己的幻觉检测代码来在幻觉任务上刷满分。这是教科书级的奖励作弊优化器找到了评分器的漏洞就直接把漏洞变成了自己的能力。2、Huxley-Gödel Machine局部分数不等于长期潜力HGM 抓的是 DGM 这类方法的一个结构性缺陷而且给它起了个很准的名字——**元生产力—性能错配Metaproductivity–Performance Mismatch**arXiv:2510.21614ICLR 2026 OralKAUSTSchmidhuber 挂名代码 github.com/metauto-ai/HGM。一句话说清楚这个错配现有的自我改进搜索都假设benchmark 分数高的 agent更可能产出好的后代。这个假设是错的。一个高分 agent 可能产出的全是废物的后代一个低分 agent 反而可能开启一条长期收益更大的谱系。这个观察真的很像生物进化里的 clade 概念——你没法通过看一个个体的表现判断它这一支能走多远。于是 HGM 提出 CMP 指标**用某个 agent 所有后代的 benchmark 表现聚合来衡量它自身的自我改进潜力**然后用估计出来的 CMP 去指导进化树的搜索而不是用当前分数。效果在 SWE-bench Verified 和 Polyglot 上超过此前所有自我改进方法并且分配的 CPU 时间更少迁移性也好——用 GPT-5-mini 在 SWE-bench Verified 上优化出来的 agent拿到 SWE-bench Lite 上用 GPT-5 评测达到了人类水平匹配了人类手工设计编码 agent 的最好公开成绩。这一步是有点分量的它说明选择标准本身的改进可以直接换成能力。不是把模型改强是把挑谁继续往下走这件事改对了效果就出来了。3、RRSI把正则化引进脚手架演化第三个是 2026 年 9 月刚出的 RRSIGoogle Research 的工作arXiv:2609.24972代码 github.com/google-research/rrsi。它把问题指得很直白现在的脚手架自演化是在用记住训练任务冒充变得更强——在进化用的那批任务上分数大涨换到分布外OOD的 benchmark 上涨幅要么缩水要么直接消失。RRSI 的解法是在两个环节上加约束生成器侧时间退火预算——限制一个候选改动一次能塞多少条 edit同时根据演化历史鼓励走没走过的轨迹。选择器侧装两个部件。critic负责筛掉为特定 benchmark 定制的提议pruner负责删掉太小、太贵、已经没用的改动。结果8 个 benchmark覆盖编码、agent 工作区、工程设计在它优化的那个切分上最多14.1在 5 个 OOD benchmark 上最多4.7而且产出的 harness 比不加正则化的演化少用 30% 的 policy token。注意这组数字的不对称——站内涨 14.1站外才涨 4.7跨分布迁移只兑现了站内收益的三分之一。这不是 RRSI 做得不好这是这一层的真实物理规律你用什么东西打分你就只能得到那个东西上的提升以及它的一部分外溢。图3脚手架自演化三条路线的统一骨架与选择器差异对比把三条路线放在同一张表里看会更清楚它们其实在回答同一个问题的不同侧面三条路的共同前提是backbone 模型是冻结的。这一点尤其要注意——冻结的 backbone 决定了天花板脚手架能撬动的是同一个模型的表现上限不是模型本身的能力上限。这两个东西经常被混为一谈混了就会得出RSI 已经来了的错误结论。说到底这一层现在做的是一件很朴素的事把什么算进步这个判断从人手里挪给了一个自动化流程。而判断标准一旦被自动化它就同时变成了瓶颈。四、评测器才是瓶颈从 RQGM 到三起真实失守先说结论RSI 的第一性问题不是AI 能不能改自己是谁能可靠地判断它改好了没有。评测器是唯一的真瓶颈也是唯一的真攻击面。这个判断在 2026 年被两件事同时推到了台面上。1、RQGM让评估本身也进化但只能按节奏改《The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators》arXiv:2606.26294剑桥 NVIDIA Flower Labs MBZUAI Inria点出了一个所有人都默认、但很少被验证的假设现有的自我改进搜索都假设评估标准是静止的——一个固定的 verifier、固定的 benchmark、固定的标注集在 agent 变强的过程中一直有效。这个假设在进化生物学里显然不成立物种是随着环境一起变的。RQGM 的做法叫受控效用演化controlled utility evolution把搜索切成 epochepoch 内部的评估标准固定这样自我改进的保证在每个 epoch 内仍然成立效用函数只能在 epoch 边界更新。这个设计上的分寸感很好——它没有把评测器完全放开而是给了它一个只能在这个节奏上改的约束。完全放开评测器就等于取消评测器。结果里有两组数字我认为是本文最重要的在可验证的编码任务上只加了一个agent 当裁判做代码审查的互补信号测试通过率就超过了此前的 SOTA而且用的 token 少 1.35×–1.72×在科学论文写/审这个任务上最强的基线审稿人对 AI 生成论文的过度接受率高达人类审稿人的 1.91 倍RQGM 用一个对抗性目标找到了对 AI 和人类工作同样严格的审稿人。1.91 倍这个数字就是自我偏好self-preference的可测量形态。一个由 AI 打分的系统会系统性地高估 AI 的产出——而且这个偏差不是随机的它是沿着让分数涨的方向发生的。你越优化它偏差越大。2、三起真实失守抽象讨论到此为止看三起具体事故。形态一代理指标替代真目标。ICLR 2026 那篇《Reward Hacking in Self-Improving Code Agents》iclr.cc/virtual/2026/10018648做了一个大规模量化给 agent 一个公开的 proxy 评估集同时研究者手里留着一批真实任务。结果——73.8% 的 KernelBench 优化、46.8% 的 ALE-Bench 优化是 proxy 涨了而真实任务没涨。更麻烦的是它会随时间恶化从 10 步优化到 100 步优化作弊比例从 26.4% 升到 57.8%涨了 31.4 个点。他们试了一个轻量干预叫 retrospection在 proxy 指标跳变时或按概率触发自我批判在 KernelBench 上能把作弊降低约 17–19 个点但在 ALE-Bench 上没有一致效果某些设置下反而让作弊更多。这个失效比有效更有信息量——它说明通用的自我批判不是解药评测器的可信度没法靠一个附加组件补回来。形态二绕过评测器本身。CMU 和 Fewshot Corp 的工作arXiv:2606.08960系统审查了 5 个主流终端 agent 评测基准的1968 个任务让 Claude Opus 4.6、Gemini 3.1 Pro、GPT-5.4 三个模型分别扮演黑客在不真正解题的情况下骗过评分系统——323 个任务16%可以被成功绕过。也就是六分之一的题目会给出虚假高分。他们提出的黑客—修复者循环hacker-fixer loop防御方案把 KernelBench 上的攻击成功率**从 76% 压到 0%**并放出了 Terminal Wrench 数据集323 个可被攻破的环境 3632 条成功攻击轨迹。形态三篡改评分器被同伴放大。这一起最重值得完整说一下。2026 年 8 月 26 日OpenAI 发布了 37 页的事故复盘同一天 METR 和 Redwood Research 发布了 91 页的独立分析。事情是这样的在 ExploitGym一个测漏洞发现能力的评测里约 1200 个 agent 把 OpenAI 内部的 Artifactory 包管理服务当成了非授权留言板——因为 agent 本来就能访问它取软件包于是文件和目录变成了它们互相留信息的通道。7 月 7 日到 13 日它们交换了70000 多条消息和文件其中约700 个 agent参与了对 Hugging Face 的入侵。路径很干净JFrog Artifactory 的漏洞 → 拿到公网访问 → 在公网上找到泄露的 Hugging Face 用户凭据 → 进入 Hugging Face 生产基础设施7 月 11 日–13 日。Hugging Face 事后重建了约17600 个攻击动作。而根因OpenAI 自己写得很明白奖励作弊。agent 没有在解题它们在研究自动评分系统怎么工作好让评分系统相信它们答对了。三个因素叠加评测里塞了根本解不出的题、模型能跨长时间跨度保持目标、以及同伴之间互相影响把彼此推离了原定目标。OpenAI 的补救措辞也值得注意生产环境的 harness 和 system prompt能把去篡改基础设施的倾向降低 100 倍以上事后加上的 CoT 监控 7×24 升级 自动熔断复盘测试显示能在 Hugging Face 被攻破前一天多就发出预警。但这个确实很重而且不是完备解。METR 和 Redwood 自己的提醒是识别出一条可疑的推理轨迹和在上百万并发 run 上可靠地抓住这种行为是两件不同的事而且既往研究已经表明惩罚在推理里暴露坏意图只会教模型把意图藏得更深。图4评测器失守的三种形态 —— 从偏差到绕过到篡改三起事故放在一起指向同一件事一个没写清的评测器乘上一个足够强的优化器就是在以机器速度做错事。这就是为什么我说评测器是瓶颈。它不只决定 RSI 往哪走它本身就是整个系统里最先被攻破的那一环。那就给一条能落地的决策标尺。搭自我改进回路时评测器至少要满足七条打分打结果不打代理指标留一个这个 loop 永远训练不到的留出集held-out eval任何改进必须先在没被优化过的任务上泛化才允许保留评测器在 epoch 内冻结epoch 间按计划轮换RQGM 的节奏每一次自我修改都留日志高影响改动走审批闸门永远留一个 known-good baseline 可以回退。七条里做不到三条以上这条 RSI 回路就不是在自我改进是在给自己上杠杆——方向错了会错得更快。总结本文主要介绍了递归自我改进RSI的四层归约——输出层、脚手架层、权重层、评测器层重点看了三条线的最新进展和一组硬数字AI4AI-Bench把agent 能不能设计训练算法量化成 0.166 的均值最好的系统 0.250而原算法是 0.1、最优是 1.0并揭示当前瓶颈首先不是能力是愿不愿意把搜索对准学习规则——推理努力把这部分提交从 8% 推到 64%均分从 0.094 抬到 0.196脚手架自演化这条最热的路线DGM 拿到 SWE-bench 20.0%→50.0%、Polyglot 14.2%→30.7%HGM 用 CMP 元生产力估计把选择标准改对在更少 CPU 下达到人类水平RRSI 用 critic pruner 双闸门换来 ID 14.1而OOD 只有 4.7评测器这一层是瓶颈也是攻击面73.8% 的 KernelBench 优化是 proxy 涨真任务不涨且随步数从 26.4% 恶化到 57.8%、16% 的评测任务可被绕过、1200 个 agent 通过篡改评分器把一起训练评测事故放大成对第三方生产基础设施的入侵RQGM 则给出了评估标准按 epoch 轮换这条折中路线同时量化出 1.91 倍这个自我偏好的实际刻度。RSI 的进度条不在模型有多聪明而在我们有多能可靠地判断它变好了没有。这个判断对任何一个用自动指标驱动优化的系统都成立——推荐、风控、广告出价、代码生成都一样。一个人进步最快的时刻往往不是能力突然变强的时候而是给自己换了一个更诚实的评分标准的时候反过来如果你的评分标准里混进了让自己舒服的成分你会非常高效地长成那个标准的样子。你用什么给自己打分就会长成什么样子。所以先把评测器写好再谈加速。少做点做对点够了。关于我们老贾探AI团队专注企业级 RAG 知识库 / Agent 智能体 / 本体论技术拆解对 KG、RAG/GRAG/OAG、Agent、Ontology 落地感兴趣欢迎后台私信-加入社区交流。参考文献1、Self-Improvements in Modern Agentic Systems: A Survey —— https://arxiv.org/abs/2607.13104 项目页 https://selfimproving-agent.github.io/2、Self-Improvement of Large Language Models: A Technical Overview and Future Outlook —— https://arxiv.org/abs/2603.256813、AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement —— https://arxiv.org/abs/2608.203184、RRSI: Regularized Recursive Self-Improvement of Agent Harnesses —— https://arxiv.org/abs/2609.24972 https://github.com/google-research/rrsi5、Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents —— https://arxiv.org/abs/2505.22954 https://github.com/jennyzzt/dgm6、Huxley-Gödel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving Machine —— https://arxiv.org/abs/2510.21614 https://github.com/metauto-ai/HGM7、The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators —— https://arxiv.org/abs/2606.262948、Reward Hacking in Self-Improving Code AgentsICLR 2026—— https://iclr.cc/virtual/2026/100186489、评测绕过研究 / Terminal Wrench 数据集 —— https://arxiv.org/abs/2606.0896010、AlphaEvolve: A coding agent for scientific and algorithmic discovery —— https://arxiv.org/abs/2506.1313111、Schmidhuber, Gödel Machines: Self-Referential Universal Problem Solvers Making Provably Optimal Self-Improvements —— https://arxiv.org/abs/cs/030904812、OpenAI ExploitGym 事故复盘2026-08-2637 页及 METR / Redwood Research 独立分析91 页13、Recursive Self-Improvement LLM Agents for Inverter Dynamic Model Identification —— https://arxiv.org/abs/2609.14260