ARIS 自进化闭环源码剖析:/meta-optimize 与 /meta-apply 如何持续改进工具
ARIS 自进化闭环源码剖析/meta-optimize 与 /meta-apply 如何持续改进工具【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleepARISAuto-Research-In-Sleep是一套面向自主机器学习研究的轻量级纯 Markdown 技能系统而它最独特的设计是自进化闭环/meta-optimize负责分析你的真实使用日志、找出工具链的短板并产出改进补丁/meta-apply则作为唯一的落地闸门在跨模型陪审团评审和人类批准后才把补丁真正写入技能库。本文带你从源码层面拆解这个闭环——数据从哪来、决策由谁做、以及它为什么不会失控。一、什么是自进化闭环ARIS 在优化它自己很多工具优化的是产出物论文、代码而 ARIS 的自进化闭环优化的是harness 本身——也就是包裹在 LLM 外层的那套技能提示词、默认参数、收敛规则和工作流编排。可优化组件示例是否可自动优化SKILL.md 提示词评审员指令、质量门槛、步骤描述✅默认参数difficulty: medium、MAX_ROUNDS: 4、阈值 6/10✅收敛规则评审循环何时停止、重试次数✅工作流顺序技能链的调用顺序✅MCP 桥接配置评审模型路由属于基础设施❌这个设计源自 Meta-Harness 的核心洞察harness 的设计与模型权重同样重要而 harness 工程可以通过记录执行轨迹 用轨迹指导改进来部分自动化。注意闭环优化的是工具而不是研究产物本身——论文和实验仍由常规工作流负责。完整技能清单可参见 docs/SKILLS_CATALOG.md 中对这两个技能的定位前者是外环自进化分析器后者是特权落地闸门。二、闭环第一步/meta-optimize 把使用历史变成补丁1. 被动埋点零成本的数据采集自进化的燃料是真实使用数据。ARIS 通过 Claude Code 的钩子机制在正常使用时静默记录一切——你完全无感。配置模板 templates/claude-hooks/meta_logging.json 在 5 类生命周期事件上挂了同一个记录脚本PostToolUse工具调用后、PostToolUseFailure工具失败、UserPromptSubmit用户提交、SessionStart/SessionEnd会话起止。真正的解析逻辑在 tools/meta_opt/log_event.sh它把钩子传来的 JSON 提炼成结构化事件双写到项目级.aris/meta/events.jsonl和全局~/.aris/meta/events.jsonl用于跨项目趋势分析。每行 JSONL 长这样{ts:2026-09-19T08:12:03Z,event:skill_invoke,skill:auto-review-loop,args:difficulty: hard} {ts:2026-09-19T08:15:41Z,event:tool_failure,tool:Bash,input_summary:python train.py}技能调用、工具失败、斜杠命令、用户改参、会话模型session_start的model字段……全是分析原料。2. 五种分析从用了什么到卡在哪里skills/meta-optimize/SKILL.md 定义了完整的分析工作流核心是五类挖掘频率分析哪些技能被高频调用用户最常手动覆盖哪些参数覆盖 默认值不好的信号失败分析哪些工具失败最多OOM / 导入错误 / 超时各占多少收敛分析评审循环平均几轮达标分数曲线是快速上升、平台期还是震荡人工干预分析用户在哪里中途打断手动纠正这些是技能缺口模型差量分析harness 瘦身如果会话模型升级了旧模型时代的手把手脚手架就成了纯开销——此时删除步骤 N–M 是一个一等公民的优化提案与新增改动走同一套排名与审批逻辑分析完成后技能会把当前最卡的环节用一句话命名如验证质量、规划追加进只增不改的账本.aris/meta/bottleneck_log.jsonl——瓶颈会随时间迁移账本记录的是它的接力史。3. 关键设计只提案不落地/meta-optimize被刻意设计成只读生产者READ-ONLY PRODUCER它没有Write/Edit工具无法直接改任何 SKILL.md它唯一的写操作是把批准的补丁暂存到.aris/meta/pending/草稿区永不触碰技能库它还会用tools/meta_opt/trigger_eval.py测量技能触发率——事件日志只能看到技能被用了看不到想被用却漏触发的失败这个工具用改写意图的探测查询直接测量混淆矩阵。为什么这么抠细节因为它堵死了一个经典失败模式——自我豁免self-acquittal如果提出补丁的循环能自己批准并应用补丁那么一句被漏掉的指令就可能让系统给自己打免罪牌。把提案和落地拆到两个工具权限不同的技能里这条防线就是结构性的而不是靠一句请勿自行应用的口头约定。详见 skills/shared-references/acceptance-gate.md。4. 就绪提醒数据够了才叫醒你你不需要盯着日志。钩子配置里的SessionEnd还会触发 tools/meta_opt/check_ready.sh每次会话结束时做两件事上次优化以来累计≥5 次技能调用 → 打印 ARIS has logged N skill runs... Run /meta-optimize会话模型发生变化→ 打印 Model changed... a model bump makes existing scaffolding a deletion candidate两者都只是建议绝不自动运行。数据不足 5 条时/meta-optimize自己也会检查并劝退继续正常使用稍后再来。三、闭环第二步/meta-apply唯一的落地闸门读完/meta-optimize的报告后你说一句应用第 1、3 条然后手动运行/meta-apply。这一次敲键盘本身就是落地授权——skills/meta-apply/SKILL.md 规定它只能由人类显式触发永远不能作为别的技能或钩子的副作用运行。1. 落地时才开陪审团绝不信任生产者写的结论一个早期设计的教训被写进了源码注释如果信任生产者 manifest 里的jury_verdict: pass字段那是可伪造的——写这个字段的正是生产者自己一个有 bug 或跑偏的生产者可以把被拒的补丁标成 pass。所以/meta-apply的做法是在落地那一刻、对真实的暂存 diff开一个全新的跨模型陪审团全新线程的 Codex 评审路径级只读不携带生产者的推理过程只问一个问题这个改动是否在不引入回归的前提下改进了 harnessPASS 或 KILL 一句话理由。结果只在本地产出、当场消费没有可伪造的中间产物。被 KILL 的补丁人类无法强行放行——你只能在通过陪审团的幸存者里挑选。2. 作者与评审必须跨家族补丁由 Claude 侧执行者撰写由 Codex 模型评审。tools/provenance.py 中的assert_cross_family会在作者与评审同属一个模型家族或家族无法识别时直接抛错拒绝——这是结构性兜底防止同一个模型既写又批。3. 备份 → 应用 → 盖章 → 记日志全程可回滚每条幸存补丁的落地都是四步备份目标文件到.aris/meta/backups/date/可构造性可回滚仅用 Write/Edit 应用diff可审查、可归因不走 Bash盖溯源章tools/provenance.py 的stamp()写入{author_model, reviewer_model, verdict_id, content_hash}四元组且盖章时再次断言跨家族记账追加一行到.aris/meta/optimizations.jsonl特别值得新手注意的一点溯源章是流程收据process receipt不是正确性背书——它记录这个改动通过了跨模型陪审团 人类落地但不担保改动本身是对的。后续任何手改都会使content_hash失配章自动作废。四、如何开启自进化闭环四步上手启用埋点把 templates/claude-hooks/meta_logging.json 复制/合并进项目的.claude/settings.json正常使用跑至少 5 次完整工作流让.aris/meta/events.jsonl攒够数据运行优化分析看到提醒或随时手动输入/meta-optimize可加参数指定目标技能如/meta-optimize auto-review-loop阅读报告后告诉它要暂存哪几条人工落地运行/meta-apply 1,3或all陪审团逐条裁决通过者备份后写入被拒者留痕报告五、总结为什么这个闭环值得参考ARIS 的自进化闭环给所有想做AI 自我改进的人演示了一套克制而完整的工程范式提案权与落地权分离生产者只读落地者特权两者工具权限不同——防线是结构不是约定裁决在使用处生成跨模型陪审团在落地瞬间、对真实 diff 运行杜绝结论可伪造默认拒绝不指定补丁就不应用KILL 不可人工翻案全程留痕事件日志、瓶颈账本、备份、溯源章、优化流水每一环都可审计、可回滚对新手而言最值得借鉴的不是具体的脚本而是这套用真实使用数据驱动改进、用权限边界约束改进、用人类保持最终闸门的方法论——工具用得越久就会越懂你而每一步变强都经得起事后审查。【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

本地大模型翻译:如何用CopyTranslator+Ollama搭建私有免费的离线翻译环境

本地大模型翻译:如何用CopyTranslator+Ollama搭建私有免费的离线翻译环境

本地大模型翻译:如何用CopyTranslatorOllama搭建私有免费的离线翻译环境 【免费下载链接】CopyTranslator 🔠Foreign language reading and translation assistant based on copy and translate. 项目地址: https://gitcode.com/gh_mirrors/co/CopyTra…

2026/9/21 19:26:00 阅读更多 →
告别环境地狱:sophone4手写实现的性能优化实战

告别环境地狱:sophone4手写实现的性能优化实战

告别环境地狱:sophone4手写实现的性能优化实战 配置环境就卡半天?这是无数开发者在接触 sophone4 时的共同噩梦。依赖冲突、版本不匹配、编译报错,让人寸步难行。与其在环境配置的泥潭里挣扎,不如直接上手 手写实现…

2026/9/21 19:26:00 阅读更多 →
拒绝瞎猜:xiu100底层原理与完整示例拆解

拒绝瞎猜:xiu100底层原理与完整示例拆解

拒绝瞎猜:xiu100底层原理与完整示例拆解 官方文档动辄几万字,翻到一半就忘了开头在说啥,这是多数开发者的噩梦。 面对【xiu100】这种看似生僻实则核心的机制,光看定义根本不够,必须配合 完整示例 才能看透本质。…

2026/9/21 19:26:00 阅读更多 →

最新新闻

猴子摘鲜果源码解析:新手避坑与多语言选型实战指南

猴子摘鲜果源码解析:新手避坑与多语言选型实战指南

猴子摘鲜果源码解析:新手避坑与多语言选型实战指南 配置环境就卡半天,是不是你的常态?很多刚入行的应届生朋友,面对经典的“猴子摘鲜果”算法题,还没开始写逻辑,就在 Python 和 Java 的环境切换中耗尽了耐心。这种 新手避坑…

2026/9/21 20:05:17 阅读更多 →
3个不可能的任务性能优化方案,面试必问实战拆解

3个不可能的任务性能优化方案,面试必问实战拆解

3个不可能的任务性能优化方案,面试必问实战拆解 看了一堆教程还是不会写项目?这是不是你的常态?视频里代码跑得飞快,自己一动手就报错。更扎心的是,面试官抛出一个性能优化场景,你愣在原地,脑子里全是 for 循环和 map…

2026/9/21 20:05:17 阅读更多 →
乔布斯癌症面试真题完整示例:3步拆解考点与避坑

乔布斯癌症面试真题完整示例:3步拆解考点与避坑

乔布斯癌症面试真题完整示例:3步拆解考点与避坑 刚拿到“乔布斯癌症”相关的面试题,复制网上的答案背了半小时,结果面试官问第二层逻辑时直接卡壳。那种感觉就像你手里攥着一把生锈的钥匙,硬插进锁孔,怎么都拧不动。别慌,这种“复制来的代码跑不通不知…

2026/9/21 20:05:17 阅读更多 →
xxxsss常见报错与解决

xxxsss常见报错与解决

3个核心避坑指南:培训机构选型与通过率真相 刚拿到那份“高薪就业”的推荐名单?别急着交钱。 你是不是也遇到过这种情况:网上搜了一堆“最佳实践”,复制下来的代码在本地环境里跑不通,报错信息看得人头大,完全不知道从哪开始调。…

2026/9/21 20:05:17 阅读更多 →
5步搞定搜索快捷键:源码解析背后的性能优化实战

5步搞定搜索快捷键:源码解析背后的性能优化实战

5步搞定搜索快捷键:源码解析背后的性能优化实战 看了一堆教程还是不会写项目?这种挫败感我太懂了。你盯着屏幕上的代码,明明每个字符都认识,合起来就是跑不通。问题往往不在语法,而在你对底层逻辑的“黑盒”认知缺失。今天我们就拿【搜索快捷键】这个看…

2026/9/21 20:05:17 阅读更多 →
欲练此功必先自宫:后端开发最佳实践与面试避坑指南

欲练此功必先自宫:后端开发最佳实践与面试避坑指南

欲练此功必先自宫:后端开发最佳实践与面试避坑指南 面试被问原理答不上来,是不是觉得脑子里一片浆糊?别慌,这不是你笨,而是你一直只记结论,没摸透底层逻辑。很多新人学编程,就像练绝世武功,光背招式口诀,连内力运行路线都没搞清,遇到变招直接卡壳。…

2026/9/21 20:04:17 阅读更多 →

日新闻

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程

agents-generator 决策矩阵全解析:从项目检测到 AGENTS.md 规则生成的 16 步判定流程 【免费下载链接】agentic-awesome-skills AAS Core is the local, agent-first control plane for complete catalog discovery, agent-owned selection, stack validation, and …

2026/9/21 0:00:01 阅读更多 →
gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析

gin-vue-admin 前端工具函数全景指南:src/utils 复用规范与源码级解析 【免费下载链接】gin-vue-admin 🚀ViteVue3Gin拥有AI辅助的基础开发平台,企业级业务AI开发解决方案,内置mcp辅助服务,内置skills管理,…

2026/9/21 0:00:01 阅读更多 →
Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

Wox 全功能插件开发实战指南:基于 Python / Node.js 宿主与 WebSocket 的持久化插件体系

桌面应用AI 应用插件系统 【免费下载链接】Wox A cross-platform launcher that simply works 项目地址: https://gitcode.com/gh_mirrors/wo/Wox 点击查看 免费下载 全功能插件(Full-featured Plugin)是 Wox 三类插件实现方式中能力最完整的…

2026/9/21 0:00:01 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/21 3:13:20 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/21 2:19:36 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/21 4:51:05 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/21 15:36:51 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/21 15:36:51 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →