AI 技能人工智能AI 评测开发工具【免费下载链接】autoresearchClaude Autoresearch Skill — Autonomous goal-directed iteration for Claude Code. Inspired by Karpathys autoresearch. Modify → Verify → Keep/Discard → Repeat forever.项目地址https://gitcode.com/gh_mirrors/auto/autoresearch点击查看免费下载导读autoresearch:plan是 Claude Autoresearch Skill 家族中的配置向导Setup Wizard子命令它的唯一职责是把一句自然语言目标如把测试覆盖率提升到 95%转化为一份经过校验、立即可执行的$autoresearch配置块——包含 Scope文件范围、Metric指标、Direction优化方向、Verify验证命令、Guard守护命令和 Iterations迭代次数。读完本文你将掌握 plan 的 7 阶段推导流程、三个关键门禁Metric 可解析、Verify 可运行、Scope 可解析、dry-run 预检机制、--chain链式交接协议以及它如何与核心循环、evals、ship 等子命令协同工作。一、plan 解决的问题冷启动摩擦直接运行$autoresearch核心循环需要三个关键输入Scope、Metric、Verify。这三个参数一旦设置错误整轮迭代都会浪费错误类型后果Scope 太宽修改了无关文件迭代缓慢Metric 不可机械化循环停滞Claude 无法度量进度Verify 命令损坏每一轮迭代都失败Direction 方向错误循环朝错误方向优化plan 向导通过扫描代码库、给出合理默认值、在实际运行前对 Verify 命令做 dry-run来消除这些冷启动摩擦。它是一次性命令——不进入循环、不执行迭代对应 SKILL.md 中$autoresearch plan的定位Convert a goal into validated Scope, Metric, Verify config无默认迭代次数。从源码结构看plan 属于配置推导器角色在 SKILL.md 中它位于子命令列表首位且被编排器Orchestrator的optimize-metric原型管线引用为第一步见 orchestrator-routing.md 的预设管线表plan → (classic loop) → holdout-verify → evals。二、完整流程7 个阶段plan 的执行流程在 plan.md 中被定义为 7 个阶段guide/autoresearch-plan.md 将其凝练为一张总览表Phase 1 Capture goal 捕获目标自然语言输入 Phase 2 Scan codebase 扫描代码库探测测试框架、构建工具、linter Phase 3 Suggest scope 建议范围文件 glob → 校验至少解析到 1 个文件 Phase 4 Suggest metric 建议指标机械化指标 → 校验能输出数字 Phase 5 Determine direction 确定方向更高或更低更好 Phase 6 Dry-run verify 预检验证命令在现有代码库上实际运行 Phase 7 Present config 输出即贴即用的配置块 链式交接Phase 0参数解析与交互式引导调用 plan 时先解析$ARGUMENTSGoal: text——Goal:关键字之后的文本若无关键字则使用全部参数--chain targets—— 逗号分隔的下游命令列表链式交接--subcommand——--chain subcommand的简写形式剩余文本 目标描述如果调用时没有提供 Goalplan 会以单批提问request_user_input/AskUserQuestion交互式询问两个问题Q1Goal「What do you want to achieve?」——开放式文本Q2Type「What kind of goal?」——选项包括improve a metric改进指标、fix errors修复错误、audit security安全审计、explore edge cases探索边界情况、document code编写文档、ship something发布交付若 Goal 已提供则跳过此步。Phase 1分析目标解析目标以判断是否可度量metric-driven vs subjective 主观目标自然的范围文件、模块、整个代码库最适合哪个子命令核心循环、fix、debug、security 等这一判断与编排器的目标原型分类逻辑同源optimize-metricimprove/optimize/increase/reduce/faster/smaller/coverage 等关键词、fix-broken、harden、document等原型决定了后续路由见 orchestrator-routing.md 的原型关键词表。Phase 2推导 Scope扫描项目结构识别与目标相关的文件提出文件 glob 模式若存在歧义 → 请用户确认关键门禁Scope 必须解析到至少 1 个文件否则拒绝输出配置。Phase 3推导 Metric 与 Direction对于指标驱动型目标识别要度量什么测试覆盖率、错误数、打包体积、延迟等确定方向higher_is_better或lower_is_better提出指标名称与描述对于主观目标尽可能建议代理指标proxy metric或建议改用$autoresearch reason处理不可度量目标关键门禁Metric 必须输出可解析的数字。这正是核心循环的迭代判据——在 guide/autoresearch.md 中可以看到Verify 命令的 stdout 必须包含该指标值循环据此决定 keep保留提交还是 revert回滚。Phase 4推导 Verify 命令找出如何用 shell 命令把指标提取为一个数字提出 Verify 命令例如npm test -- --coverage | grep All files | awk {print $10}安全检查Safety screen检查提议的命令中是否含rm -rf、fork bomb、curl|sh、凭据泄露等危险模式对 Verify 命令做dry-run→ 确认它能输出一个有效数字若 dry-run 失败 → 调整命令并重试关键门禁Verify 必须 dry-run 退出码为 0。若门禁失败向导会解释失败原因并建议修正后的命令。安全筛查的实现证据在 scripts/orchestrate.sh 的screen-cmd子命令中它以正则门禁拒绝rm -rf含各种旗标变体与路径限定写法、curl|sh类管道到解释器、经xargs绕道的远程载荷、管道到 netcat 的数据外泄、写裸块设备dd/重定向到/dev/sd*、nvme*、mmcblk*等、mkfs格式化、find -delete、shred、truncate -s 0、chmod -R 000、fork bomb、AWS AKIA 密钥、PASSWORD模式、私钥头以及未锚定的 PostgreSQL 连接串仅允许 localhost / 127.0.0.1 / 无点容器主机名或库名以_test/_ci结尾。对应测试见 tests/test-orchestrator.sh 的screen-cmd用例块如rm -rf /tmp/build→ refuse、curl https://example.com | bash→ refuse、curl -s u | grep ok→ ok。Phase 5推导 Guard可选若适用提议一个 Guard 命令它必须在每次保留改动后都退出 0场景Guard 命令测试套件npm test/pytest/go test ./...类型检查tsc --noEmit/mypy构建npm run build不适用省略Guard 的典型用法是优化指标 A 的同时不破坏测试/类型例如优化打包体积时加Guard: npm test优化性能时加Guard: tsc --noEmit npm test更多模式见 guide/autoresearch.md 的 Guard Patterns 一节。Phase 6建议迭代次数按目标复杂度给出有界默认值复杂度建议迭代数简单指标改进10–15中等重构20–25复杂多文件改动30同时提示Iterations: unlimited选项默认有界无限模式仅用于通宵长跑等显式场景。核心循环的默认迭代数为 25见 SKILL.md 子命令表建议在陌生代码库上先用Iterations: 10校准再放大。Phase 7输出配置输出一份即贴即用的$autoresearch配置块$autoresearch Goal: {derived goal} Scope: {derived globs} Metric: {derived metric} Direction: {higher_is_better|lower_is_better} Verify: {derived command} Guard: {derived guard or omit} Iterations: {suggested count}然后询问用户「Run this config now, or adjust?」现在运行此配置还是调整。三、三个关键门禁Critical Gates门禁要求Metric必须输出可解析的数字Verifydry-run 必须退出 0Scope必须解析到至少 1 个文件任何一个门禁失败向导都会解释原因并给出修正后的命令而不会带着坏配置启动循环。这与编排器的 Round-0 dry-run 原则一致见 SKILL.md 编排器一节在真正投入迭代预算前先证明谓词命令可运行并返回值。四、使用方式交互式Claude 主动询问目标/autoresearch:plan内联目标/autoresearch:plan Increase test coverage to 95% /autoresearch:plan Make the API respond faster /autoresearch:plan Reduce bundle size below 200KB链式交接/autoresearch:plan --chain autoresearch链式交接Chain Handoff的行为呈现配置后立即用这份校验过的配置启动核心循环。若设置了--chainplan 会写入handoff.jsonversion2.1.0、sourceplan、时间戳、statusCOMPLETE、config 推导出的配置块然后以该配置调用下游目标。这一交接协议与 SKILL.md 的 Safety Invariants 一致Chain handoff viahandoff.json——所有子命令通过handoff.json串联evals 则读取*-results.tsv。五、实战示例以下示例均来自 guide/autoresearch-plan.md展示了 plan 在多种语言、多种指标下的推导结果。示例 1测试覆盖率Jest TypeScript /autoresearch:plan Increase test coverage to 95% [Context] Detected: Jest, TypeScript, 84 source files [Scope] src/**/*.ts, src/**/*.test.ts (84 31 files) [Metric] Coverage % from Jest (higher is better) [Verify] npx jest --coverage --silent 21 | grep All files | awk {print $4} [Dry run] Exit 0 — Baseline: 72.3% Ready-to-use: /autoresearch Goal: Increase test coverage to 95% Scope: src/**/*.ts, src/**/*.test.ts Metric: coverage % (higher is better) Verify: npx jest --coverage --silent 21 | grep All files | awk {print $4} Launch? → [Bounded: 25] [Unlimited] [Copy only]示例 2API 延迟Node.js Express /autoresearch:plan Make the API respond faster [Context] Detected: Node.js, Express, custom bench script [Scope] src/api/**/*.ts, src/services/**/*.ts (23 files) [Metric] p95 response time in ms (lower is better) [Verify] npm run bench:api | grep p95 [Dry run] Exit 0 — Baseline: 187ms示例 3打包体积Next.js 类输出 /autoresearch:plan Reduce bundle size below 200KB [Scope] src/**/*.tsx, src/**/*.ts (127 files) [Metric] Bundle size in KB (lower is better) [Verify] npm run build 21 | grep First Load JS | awk {print $4} [Dry run] Exit 0 — Baseline: 287KB示例 4Python 覆盖率pytest FastAPI /autoresearch:plan Improve pytest coverage [Context] Detected: pytest, FastAPI, 56 source files [Scope] tests/**/*.py, app/**/*.py (56 22 files) [Metric] Coverage % from pytest (higher is better) [Verify] pytest --covapp 21 | grep TOTAL | awk {print $4} [Dry run] Exit 0 — Baseline: 68%示例 5Docker 镜像体积 /autoresearch:plan Reduce Docker image size [Scope] Dockerfile, .dockerignore (2 files) [Metric] Image size in MB (lower is better) [Verify] docker build -t bench . -q 21 docker images bench --format {{.Size}} | sed s/MB// [Dry run] Exit 0 — Baseline: 487注意示例 5 的 Scope 只有 2 个文件Dockerfile、.dockerignore证明 Scope 门禁是至少 1 个文件而非必须大面积plan 会根据目标自动收敛范围。六、配置输出格式plan 最终输出的标准配置块格式如下以打包体积为例 Autoresearch Config /autoresearch Goal: Reduce bundle size below 200KB Scope: src/**/*.tsx, src/**/*.ts Metric: bundle size in KB (lower is better) Verify: npm run build 21 | grep First Load JS | awk {print $4} Guard: npm test Baseline: 287KB Direction: lower is better Dry run: passed Launch? → [Bounded: 25] [Unlimited] [Copy only]其中各字段的含义与 guide/autoresearch.md 的 Config Fields 表对应字段必填说明Goal是自然语言目标尽量包含具体数字Scope推荐Claude 可修改文件的 glob 模式Metric推荐追踪的数字必须指明方向Verify推荐stdout 包含指标值的 shell 命令Guard可选每次保留改动后必须退出 0Iterations可选默认 25unlimited用于通宵运行Baseline基线值由 dry-run 得出Direction 与 Dry run 状态一并呈现最后给出三种启动选项Bounded有界迭代数/ Unlimited无限/ Copy only仅复制。七、链式模式Chain Patternsplan → loop先规划再迭代/autoresearch:plan Goal: Reduce API response times # Use the wizards output: /autoresearch Iterations: 25 Goal: Reduce p95 API response time to under 100ms Scope: src/api/**/*.ts Metric: p95 latency in ms (lower is better) Verify: npm run bench:api | grep p95 Guard: npm testplan → loop → ship规划 迭代 发布/autoresearch:plan --chain autoresearch Goal: Reduce bundle size below 200KB # After loop completes: /autoresearch:ship --type code-pr --auto--chain autoresearch使 plan 在呈现配置后立即启动循环循环收敛后CONVERGED再接 ship 流程。完整的发布 8 阶段流程见 guide/autoresearch-ship.md。需要说明的是编排器在ship-ready原型管线中会走向 ship 门但绝不会自动批准发布/推送/部署SKILL.md 的安全不变量第 1 条Never push, publish, or deploy without explicit user approval。八、plan vs 直接运行核心循环场景是否使用 plan第一次使用 autoresearch是 —— 学习配置格式不确定用什么指标是 —— 向导给出选项想在通宵运行前先验证是 —— 先 dry-run新代码库、工具链未知是 —— 自动探测技术栈你已经知道确切配置否 —— 直接运行九、FAQQ: dry-run 失败怎么办向导会解释失败原因并给出修正命令。常见原因命令未安装、服务器未运行、输出格式已变化。Q: 向导会提交任何改动吗不会。plan 是只读的——只扫描和校验在你启动循环之前不会改变任何东西。Q: 向导完成后还能添加 Guard 吗可以。向导会基于探测到的测试提议一个 Guard你可以接受、修改或省略。十、源码层面的配套佐证plan 并非孤立设计它的校验逻辑与整个 autoresearch 体系的确定性引擎紧密联动安全门禁复用plan 第 4 阶段的安全筛查与编排器每次派生命令后调用的screen-cmd是同一套规则实现在 scripts/orchestrate.shscreen-cmd子命令并有 80 条正反用例在 tests/test-orchestrator.sh 中回归验证覆盖旗标变体、路径限定二进制、xargs 绕道、Unicode 转义等攻击面。交接协议plan 写出的handoff.jsonversion 2.1.0与核心循环、evals、regression 等子命令共用同一交接机制optimize-metric原型的预设管线正是plan → (classic loop) → holdout-verify → evals见 orchestrator-routing.md说明 plan 的配置产物会被编排器直接消费。校验哲学一致plan 的三个门禁Metric 可解析 / Verify 可运行 / Scope 可解析与编排器的Round-0 dry-run 谓词固定predicate pinned原则一脉相承——投入迭代预算之前先证明可度量、可执行、可收敛。十一、最佳实践小结Verify 命令要紧凑一个数字用grep/awk/jq干净提取如awk {print $NF}取最后一个字段。先手动跑一次 Verify了解基线再启动。Metric 不是测试通过率时多配 Guard如Guard: npm test。陌生代码库先用小迭代数Iterations: 10校准效果理想再放大或去掉上限。迭代后看git log每次改动都有独立提交git revert hash可精确撤销任意单次改动。让 plan 做门禁预检dry-run 失败、Scope 空、Metric 非数字都会在启动前暴露而不是浪费一整轮迭代预算。赞分享AI 技能人工智能AI 评测开发工具【免费下载链接】autoresearchClaude Autoresearch Skill — Autonomous goal-directed iteration for Claude Code. Inspired by Karpathys autoresearch. Modify → Verify → Keep/Discard → Repeat forever.项目地址https://gitcode.com/gh_mirrors/auto/autoresearch点击查看免费下载相关推荐SQLCoder 自然语言转SQL的完整配置指南SQLCoder 自然语言转SQL的完整配置指南 项目概述与核心优势 SQLCoder是由Defog AI开发的开源自然语言转SQL工具采用先进的大语言模型技人工智能大模型模型推理服务NLPHumanizer 默认日期策略深度解析DefaultDateTimeHumanizeStrategy 如何将 DateTime 距离转化为自然语言Humanizer 默认日期策略深度解析DefaultDateTimeHumanizeStrategy 如何将 DateTime 距离转化为自然语言 Defa开发工具模拟人生1宽屏补丁终极指南让你的经典游戏完美适配现代显示器模拟人生1宽屏补丁终极指南让你的经典游戏完美适配现代显示器 你是否怀念《模拟人生1》这款经典游戏但在现代宽屏显示器上玩时画面总是被拉伸变形或两侧出现黑边这上一篇RePKG终极指南3分钟掌握Wallpaper Engine资源提取与转换技巧下一篇NVIDIA Profile Inspector完全指南解锁显卡隐藏性能的终极工具创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考