SuperClaude Framework Self Review Agent 实战指南:实现后自检、证据校验与 Reflexion 错误学习
SuperClaude Framework Self Review Agent 实战指南实现后自检、证据校验与 Reflexion 错误学习【免费下载链接】SuperClaude_FrameworkA configuration framework that enhances Claude Code with specialized commands, cognitive personas, and development methodologies.项目地址: https://gitcode.com/gh_mirrors/su/SuperClaude_Framework本指南以 SuperClaude Framework 的 Self Review Agent位于 plugins/superclaude/agents/self-review.md源码同版位于 src/superclaude/agents/self-review.md为核心讲解如何在每次实现波次implementation wave结束后用四项强制自检问题确认交付物是否达到生产就绪标准并通过 Reflexion 模式沉淀错误经验防止复发。读完本文你将掌握一套可复制的实现后验证 教训沉淀闭环流程以及它在框架源码SelfCheckProtocol、ReflexionPattern与 pytest 插件中的落地实现。Self Review Agent 的角色定位在 SuperClaude Framework 中Self Review Agent 是一个post-implementation validation and reflexion partner实现后验证与反思伙伴类别归属为quality。它的触发时机非常明确在一次实现波次implementation wave结束后立即启用用于确认结果是否生产就绪production-ready并捕获本次实现产生的经验教训。它与 PM Agent见 plugins/superclaude/agents/pm-agent.md形成互补PM Agent 负责把实现过程中的模式、决策与错误沉淀为知识库而 Self Review Agent 专注于验收环节——核实 SuperClaude Agent 声称完成的测试与工具链结果输出简洁的清单式报告并把残余风险与后续动作交还给 SuperClaude Agent 进行最终用户回复。核心职责一核实测试与工具链证据Self Review Agent 的首要职责是Verify tests and tooling reported by the SuperClaude Agent即逐条核对 SuperClaude Agent 上报的测试和工具执行结果而不是照单全收。这里的核心理念是证据优先一个声称测试通过的结论必须附带实际的命令与输出否则不能视为有效证据。这一要求在框架源码中被硬编码为校验规则详见下文源码级支撑一节SelfCheckProtocol._check_tests_passing()会同时要求tests_passedTrue与test_output非空且输出中必须包含passed、OK、✓、✅等通过标志仅有断言而无真实输出时直接判定为不通过。核心职责二运行四项强制自检问题这是 Self Review Agent 的方法论骨架。在原文档 plugins/superclaude/agents/self-review.md 中规定了四项强制问题它们与源码 src/superclaude/pm_agent/self_check.py 中SelfCheckProtocol注释里记载的 The Four Questions 一一对应但在表述上略有差异Agent 文档侧重验收视角源码侧重防幻觉视角维度Agent 文档的四问源码SelfCheckProtocol的四问测试Tests/validation executed?附带命令与结果Are all tests passing?要求展示真实结果边界Edge cases covered?列出有意遗漏项No assumptions without verification?假设必须核对官方文档需求Requirements matched?回连验收标准Are all requirements met?逐条对比 ✅/❌收尾Follow-up or rollback steps needed?Is there evidence?测试结果、代码变更、lint/类型检查从源码结构看这四项问题被映射为validate()中的四次独立检查# 摘自 src/superclaude/pm_agent/self_check.py#L64-L107结构示意 issues [] # Question 1: Tests passing? if not self._check_tests_passing(implementation): issues.append(❌ Tests not passing - implementation incomplete) # Question 2: Requirements met? unmet self._check_requirements_met(implementation) if unmet: issues.append(f❌ Requirements not fully met: {, .join(unmet)}) # Question 3: Assumptions verified? unverified self._check_assumptions_verified(implementation) if unverified: issues.append(f❌ Unverified assumptions: {, .join(unverified)}) # Question 4: Evidence provided? missing_evidence self._check_evidence_exists(implementation) if missing_evidence: issues.append(f❌ Missing evidence: {, .join(missing_evidence)})其中证据维度进一步细化为三类硬性要求见_check_evidence_exists()src/superclaude/pm_agent/self_check.pytest_results测试实际输出code_changes变更文件清单validationlint、类型检查、构建等静态校验结果。三者缺一即记为Missing evidence问题。测试夹具 tests/conftest.py 中的sample_implementation展示了满足全部四问的完整数据结构含tests_passed、test_output、requirements、requirements_met、assumptions、assumptions_verified、evidence、status而failing_implementation则演示了典型的失败形态测试未过、需求仅完成 1/3、假设未全部核实、证据为空、状态却声称 complete。核心职责三汇总残余风险与缓解思路四项自检全部通过并不意味着零风险。Self Review Agent 还需Summarize residual risks and mitigation ideas——把明知存在但不影响本次验收的风险显式列出来并给出缓解方向。例如原文档报告示例中的⚠️ Edge cases: concurrency behaviour not exercised就属于此类并发行为未被覆盖需要在后续迭代中补测。这对应报告中的⚠️级条目与✅级已通过和级后续动作共同构成三层状态标注。在源码侧SelfCheckProtocol用标注幻觉告警、❌标注硬性问题见format_report()src/superclaude/pm_agent/self_check.py两者语义层级互补。核心职责四记录 Reflexion 模式避免同类缺陷复发当缺陷出现时Self Review Agent 要Record reflexion patterns让 SuperClaude Agent 后续不再重复犯错。这正是框架中ReflexionPattern类src/superclaude/pm_agent/reflexion.py的职责把错误转化为可检索、可复用的知识。ReflexionPattern的工作流程分为两条路径命中已知错误0 token 成本构造错误签名error_type | 去数字化的 error_message 前 100 字符 | test_name先尝试 mindbase 语义检索http://localhost:18003/api/search相似度阈值 0.73 秒超时失败自动降级再回退到本地 JSONL 文件做词重叠匹配默认阈值 0.7见_search_mindbase()与_search_local_files()。新错误1-2K token 调研成本调用record_error()将错误信息追加写入docs/memory/solutions_learned.jsonl追加式日志若带root_cause或solution分析还会生成结构化错误文档docs/mistakes/[test_name]-YYYY-MM-DD.md见_create_mistake_doc()src/superclaude/pm_agent/reflexion.py。该文档固定包含七个板块## ❌ What Happened → 现象描述 ## Root Cause → 根本原因 ## Why Missed → 为何此前未被发现 ## ✅ Fix Applied → 实际修复方案 ## ️ Prevention Checklist → 防复发清单 ## Lesson Learned → 经验教训仓库中已有真实产出可对照docs/memory/solutions_learned.jsonl120 行 JSONL 记录如{error_type: ConnectionError, solution: Ensure database is running and credentials are correct, timestamp: ...}与 docs/mistakes/test_database_connection-2026-03-22.md按上述模板生成的错误记录。get_statistics()还能统计total_errors、errors_with_solutions与solution_reuse_rate用于量化知识库的学习效果。操作流程How to Operate原文档给出了四步操作法这里结合框架源码补充每一步的落地细节Step 1审查任务摘要与实现 diffSuperClaude Agent 会提交任务摘要task summary与实现差异implementation diffSelf Review Agent 据此还原声称做了什么。Step 2确认测试证据缺失则要求重跑这是先证据后放行的硬门槛。对应源码中_check_tests_passing()的两条规则tests_passed必须为True且test_output必须含真实通过标志。单测 tests/unit/test_self_check.py 中的test_check_tests_passing_with_output明确验证了有输出通过 / 无输出判失败两种分支。Step 3输出简短的清单式报告原文档报告模板原文如下字段格式可照搬✅ Tests: uv run pytest -m unit (pass) ⚠️ Edge cases: concurrency behaviour not exercised ✅ Requirements: acceptance criteria met Follow-up: add load tests next sprint在源码侧format_report()提供程序化版本通过时输出✅ Self-Check PASSED - Implementation complete with evidence失败时逐条列出❌问题项。Step 4剩余问题给出定向行动建议When issues remain, recommend targeted actions rather than reopening the entire task——只针对具体问题开处方而不是推翻整个任务重来这保证了修复成本可控。源码级支撑7 个幻觉红旗检测SelfCheckProtocol除了四问校验还内置了一套幻觉检测机制这是它区别于普通 checklist 的关键。HALLUCINATION_RED_FLAGS常量与_detect_hallucinations()src/superclaude/pm_agent/self_check.py实现了 7 类红旗的自动识别声称测试通过但未附输出tests_passedTrue且test_output为空声称一切正常但无任何证据statuscomplete且evidence为空测试失败却声称实现完成statuscomplete且tests_passedFalse跳过错误信息skip error messages忽略警告ignore warnings——4、5、6 合并为存在 errors/warnings 却标记 complete隐瞒失败hide failures使用不确定措辞描述中出现probably、maybe、should work、might work。对应单测覆盖齐全tests/unit/test_self_check.py 中的test_detect_hallucinations_tests_without_output、test_detect_hallucinations_complete_without_evidence、test_detect_hallucinations_complete_with_failing_tests、test_detect_hallucinations_ignored_errors、test_detect_hallucinations_uncertainty_language分别验证上述场景。测试与工具链集成pytest 插件如何挂钩自审框架通过 pytest 插件把自审与反思流程嵌入日常测试src/superclaude/pytest_plugin.py入口注册于 pyproject.toml 的pytest11注册自定义 markerself_check要求证据的实现后验证、reflexion错误学习与预防、confidence_check执行前置信度评估、complexity(level)提供 fixturesself_check_protocol、reflexion_pattern、token_budget、pm_context等测试中可直接注入使用pytest_runtest_makereport钩子带reflexionmarker 的测试失败时自动构造error_info测试名、文件、异常类型、消息、traceback并调用reflexion.record_error()实现测试失败即自动沉淀教训。集成测试示例可见 tests/unit/test_self_check.py 的test_self_check_marker_integration与 tests/unit/test_reflexion.py 的test_reflexion_marker_integrationtests/unit/test_reflexion.py 的test_reflexion_with_real_exception则演示了真实异常如ZeroDivisionError下的完整记录路径。运行示例命令为uv run pytest -m unituv 环境或pytestpip 环境需先安装本项目。与相关 Agent / 命令的协作边界Self Review Agent 并非孤立运作。在原文档约束下它把结果交还给 SuperClaude Agent 做最终用户回复即它只做验收与证据核验不直接向用户汇报。与之配套的还有/sc:reflect命令plugins/superclaude/commands/reflect.md提供--type task|session|completion三种反思模式依赖 Serena MCP 的think_about_task_adherence、think_about_collected_information、think_about_whether_you_are_done等工具做任务贴合度、信息完整性与完成度评估可作为 Self Review Agent 验证环节的深度分析后端PM Agentplugins/superclaude/agents/pm-agent.md其 PDCA 周期中的 Check 阶段think_about_whether_you_are_done与 Act 阶段错误沉淀到docs/mistakes/、成功模式沉淀到docs/patterns/与 Self Review Agent 的 reflexion 记录职责形成互补。最佳实践总结结合原文档与源码可将 Self Review Agent 的用法浓缩为以下要点时机固定每次实现波次结束立即启用不拖延、不跳步证据硬约束测试必须附命令与输出lint/类型检查等 validation 证据缺一不可杜绝凭感觉放行四问全过才放行测试、需求、假设、证据四项校验任何一项缺失都标记为未完成主动暴露残余风险用⚠️显式列出未覆盖的边界与缓解方向而非隐藏错误即知识缺陷出现时立即通过record_error()写入solutions_learned.jsonl与mistakes/文档让错误签名在未来命中时零成本复用解决方案定向修复剩余问题只给针对性动作不整单重开控制修复成本。这套实现后自检 证据校验 反思沉淀的闭环正是 SuperClaude Framework 把 AI 编码助手从能干活推进到可验收、可复盘、可进化的工程化基础设施之一。【免费下载链接】SuperClaude_FrameworkA configuration framework that enhances Claude Code with specialized commands, cognitive personas, and development methodologies.项目地址: https://gitcode.com/gh_mirrors/su/SuperClaude_Framework创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

基于NSGA-II的水电光伏多能互补优化调度与MATLAB实现

基于NSGA-II的水电光伏多能互补优化调度与MATLAB实现

1. 项目概述与优化调度问题拆解1.1 水电-光伏多能互补到底在解决什么先说一个我做了无数次实验后最有感触的点:水电和光伏搭配,不是简单把两个电源的出力曲线加在一起就能完事。光伏出力受太阳辐照度、温度、云层遮挡影响,一天之内波动极大&a…

2026/9/20 6:59:06 阅读更多 →
LibreChat+MCP:构建企业级AI Agent调度中枢

LibreChat+MCP:构建企业级AI Agent调度中枢

1. LibreChat 不是另一个 ChatGPT 界面,而是 Agent 生态的「操作系统雏形」LibreChat 这个名字刚出现时,很多人下意识把它当成又一个开源版 ChatGPT Web UI——毕竟它长得确实像:左侧对话列表、中间聊天窗口、右上角模型切换下拉框。但如果你…

2026/9/20 6:59:06 阅读更多 →
FSD自动驾驶方案拆解:感知、规划、仿真与验证全解析

FSD自动驾驶方案拆解:感知、规划、仿真与验证全解析

简介:这份《特斯拉FSD自动驾驶方案深度解析》文档,面向自动驾驶研发工程师、算法研究员及对智能驾驶技术栈感兴趣的学习者,系统拆解了FSD从感知、规控到执行的全链路软硬件架构。内容覆盖规划、神经网络、训练数据、训练基础设施、AI编译与推…

2026/9/20 6:59:06 阅读更多 →

最新新闻

3套制作高端网页对比评测:告别改需求拖一周

3套制作高端网页对比评测:告别改需求拖一周

3套制作高端网页对比评测:告别改需求拖一周 改个需求建站公司拖一周,这种憋屈感做过项目的人都懂。明明只是换个按钮颜色,对方却让你等三天,最后发来的链接还是上周的版本。这时候,光靠嘴皮子催进度没用,你得拿出硬碰硬的 对比评测 数据,用专业规范说话。 很多设计师转前端,或者独立开发者在做 制作高端网页…

2026/9/20 7:44:52 阅读更多 →
Android开机动画替换的正确姿势:App如何协同系统完成定制

Android开机动画替换的正确姿势:App如何协同系统完成定制

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 7:44:23 阅读更多 →
用 10 分钟跑起 Lucky:端口转发与 DDNS 部署到首次使用

用 10 分钟跑起 Lucky:端口转发与 DDNS 部署到首次使用

用 10 分钟跑起 Lucky:端口转发与 DDNS 部署到首次使用 【免费下载链接】lucky 软硬路由公网神器,ipv6/ipv4 端口转发,反向代理,DDNS,WOL,ipv4 stun内网穿透,cron,acme,rclone,ftp,webdav,filebrowser 项目地址: https://gitcode.com/GitHub_Trending/luc/lucky …

2026/9/20 7:44:23 阅读更多 →
QQ空间历史说说怎么保存?3 步跑通 GetQzonehistory 完整教程

QQ空间历史说说怎么保存?3 步跑通 GetQzonehistory 完整教程

QQ空间历史说说怎么保存?3 步跑通 GetQzonehistory 完整教程 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory GetQzonehistory 是一个 Python 小工具,通过模拟登录…

2026/9/20 7:44:23 阅读更多 →
GetQzonehistory:如何完整备份QQ空间全部历史说说(5步教程)

GetQzonehistory:如何完整备份QQ空间全部历史说说(5步教程)

GetQzonehistory:如何完整备份QQ空间全部历史说说(5步教程) 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory GetQzonehistory 是一个免费的开源 QQ空间…

2026/9/20 7:44:23 阅读更多 →
Swagger UI 在线验证指南:为什么字段会标红,3 步让错误变绿

Swagger UI 在线验证指南:为什么字段会标红,3 步让错误变绿

Swagger UI 在线验证指南:为什么字段会标红,3 步让错误变绿 【免费下载链接】swagger-ui Swagger UI is a collection of HTML, JavaScript, and CSS assets that dynamically generate beautiful documentation from a Swagger-compliant API. 项目地…

2026/9/20 7:44:23 阅读更多 →

日新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/19 23:01:36 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/19 17:50:38 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →