QUALITY_SCORE.md 完全ガイド:エージェントファーストなリポジトリの品質追跡を実装する
QUALITY_SCORE.md 完全ガイドエージェントファーストなリポジトリの品質追跡を実装する【免费下载链接】learn-harness-engineeringHarness engineering beginner tutorial, from 0 to 1项目地址: https://gitcode.com/gh_mirrors/le/learn-harness-engineeringこの文書は、learn-harness-engineering リポジトリが提供する OpenAI アドバンストパックdocs/ja/resources/openai-advanced/に含まれるrepo-template/docs/QUALITY_SCORE.mdテンプレートを深掘りし、エージェントファーストなリポジトリで「時間とともに強くなるリポジトリ」をどう運用するかを解説する技術ガイドです。読み終えると、評価スケールの設計意図、プロダクトドメインアーキテクチャレイヤーベンチマーク単純化ログの4つの追跡表の記入方法、および AGENTS.md や RELIABILITY.md との連携による品質ループの回し方を、実装例つきで理解できます。QUALITY_SCORE.md とは何かQUALITY_SCORE.mdは、リポジトリが時間とともに強くなっているか弱くなっているかを追跡するための、リポジトリローカルな品質ダッシュボードです。冒頭の日本語コメントにある通り、このファイルは単なるスナップショットではなく、継続的な評価の記録を蓄積する仕組みとして設計されています。このファイルの存在意義は、エージェントが「今どのドメインやレイヤーが最も弱いのか」をチャット履歴や人間の記憶に頼らずに発見できるようにすることにあります。Advanced Repo Template のコピー手順docs/ja/resources/openai-advanced/repo-template/index.mdでも、AGENTS.mdとARCHITECTURE.mdをコピーした後、最初に記入すべき3ファイルのひとつとしてdocs/PRODUCT_SENSE.md、docs/QUALITY_SCORE.md、docs/RELIABILITY.mdが挙げられています。テンプレートが最適化しているもの同じ index.md には、このテンプレートが狙っている設計目標が明記されています永続的なリポジトリローカルコンテキスト巨大な単一指示ファイルではなくプログレッシブディスクロージャー段階的開示明示的なプランライフサイクル時間経過による品質追跡エージェントと人間の両方にとって読みやすい境界QUALITY_SCORE.mdはこのうち「時間経過による品質追跡」と「読みやすい境界」を担う中心ファイルです。評価スケールA〜D の4段階の意味テンプレートが定義する評価スケールは以下の4段階です評価意味原文の日本語訳実務上の解釈A検証済み、読みやすい、安定、境界が強制されている実装・検証・ドキュメントが揃い、依存ルールなどの境界が機械的チェックやテストで守られている状態B軽微なギャップはあるが動作する主要機能は動くが、テスト不足・ドキュメント欠落・境界違反の萌芽など小さな穴がある状態C部分的に動作、顕著な混乱または不安定性一部しか動かない、または設計意図が読み取れず不安定な状態D壊れている、安全でない、または構造的に不明確ビルド不能、セキュリティ上の問題、構造が破綻している状態このスケールの特徴は、「動くかどうか」だけでなく「読みやすさ」「安定性」「境界の強制」を評価軸に含めている点です。エージェントが次に作業できる状態かを判定するため、コード単体の品質より「エージェント可読性」と「再現性」が重視されています。追跡表1プロダクトドメインの健全性最初の表は、プロダクトをドメイン単位で評価しますドメイン評価検証エージェント可読性テスト安定性主要なギャップ最終更新[domain-a]------[domain-b]------[domain-c]------各カラムの記入指針は以下の通りですドメインプロダクト仕様docs/product-specs/や設計文書docs/design-docs/と対応するドメイン名を入れる。プレースホルダー[domain-a]を実プロジェクトのドメインに置き換えます。評価A〜D のスケール値。検証そのドメインが「本当に動作している」ことを示す実行可能な証拠テストコマンド、ベンチマーク結果など。コードを目視しただけでは「検証済み」にできません。エージェント可読性新しいエージェントセッションがドキュメントだけでドメインを理解できるか。テスト安定性そのドメインのテストがどの程度フレークせず安定しているか。主要なギャップ次に着手すべき穴を具体的に記録。最終更新YYYY-MM-DD 形式の日付。追跡表2アーキテクチャレイヤーの境界強制2つ目の表は、レイヤードアーキテクチャの各層を評価しますレイヤー評価境界の強制エージェント可読性主要なギャップ最終更新Types-----Services-----Runtime-----UI-----ここで注目すべきは「境界の強制Boundary Enforcement」カラムです。レイヤー間の依存ルールが「暗黙の約束」ではなく、リンターやテスト、CI などの機械的チェックで実際に守られているかを記録します。これは、docs/ja/resources/openai-advanced/sops/layered-domain-architecture.mdの SOP が扱う「レイヤードドメインアーキテクチャ」と対応しており、ARCHITECTURE.mdに記載された依存ルールが守られているかを追跡する役割を持ちます。Types → Services → Runtime → UIの4レイヤーはプレースホルダーです。実際のプロジェクトのレイヤーモデルに合わせて列を追加・変更してください。追跡表3ベンチマークスナップショット3つ目の表は、ハーネスエージェント支援環境の改良前後を定量的に比較するための記録です日付ハーネスバリアント完了率リトライレビュー前の欠陥備考YYYY-MM-DD[baseline / improved / simplified]----ハーネスバリアントbaseline素の状態、improved改良後、simplified単純化後のいずれかを記録します。単純化後に品質が下がったかどうかを判断するための比較軸です。完了率タスクセットに対する完了の割合。リトライエージェントが失敗して再試行した回数。多いほどハーネスの指示が不明確であるシグナル。レビュー前の欠陥人間のレビュー前に見つかった欠陥数。ハーネス品質の直接的な指標。この表は、ハーネスを変更した際に「良くなったか悪くなったか」を印象ではなくデータで判断するために使います。プロジェクト 01projects/project-01/README.mdが「素の状態 vs 最小ハーネス」の比較を扱っているのに対し、この表はその比較を継続的な回帰測定としてリポジトリに記録し続ける仕組みです。追跡表4単純化ログ4つ目の表は、コンポーネント削除の履歴とその結果を記録します日付削除されたコンポーネント結果決定YYYY-MM-DD[component][degraded / unchanged][restore / keep removed]結果削除後に品質がdegraded悪化したか、unchanged変わらずだったか。決定restore復元するかkeep removed削除を維持か。この表は「単純化は第一級の責務」という OpenAI アドバンストパックの設計原則docs/ja/resources/openai-advanced/index.mdを支えます。単純化は一度きりのイベントではなく、試行錯誤の記録として残すことで、将来のエージェントが「以前このコンポーネントを消して悪化した」という履歴を発見できるようにします。テンプレート全体の中での役割と連携AGENTS.md からのルーティングrepo-template/AGENTS.mdは、コード変更前のスタートアップワークフローとして以下を要求しますpwdでリポジトリルートを確認するARCHITECTURE.mdを読むdocs/QUALITY_SCORE.mdを読み、どのドメインやレイヤーが最も弱いかを確認するdocs/PLANS.mdを読み、アクティブプランを開くdocs/product-specs/の関連仕様を読む標準ブートストラップと検証パスを実行するベースライン検証が失敗している場合、スコープ追加前に修復するつまりQUALITY_SCORE.mdは、エージェントが「どこに手を付けるべきか」を決める最初の入力として設計されています。ルーティングマップではdocs/QUALITY_SCORE.md: プロダクトドメインとレイヤーの健全性と明記されており、短いAGENTS.mdから深いドキュメントへ段階的に開示プログレッシブディスクロージャーする構造の要です。セッション終了時の更新義務同じ AGENTS.md の「セッションの終了」セクションには、セッションを終える前にアクティブな実行プランを更新するドメインやレイヤーに意味のある変更があった場合、docs/QUALITY_SCORE.mdを更新する先送りした負債はdocs/exec-plans/tech-debt-tracker.mdに記録する終了したプランはdocs/exec-plans/completed/に移動する次のアクションが明確な再起動可能な状態でリポジトリを残すQUALITY_SCORE.mdの更新は「独立したクリーンアップ日」ではなく、通常の作業の一部として行うことが運用ルールですdocs/ja/resources/openai-advanced/index.mdの導入方法にも同旨の記載あり。RELIABILITY.md との関係docs/RELIABILITY.mdは「システムが正常で再起動可能であることをどう証明するか」を定義するファイルで、信頼性ルールとして以下を定めていますシステムがクリーンに再起動できない場合、機能は完了とみなされないランタイム障害はリポジトリローカルのシグナルから診断可能であるべき繰り返される障害モードが現れた場合、ベンチマークまたはガードレールを追加するクリーンアップは信頼性の一部であり、別個の関心事ではないQUALITY_SCORE.mdの「検証」「テスト安定性」カラムと、RELIABILITY.mdの「ゴールデンジャーニー反復可能な検証パスと明確な失敗シグナルを持つ主要フロー」は相互補完関係にあり、品質評価と稼働証明を同じ文書群に閉じ込めています。実装例Project 06 の quality-document.md から学ぶ実践パターンこのテンプレートの実運用イメージは、projects/project-06/solution/quality-document.mdキャップストーンプロジェクト「Runtime Observability and Debugging」の品質文書が具体例として参考になります。同文書では、QUALITY_SCORE.md の「ドメイン」に相当する次元ごとに評価を付与しています次元評価注記抜粋Build CompileAクリーンなコンパイル、エラー・警告なしFeature CompletenessA15機能すべて実装・パスStructured LoggingAJSON 形式、ログレベル、サービスタグ、全サービスのデータペイロードQA with CitationsA8つの回答パターン、キーワード検索、信頼度スコアPersistenceA全データ型が再起動後も永続Clean State ResetA確認付き完全リセット、べき等Test CoverageBビルド時チェックはパス、ランタイム検証はベンチマークスクリプト経由BenchmarkingAimport/index/query のタイミングを含む完全タスクスイートOverall Grade: Aとして総括され、以下のような証拠Evidence of Qualityが列挙されていますビルドnpm run checkがクリーンにパス、npm run buildが正しい出力を生成、bash init.shが全ファイルの存在を検証ランタイム構造化 JSON ログが初回起動から出力、インポートがメタデータを作成、バッチ索引が全ドキュメントを処理、QA が引用付きで接地回答を返す観測性すべての IPC チャネル呼び出しがログされるqa:askは confidence / citationCount / answerLength / durationMs を記録パフォーマンスサンプルデータドキュメント3件インポート200ms、バッチ索引100ms、引用付きクエリ300ms、クリーンリセット20msさらに「Verified Against」セクションで、clean-state-checklist.md30チェックすべてパス、evaluator-rubric.md総合 5.0/5、feature_list.json15/15 機能が status passという実行可能な検証証跡へのリンクを張っています。この例が示す実践パターンは次の通りです評価は主観ではなく証拠に紐づけるグレードの横に、どのチェックリスト・ルーブリック・ベンチマークで確認したかを必ず書く。カラムの粒度はプロジェクトに合わせて変えるテンプレートの「ドメイン」を、プロジェクトの機能次元に読み替えて適用してよい。B 評価も正直に残すTest Coverage が B のように、完全でない次元を残すことで「次に何をすべきか」が見える。QUALITY_SCORE.md を運用するための実践ステップステップ1初期記入リポジトリ立ち上げ時Advanced Repo Template のコピー順序docs/ja/resources/openai-advanced/repo-template/index.mdに従い、AGENTS.mdとARCHITECTURE.mdをルートにコピーし、docs/ツリー全体をコピーしたら、最初にPRODUCT_SENSE.md、QUALITY_SCORE.md、RELIABILITY.mdを記入します。初期状態では全セルが「-」でも構いません。重要なのはフォーマットを決めておくことです。ステップ2プレースホルダーの置換[domain-a]等を実際のプロダクトドメインに置き換えるレイヤー表をARCHITECTURE.mdのレイヤーモデルと一致させるベンチマーク表の[baseline / improved / simplified]を実際のハーネスバリアント名に合わせるステップ3作業のたびに更新するエージェントのワーキングコントラクトAGENTS.mdにある通り、動作を変更した場合は同じセッションで対応するプロダクト・プラン・信頼性の文書を更新します。品質文書もその例外ではありません。「最終更新」カラムの日付を必ず今日の日付にします。ステップ4繰り返すフィードバックは機械的ルールへ昇格AGENTS.md のワーキングコントラクトには「繰り返しのレビューフィードバックが見られた場合、チャットで再説明するのではなく、機械的なルール、チェック、またはリンターに昇格させる」とあります。QUALITY_SCORE.mdで同じギャップが繰り返し出現するようであれば、それはドキュメント更新ではなくリンターやテストで境界を強制するべきシグナルです。この判断は「境界の強制」カラムに記録されます。よくある落とし穴と対処一度書いて放置するQUALITY_SCORE.md は静的スナップショットではなく履歴の蓄積です。日付つきで更新し続けないと、AGENTS.md のスタートアップワークフローが参照する「最も弱い領域」の情報が古くなります。評価だけ書いて証拠を書かないA〜D のグレードだけ並べても、エージェントは次に何をすべきか判断できません。「検証」「テスト安定性」「主要なギャップ」を具体的に埋めます。単純化ログを付けないコンポーネントを消した履歴が残っていないと、将来のエージェントが同じ失敗を繰り返します。削除したら必ず結果と決定を記録します。他の文書と矛盾させるARCHITECTURE.mdのレイヤー名とQUALITY_SCORE.mdのレイヤー表が食い違うと、エージェントの信頼を損ないます。SOP「目に見えないナレッジをリポジトリにエンコードする」docs/ja/resources/openai-advanced/sops/encode-knowledge-into-repo.mdの原則「同じ事実が矛盾する複数のファイルに散らばっていない」ことを維持します。まとめQUALITY_SCORE.md がもたらすものQUALITY_SCORE.mdは、単なる「品質スコア表」ではなく、エージェントファーストなリポジトリにおける品質のシステム・オブ・レコードです。ドメイン・レイヤー・ベンチマーク・単純化の4つの視点でリポジトリの健全性を時系列で記録し、AGENTS.mdのルーティング層から常に参照されることで、「今どこが弱いか」をチャット履歴なしに発見できる状態を作り出します。RELIABILITY.md再起動可能性の証明、PLANS.mdとexec-plans/プランライフサイクル、tech-debt-tracker.md先送り負債の記録と組み合わせることで、「作業 → 検証 → 評価更新 → 次の着手点の発見」という品質ループがリポジトリ内部に閉じて回り始めます。Project 06 の quality-document.md が示すように、評価のたびに実行可能な証拠へのリンクを張り、未達の次元を正直に残すことこそが、時間とともに強くなるリポジトリの土台です。【免费下载链接】learn-harness-engineeringHarness engineering beginner tutorial, from 0 to 1项目地址: https://gitcode.com/gh_mirrors/le/learn-harness-engineering创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

AI推理网关路由架构与策略实践:应对多模型调用混乱

AI推理网关路由架构与策略实践:应对多模型调用混乱

做AI推理网关这件事,说白了就是一句话:当你的大模型后端从一两个变成七八个,调用入口必须有一个统一的路由架构,把流量按策略分到最合适的推理服务上。这篇是“大模型推理优化系列”的第一篇,我会把AI推理网关的路由架…

2026/9/24 21:09:13 阅读更多 →
AI推理网关实战:从负载均衡到推理感知的路由架构与策略

AI推理网关实战:从负载均衡到推理感知的路由架构与策略

把大模型推理服务真正推到生产环境之后,最先发现的一个尴尬事实是:模型跑得动,流量却管不住。我之前部署过一套基于vLLM的服务,多个模型、多个副本挂在集群里,前端只放了一个常规Nginx做负载均衡,结果线上并…

2026/9/24 21:09:13 阅读更多 →
企业RAG知识库从零搭建:切块、表格入库、多轮对话与服务商选型全攻略

企业RAG知识库从零搭建:切块、表格入库、多轮对话与服务商选型全攻略

上个月一个做设备制造的客户找我,说想在公司内部上一套AI知识库系统,手头有几百份设备手册、质检规范、历史工单,员工每次查资料都要翻半天,新人培训更是折磨。他说得直白:“我就想让员工像聊天一样,直接问…

2026/9/24 21:09:13 阅读更多 →

最新新闻

Ekko Studio docx Skill 源码级解析:Word 修订(Tracked Changes)与批注(Comments)的 WordprocessingML 处理

Ekko Studio docx Skill 源码级解析:Word 修订(Tracked Changes)与批注(Comments)的 WordprocessingML 处理

AI 应用人工智能AI Agent本地部署前端后端工作流自动化 【免费下载链接】ekko-studio Ekko Studio is a local-first AI workspace for multi-agent chat, coding, and visual workflows, available on desktop and the web. 项目地址: https://gitcode.com/gh_mirr…

2026/9/24 22:02:05 阅读更多 →
Java Swing 黄金矿工小游戏:抓钩状态机与碰撞检测实战

Java Swing 黄金矿工小游戏:抓钩状态机与碰撞检测实战

简介:这是一份基于Java实现的黄金矿工小游戏完整源码包,面向Java初学者、课程设计学生以及想通过经典小游戏练手的开发者,帮助读者理解Swing图形界面、游戏循环、碰撞检测与资源加载等核心机制。压缩包共30个文件,约141KB&#xf…

2026/9/24 22:02:05 阅读更多 →
体育馆场地预约系统开发实战:微信小程序+Django+Flask架构解析

体育馆场地预约系统开发实战:微信小程序+Django+Flask架构解析

体育馆场地预约平台开发手记:从电话排队到小程序一键订场做体育馆场地预约系统,最早是因为一个朋友在高校体育部上班,天天被电话轰炸:羽毛球场地有没有?今晚七点的场子被人占了能不能调?隔壁单位想包场怎么…

2026/9/24 22:02:05 阅读更多 →
GPT-Live-1+Agora构建AI会议助手实战指南

GPT-Live-1+Agora构建AI会议助手实战指南

1. 这不是“又一个AI聊天框”,而是一个能真正坐在会议室里干活的数字同事GPT‑Live‑1 Agora 实战教程:做一个能参会、操作看板的 AI 助手——这个标题里藏着三个被多数人忽略的关键动作:“能参会”、“操作看板”、“实战教程”。它不讲大模…

2026/9/24 22:02:05 阅读更多 →
全栈AI修图Agent实战:从架构设计到模型调度与踩坑记录

全栈AI修图Agent实战:从架构设计到模型调度与踩坑记录

“又一个新项目完结”——这句话说出口的时候,我终于能把“全栈 AI 修图 Agent”从待办列表里划掉了。这个项目从立项到交付,前后差不多一个多月,期间推翻过一版架构,也踩了不少模型和前后端的坑。如果你最近也在折腾 AI 全栈项目…

2026/9/24 22:02:05 阅读更多 →
如何挑选靠谱的AI创业项目机构?资源评估与避坑实操指南

如何挑选靠谱的AI创业项目机构?资源评估与避坑实操指南

想找靠谱的AI人工智能创业项目机构,我建议你先把“找机构”这三个字放一放。过去两年我陪不少团队聊过孵化器、加速器、产业平台,见过真给资源的,也见过把“AI”当挂件的。这篇文章不吹不黑,聊聊什么样的AI创业机构值得进、怎么判…

2026/9/24 22:01:05 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →