Harvey LAB架构揭秘:三阶段评估管线深度解析与新手入门指南
Harvey LAB架构揭秘:三阶段评估管线深度解析与新手入门指南【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LABLegal Agent Benchmark是一个开源的法律 AI 智能体基准测试项目用于在真实法律工作场景中评估大模型 Agent 的能力。它的核心是一条清晰的三阶段评估管线Run智能体干活→ EvaluateLLM 裁判打分→ Report报告与对比看板。本文将带你从零理解这条法律智能体评估管线的完整架构帮助新手快速跑通任意一个法律任务评测。 先懂架构:一个文件系统优先的评测基准Harvey LAB 的设计哲学非常简单:没有数据库没有 Web 服务架构详情见 docs/architecture.md。任务放在tasks/目录运行结果放在results/目录报告生成为静态 HTML 文件浏览器直接打开数据集包含1,660 个任务、24 个法律执业领域含合同场景、约101,000 条评分标准覆盖企业并购、知识产权、税务、破产重组、数据隐私等方向每个任务就是一个目录一份task.json指令 交付物清单 评分标准加一个documents/文件夹模拟案卷资料。例如tasks/corporate-ma/review-data-room-red-flag-review/ ├── task.json # 任务指令、交付物、68条评分标准 └── documents/ # 60份模拟数据室文件这种目录即任务的模型让任务 ID 天然对应路径如 tasks/ 下的corporate-ma/review-data-room-red-flag-review或嵌套场景real-estate/extract-psa-key-terms/scenario-01。阶段一 · Run:智能体读卷宗、写交付物运行入口是一条命令harness/run.py 负责全部调度uv run python -m harness.run \ --model anthropic/claude-sonnet-4-6 \ --task corporate-ma/review-data-room-red-flag-reviewHarness 会加载任务文件、共享系统提示词harness/system_prompt.md以及harness/skills/下的 docx、xlsx、pptx 技能手册然后启动 harness/agent_loop.py 中的智能体循环模型响应 → 执行工具调用 → 结果回填 → 继续直到模型不再调用工具没有显式的结束工具。智能体拥有 6 个封闭工作区工具工具用途bash在工作区执行 Shell 命令read读取 .docx / .xlsx / .pptx / .pdf / 文本write写入交付物到输出目录edit精确替换文件内容glob/grep按模式查找文件 / 正则搜索内容两个关键设计让这条管线既安全又可移植沙箱隔离每次运行都在独立的 Podman 容器中执行无网络、丢弃全部权限文档目录只读、输出目录可写攻击性内容在容器内解析详见 sandbox/README.md模型适配器harness/adapters/ 下统一实现了 Anthropic、OpenAI、Google、Mistral、Fireworks 等供应商接口换模型只需改--model参数运行结束后results/run-id/下会留下完整案底config.json配置、transcript.jsonl逐轮对话追踪、metrics.jsontoken/耗时/工具统计和output/交付物。阶段二 · Evaluate:LLM 裁判的 All-Pass 打分这一步是 Harvey LAB 评估策略最有特色的部分方法论见 docs/eval-strategies.mduv run python -m evaluation.run_eval \ --run-id run-id \ --task corporate-ma/review-data-room-red-flag-review① 没有标准答案文件。每条评分标准criterion的match_criteria字段本身就是一句什么样的输出算通过、什么算不通过的描述例如若智能体识别出关键客户合同包含控制权变更同意条款则 PASS……。评分逻辑在 evaluation/scoring.py裁判实现在 evaluation/judge.py提示词模板见 evaluation/prompts/rubric_criterion.txt。② 逐条独立评判 范围隔离。裁判默认 claude-sonnet-4-6温度 0.0每次只看一条标准和该条声明的交付物文件避免串味且每条判定都附带推理记录存入scores.json。③ All-Pass 二元计分score 1.0全部标准通过 否则 0.0这听起来严苛但在法律场景中一份只抓到 95% 问题的尽调备忘录漏掉的那个关键风险可能致命——管线回答的核心问题正是智能体多常做到全对。同时scores.json会记录n_passed / n_criteria作为诊断指标告诉你差多远。④ 可选双裁判模式加--dual参数即可用 Sonnet 4.6 GPT-5.5 独立双评并取均值适合正式对比场景。阶段三 · Report:从单份成绩单到模型对比看板评分完成后会自动生成report.html——包含总分、逐条判定理由、文档覆盖率、裁判模型等信息是快速定位模型漏了什么的最快途径evaluation/report.py。当同一任务跑过多个模型后对比看板evaluation/compare.py就是终极输出uv run python -m evaluation.compare --all看板汇总All-Pass 率、标准通过率、逐条标准热力图、文档覆盖率、token 用量、延迟和估算成本——一张图看清各模型在法律真实工作上的差距。⚡ 一条命令跑通三阶段:Sweep 批量评测手动三步走只是起点。utils/sweep.py 可以把模型 × 任务矩阵一次跑完先预检任务与评分标准再并行执行智能体然后有界并发地评估、生成报告uv run python -m utils.sweep \ --task corporate-ma --models sonnet --parallel 4任务粒度很灵活all跑全部任务、corporate-ma跑整个执业领域、real-estate/extract-psa-key-terms跑该工作流下所有场景、或指定到单个任务。还支持--dry-run只看计划不烧 token、--eval-only只重评分、--report-only只重生成报告。 新手四步上手清单获取项目并初始化环境git clone https://gitcode.com/GitHub_Trending/ha/harvey-labs cd harvey-labs ./scripts/setup.sh配置 API 密钥在仓库根目录.env中写入ANTHROPIC_API_KEY必需裁判默认用 ClaudeOPENAI_API_KEY、GOOGLE_API_KEY可选跑一个任务先uv run python -m utils.describe_task task-id看懂任务再执行阶段一运行命令评分 对比执行阶段二评估命令最后uv run python -m evaluation.compare --all查看全局看板完整带截图式的操作示例含 20 分钟走查流程请阅读 docs/tutorial.md。 关键模块速查你想了解看这里整体架构与任务模型docs/architecture.md评估方法论与裁判机制docs/eval-strategies.md端到端教程docs/tutorial.md智能体循环harness/agent_loop.py评分逻辑evaluation/scoring.py沙箱威胁模型sandbox/README.md批量评测utils/sweep.py总结Harvey LAB 用文件系统优先 三阶段管线回答了如何严肃评估法律 AI 智能体Run 阶段让智能体在沙箱里处理真实复杂度的案卷Evaluate 阶段用 LLM 裁判逐条、语义化、可追溯地打分Report 阶段把单次成绩单沉淀为可横向对比的模型看板。对新手而言记住一条主线即可harness.run干活 →evaluation.run_eval打分 →evaluation.compare看榜——三个命令就是完整的法律智能体评测闭环。【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

QQ空间备份完整指南:用 GetQzonehistory 一键导出全部历史说说和图片到Excel

QQ空间备份完整指南:用 GetQzonehistory 一键导出全部历史说说和图片到Excel

QQ空间备份完整指南:用 GetQzonehistory 一键导出全部历史说说和图片到Excel 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 打开手机刷QQ空间,2016 年的说说早已…

2026/9/20 14:03:40 阅读更多 →
catlass_cppgen 完整指南:3 步生成 CATLASS 高性能算子代码

catlass_cppgen 完整指南:3 步生成 CATLASS 高性能算子代码

catlass_cppgen 完整指南:3 步生成 CATLASS 高性能算子代码 【免费下载链接】Yi A series of large language models trained from scratch by developers 01-ai 项目地址: https://gitcode.com/GitHub_Trending/yi/Yi 手写一个高性能 GEMM 核函数&#xff0…

2026/9/20 14:03:40 阅读更多 →
NemoClaw 维护者状态文件(state.json)Schema 全解析:维护循环的持久化状态设计与实践

NemoClaw 维护者状态文件(state.json)Schema 全解析:维护循环的持久化状态设计与实践

NemoClaw 维护者状态文件(state.json)Schema 全解析:维护循环的持久化状态设计与实践 【免费下载链接】NemoClaw Run agents like Hermes, LangChain Deep Agents, and OpenClaw more securely inside NVIDIA OpenShell with managed inferen…

2026/9/20 14:03:40 阅读更多 →

最新新闻

Mac 上安装 Claude Code 完整指南:环境配置与避坑实践

Mac 上安装 Claude Code 完整指南:环境配置与避坑实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 18:09:12 阅读更多 →
Cadence 17.2 Allegro 改一段走线线宽总选错?让 Codex 走 TaoToken 对照 Cline segs 与 Clines

Cadence 17.2 Allegro 改一段走线线宽总选错?让 Codex 走 TaoToken 对照 Cline segs 与 Clines

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 18:09:12 阅读更多 →
树莓派系统文件深度解析:config.txt、cmdline.txt与设备树实战

树莓派系统文件深度解析:config.txt、cmdline.txt与设备树实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 18:09:12 阅读更多 →
OpenRouter 用量榜:TaoToken 上跑 Kimi K2.7 Code 选哪条通道

OpenRouter 用量榜:TaoToken 上跑 Kimi K2.7 Code 选哪条通道

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/20 18:09:12 阅读更多 →
把 .assets 变成 FBX 和 PNG:AssetRipper 免费 Unity 资源提取实操教程

把 .assets 变成 FBX 和 PNG:AssetRipper 免费 Unity 资源提取实操教程

把 .assets 变成 FBX 和 PNG:AssetRipper 免费 Unity 资源提取实操教程 【免费下载链接】AssetRipper GUI application to analyze game files 项目地址: https://gitcode.com/GitHub_Trending/as/AssetRipper AssetRipper 是一款免费的 Unity 资源提取 GUI …

2026/9/20 18:09:12 阅读更多 →
MicroPython pyboard 入门指南:硬件布局、供电方式与首次上电

MicroPython pyboard 入门指南:硬件布局、供电方式与首次上电

嵌入式语言运行时编程语言解释器编译器物联网系统编程 【免费下载链接】micropython MicroPython - a lean and efficient Python implementation for microcontrollers and constrained systems 项目地址: https://gitcode.com/gh_mirrors/mi/micropython 点击查看…

2026/9/20 18:08:11 阅读更多 →

日新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/20 0:00:46 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/20 0:00:46 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/20 0:00:46 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/19 23:01:36 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/19 17:50:38 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →