人工智能AI 应用深度研究AI Agent自主智能体RAG多智能体后端【免费下载链接】gpt-researcherAn autonomous agent that conducts deep research on any data using any LLM providers项目地址https://gitcode.com/GitHub_Trending/gp/gpt-researcher点击查看免费下载导读本文以 gpt-researcher 仓库中 deep_agents 混合研究基准的真实语料——虚构公司 Veltrix Dynamics 的《2026 战略董事会备忘录》deep_agents/benchmark_data/internal_docs_src/board_memo_2026_strategy.md——为对象完整讲解该文档在混合研究hybrid research与私有文档检索场景中的角色、内容结构与可验证要点并对照仓库源码语料构建、Agent 装配、打分器剖析其底层原理与复现方法。读完本文你将理解内部文档 ground truth 如何被转换为 PDF 语料、如何被 deep agent 检索引用、又如何被 LLM 按事实检查点打分并能直接运行 hybrid 基准复现 87.5% 的私有事实覆盖率结论。一、文档定位一份服务于 LLM 研究的事实金矿board_memo_2026_strategy.md是 deep_agents 混合研究基准的四个 ground-truth 文档之一其余三个见下表。它模拟一家虚构的荷兰仓库机器人AMR公司Veltrix Dynamics B.V.在 2026 年 1 月由 CEO 办公室发出的内部战略备忘录内容包含市场份额、2026 优先事项、财务计划与竞争判断。之所以选择虚构公司是为了保证私有语料中的事实无法从公开互联网泄漏——这正是 hybrid 基准能测出web-only 检索 0% 私有事实覆盖率的前提。该文档在仓库中的具体作用链条是deep_agents/benchmark_data/build_corpus.py读取internal_docs_src/*.md把四份事实文档转换为真实企业文档共享盘的形态转换后的语料被deep_agents/hybrid_benchmark.py通过DOC_PATH挂载给 gpt-researcher 的 hybrid 研究管线备忘录中的关键数字被提炼为internal_checkpoints由 LLM 打分器逐条核对生成报告产出覆盖率指标。二、关联文档与配套 ground-truth 全貌deep_agents/benchmark_data/internal_docs_src/共包含四份事实文档共同构成基准的标准答案源文档相对路径转换后形态覆盖主题deep_agents/benchmark_data/internal_docs_src/board_memo_2026_strategy.mddeep_agents/benchmark_data/internal_docs/board/board_memo_2026_strategy.pdf战略、财务计划、竞争格局deep_agents/benchmark_data/internal_docs_src/company_overview.mddeep_agents/benchmark_data/internal_docs/company_overview.md公司沿革、融资、商业模式、差异化deep_agents/benchmark_data/internal_docs_src/q1_2026_ops_report.mddeep_agents/benchmark_data/internal_docs/ops/q1_2026_ops_report.pdf运营指标、事故记录、供应链、风险deep_agents/benchmark_data/internal_docs_src/vlx500_product_brief.mddeep_agents/benchmark_data/internal_docs/product/vlx500_product_brief.docx下一代产品规格与路线图转换逻辑见 build_corpus.pywrite_pdf用 pymupdf 按每页 52 行、10pt Helvetica 排版写入 PDFwrite_docx用 python-docx 逐行生成段落write_md直接落盘。脚本对干扰项HR 政策、IT 手册、营销文案等见 DISTRACTORS与陈旧近失文档2024/2025 运营报告、被取代的 VLX-500 概念稿见 STALE_OPS_2024、STALE_PRODUCT_2025做了刻意设计陈旧版本的数字与 2026 真相不同因此回答错误年代的事实会被判为 WRONG。整个语料共 27 个文件且生成是确定性的重复运行产出相同语料。三、备忘录核心内容全景四个战略板块原文共五个小节这里按文档主体与可验证要点两条线完整继承并展开。3.1 Where we win冷链护城河的量化工况备忘录开篇即给出公司在哪里赢的量化证据公司收入的61% 来自冷链frozen/chilled配送中心对应 ARR 占比冷链 RFP 的中标率 71%而常温ambient-temperatureRFP 中标率仅24%。这两组数字是整份备忘录乃至整个 Veltrix 投资叙事的核心事实检查点在 hybrid_benchmark.py 中被列为internal_checkpoints[6]。它们与 company_overview.md 中Veltrix 是唯一通过 EN 60068 认证、可在 -25°C 冷库运行的 AMR 厂商互为印证常温场景胜率不足四分之一说明公司的竞争力是垂直聚焦而非横向铺开——这是后续风险分析客户集中度、品类依赖的伏笔。3.2 2026 优先事项三项战略任务原文列出三条优先级每一条都对应后续文档中的可核验事实守住冷链护城河Q4 2026 交付VLX-500-30°C 额定目标Top 20 账户的续约扩张率达到80%。VLX-500 的 -30°C 规格、Q4 2026 时间表与 vlx500_product_brief.md950kg 载荷、2.4 m/s、11h LFP 快充、固态 LiDAR、VeltrixOS 5完全对齐构成产品路线图 checkpoint。北美扩张北美站点从14 个增至 30 个亚特兰大办公室 CSM 团队翻倍关键风险是美国客户要求 UL 3100 认证审计定于2026 年 9 月。UL 3100 作为北美准入风险在基准报告中被记为一个独立的运营/合规风险点。互操作赌注承诺采用VDA 5050 接口标准让 VeltrixOS 能编排第三方机器人是否向竞品硬件开放 VeltrixOS 需要董事会决策管理层建议开放但以 VLX-500 发布为门槛。这条策略在生成报告中通常被解读为降低多供应商客户的锁定顾虑也是评测中考察推理深度的地方。3.3 财务计划可量化可核对财务小节是全文档数字密度最高、最容易被 LLM 提取出错的部分务必逐条列出2026 营收目标$96M2025 实际$61M隐含同比增速约 57%EBITDA 盈亏平衡目标2027 年 Q32025 年末现金$91M跑道runway足以覆盖至盈亏平衡之后2027 年前无融资计划Series D 仅在 MA 场景下可选。对照internal_checkpoints[1]的完整要求Q1 2026 营收 $21.4M67% YoY、RaaS ARR $46.9M、2026 目标 $96M备忘录里的 $96M 必须与 q1_2026_ops_report.md 的季度数据一起出现才算满分——只写年度目标、漏掉季度进度会被判为 PARTIAL。3.4 竞争判断三类威胁的差异化解读管理层的竞争判断同样构成 web checkpoint 的对照基准Geek 与 Locus Robotics被列为全球主要威胁Exotec通过集成式 ASRS 交易在欧盟食品杂货grocery细分施压Amazon 自研机器人被视为市场扩容者而非直接对手。这条判断的价值在于它把内部视角与公开市场事实如 hybrid_benchmark.py 中 Geek 2025 年 7 月港交所 IPO、Locus 累计融资约 $410–440M、Exotec 累计融资约 $446M拼合起来评测报告因此可以同时考核私有事实提取与公开事实时效性两类能力。四、从 Markdown 到 PDF语料构建的源码级原理build_corpus.py中与本备忘录直接相关的核心代码是src {p.name: p.read_text(encodingutf-8) for p in SRC.glob(*.md)} write_pdf(src[board_memo_2026_strategy.md], OUT / board / board_memo_2026_strategy.pdf)两个值得注意的实现细节格式即挑战备忘录被转换为 PDF 而非保留 Markdown。这意味着纯文本读取文件工具baselinefiles 方案无法像读 MD 一样轻松抽取内容必须依赖 gpt-researcher 的格式感知解析pymupdf 提取与 embedding 检索——这正是混合方案在私有事实覆盖上拉开差距的机制之一。陈旧版本的干扰ops/archive/中的 2024/2025 运营报告、product/archive/中被取代的 VLX-500 概念稿包含同指标但不同年代的数字如 2025 概念稿的 $52,000 定价、800kg 载荷、-25°C 额定见 STALE_PRODUCT_2025。打分器对用了错误年代数字的回答一律判 WRONG因此备忘录中的 2026 版本是唯一正确的新鲜事实源。基准对三种方案的定义hybrid_benchmark.py为baseline 仅 raw Tavily web 搜索deepagents quickstart 配置baselinefiles web 搜索 把语料挂载到 deepagents 的ls/read_file文件工具gptr gpt-researcher hybrid 模式。三种方案共用完全相同的任务提示词TASK[prompt]见 hybrid_benchmark.py与 8 条内部检查点保证唯一变量是研究工具本身。五、备忘录事实如何进入基准检查点5.1 检查点的提炼规则TASK[internal_checkpoints]hybrid_benchmark.py共 8 条其中直接源自本备忘录的有 4 条另有 4 条来自配套文档checkpoint 2部分2026 revenue target $96M← 备忘录财务计划checkpoint 4部分VLX-500 于 Q4 2026 发布$56,000 定价950kg 载荷-30°C 额定← 备忘录 产品简报checkpoint 6部分客户集中度 top3 44% of ARR← 运营报告备忘录的 61% ARR 冷链占比与之互补checkpoint 7冷链护城河61% ARR 来自冷链、71% 冷链 RFP 中标率← 备忘录 Where we win 小节checkpoint 82026-02-11 固件回归事故← 运营报告备忘录未覆盖。5.2 打分器如何裁决打分逻辑位于 grade_report被 hybrid_benchmark.py 以asyncio.to_thread调用由 LLM 仅依据报告内容 vs ground truth 一致性给出CORRECT / PARTIAL / MISSING / WRONG四级判定然后按coverage (CORRECT 数 0.5 × PARTIAL 数) / 总数折算覆盖率见 coverage。这意味着备忘录中的每个数字都是有标准答案的考题——报告若写了2025 概念稿的 $52,000 定价而非常识中的 $56,000即被判 WRONG。六、三种方案的实测对比备忘录事实的提取能力差异deep_agents/benchmark_results/下已跟踪多轮 hybrid 运行产物以hybrid_2026-07-05_14-43-50.json为例方案internal_coverageweb_coveragelatency_secondsgptr_internal_cost_usdbaselineraw search0.00.37577.5—baselinefiles文件工具挂载0.5620.7598.6—gptrhybrid 模式0.9380.25180.70.3064三份基准 JSON 中 gptr 的 internal_coverage 分别为 0.938、0.875、0.875平均 87.5%最高 94%与 BENCHMARK.md 公布口径一致。值得注意的细节web-only 方案对备忘录一无所知baseline 的 internal 评分是 7 个 WRONG 1 个 MISSING报告通篇无法验证 Veltrix 存在——因为它根本看不到私有语料DIY 文件工具方案时好时坏baselinefiles 拿到 3 CORRECT 3 PARTIAL但在 PDF/DOCX 解析产品简报事实每轮都漏或取旧值、步骤预算内的文件选取上不稳定且有时会误信archive/中的陈旧版本hybrid 方案覆盖最稳gptr 拿到 7 CORRECT 1 PARTIAL8 条内部检查点备忘录的 $96M 目标、71% 冷链中标率、VLX-500 Q4 2026/-30°C 全部命中。同轮 web 侧三方案覆盖率接近约 40%–46%见 BENCHMARK.md说明 hybrid 的增益集中在私有事实而不以牺牲公开事实为代价。七、复现与扩展把备忘录换成你自己的内部文档7.1 复现 hybrid 基准前置条件Python 3.12、OPENAI_API_KEY与TAVILY_API_KEY。从仓库根目录执行pip install -r requirements.txt pip install -r deep_agents/requirements.txt python deep_agents/hybrid_benchmark.py脚本会自动把benchmark_data/internal_docs写入DOC_PATHhybrid_benchmark.py运行三臂并保存deep_agents/benchmark_results/hybrid_时间戳.json。默认模型为openai:gpt-5.4可用--model覆盖由STRATEGIC_LLM环境变量兜底见 hybrid_benchmark.py。如需重新生成语料例如修改了备忘录内容执行python deep_agents/benchmark_data/build_corpus.py脚本会重建internal_docs/并打印文件总数27。7.2 把方法论迁移到自己的文档这套机制的扩展点非常清晰语料把internal_docs_src/*.md换成你自己的事实文档build_corpus.py会按相同规则生成 PDF/DOCX/MD 混合语料internal_checkpoints需同步改写为你自己的可核验事实。研究工具hybrid 模式由 tools.py 中的deep_research工具承载——它通过GPTResearcher(query, report_typesubtopic_report, report_sourcereport_source, parent_queryparent_query)调用完整研究管线report_source在 build_research_tools 中从 task 配置闭包绑定web/local/hybrid返回带行内引用与来源列表的 markdown 报告。Agent 装配deep_agents/agent.py定义了两级研究团队——Chief Editor总编负责quick_search定范围、write_todos规划、task并行派发与 Researcher 子代理每个章节调用一次deep_research并把草稿写入sections/序号-slug.md见 CHIEF_EDITOR_PROMPT 与 RESEARCHER_PROMPTtask.json中的source: hybrid配合DOC_PATH即完成本地文档 网页的联合检索。打分器grade_reportcoverage可原样复用只需替换 checkpoints。7.3 扩展阅读完整方法论与 DeepResearch BenchRACE/FACT复现步骤deep_agents/BENCHMARK.mddeep_agents 示例整体说明架构图、任务字段、可观测性deep_agents/README.md各轮原始产物按检查点分级、裁判结论、完整报告deep_agents/benchmark_results/hybrid_2026-07-05_*.json运营数据与产品路线图配套文档q1_2026_ops_report.md、vlx500_product_brief.md、company_overview.md八、小结board_memo_2026_strategy.md看似只是一份虚构的战略备忘录实则是 gpt-researcher 私有语料研究能力的标准答案集合它定义了冷链护城河、VLX-500 路线图、财务计划与竞争判断四组事实经过build_corpus.py的格式转换与陈旧版本干扰设计后进入hybrid_benchmark.py的 8 条内部检查点最终由 LLM 打分器量化出web-only 0%、DIY 文件工具 62.5%、hybrid 87.5%最高 94%的私有事实覆盖率结论。对开发者而言理解这份文档的构造与流转就等于掌握了一条可迁移的内部文档 → 检索语料 → 事实检查 → 覆盖率评估完整链路。赞分享人工智能AI 应用深度研究AI Agent自主智能体RAG多智能体后端【免费下载链接】gpt-researcherAn autonomous agent that conducts deep research on any data using any LLM providers项目地址https://gitcode.com/GitHub_Trending/gp/gpt-researcher点击查看免费下载相关推荐私有文档事实源如何驱动混合研究Veltrix company_overview.md 与 gpt-researcher hybrid 基准的构建与复现私有文档事实源如何驱动混合研究Veltrix company_overview.md 与 gpt researcher hybrid 基准的构建与复现 导读人工智能AI 应用深度研究AI Agent自主智能体RAG多智能体后端gpt-researcher 私有文档深度研究基准解构 Q1 2026 运营报告语料与 hybrid 模式的内部事实覆盖率gpt researcher 私有文档深度研究基准解构 Q1 2026 运营报告语料与 hybrid 模式的内部事实覆盖率 本文以仓库中 q1_2026_op人工智能AI 应用深度研究AI Agent自主智能体RAG多智能体后端gpt-researcher 私有文档评测中的干扰项设计以 Veltrix 2026 营销事件日历为例gpt researcher 私有文档评测中的干扰项设计以 Veltrix 2026 营销事件日历为例 本篇技术指南聚焦于 gpt researcher 仓库人工智能AI 应用深度研究AI Agent自主智能体RAG多智能体后端上一篇Awesome PocketBase 安装与配置指南下一篇YimMenu终极指南如何在GTA5中安全使用开源辅助工具提升游戏体验创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考