PostHog ReviewHog 验证器模型实验成本账解析:Sonnet 5 网关用量表(N1 运行)全解读
PostHog ReviewHog 验证器模型实验成本账解析Sonnet 5 网关用量表N1 运行全解读【免费下载链接】posthog:hedgehog: PostHog is the leading platform for building self-driving products. Our developer tools – AI observability, analytics, session replay, flags, experiments, error tracking, logs, and more – capture all the context agents need to diagnose problems, uncover opportunities, and ship fixes. Steer it all from Slack, web, desktop, or the MCP.项目地址: https://gitcode.com/GitHub_Trending/po/posthog本文以products/review_hog/eval/experiments/2026-08-validator-model-sol/runs/N-sonnet5-validator-1.gateway_usage.md为骨架结合该实验的 PLAN、FINAL_REPORT、运行详情与统计脚本完整还原一次 ReviewHog 验证器模型对比实验N1 运行Sol 评审器 Sonnet 5 验证器的 AI 网关用量与成本构成并说明这份用量表是如何从 Kafka 中的$ai_generation事件逐级聚合出来的以及它在整个验证器模型选型决策中扮演的证据角色。这张表是什么一次运行、546 个 LLM 调用的成本账N-sonnet5-validator-1.gateway_usage.md是 PostHog ReviewHog 评估实验2026-08-validator-model-sol中 N1 运行arm Nclaude-sonnet-5验证器的网关用量汇总表。文件只有一张表但它是对该运行窗口内546 条消息、546 个$ai_generation事件的忠实压缩stage familymodelcallsinputcache readoutputreasoninggateway $effortblind-spotgpt-5.6-sol919,229,2458,661,14453,26641,570$6.80xhighdedupclaude-sonnet-5110,487010,9960$0.13xhighperspective_selectionclaude-sonnet-515,98101,6440$0.03xhighreviewgpt-5.6-sol26828,795,66727,282,987118,01485,662$19.32xhighvalidationclaude-opus-4-86672,583554,4838,1420$1.22xhighvalidationclaude-sonnet-517924,572,66823,553,035212,3660$9.31xhigh把 calls 列相加91 1 1 268 6 179 546与首行scanned 546 messages完全对账把成本相加$6.80 $0.13 $0.03 $19.32 $1.22 $9.31 $36.81恰好等于 FINAL_REPORT.md 中 N1 的网关总额review $19.32 blind-spot $6.80 validation $10.53 one-shots $0.16。这份自洽性正是该用量表作为权威成本证据的价值所在。实验背景为什么要给验证器模型算这笔账这张表来自 PostHog 在 2026-08-25/26 进行的GPT-5.6 Sol 是否可作为 ReviewHog 验证器实验目录2026-08-validator-model-sol。实验要回答的问题记录在 PLAN.md 开头能否用gpt-5.6-solCodex 多轮会话在更低成本、更短时间下不损失裁决质量地取代 Claude Opus 作为验证模型实验采用同一冻结 PR#75215 a7fb363、同一分块pinned chunks、零评论洁净室的受控设计评审器一律为 Sol xhigh仅更换验证器变量形成多个对照臂arm Lclaude/claude-opus-5/xhigh生产 pins运行 L1/L2arm Mcodex/gpt-5.6-sol/xhigh/full-access运行 M1/M2arm N本表所属claude/claude-sonnet-5/xhigh/ None运行 N1/N2arm P评审器降为medium、验证器为 Opus 5运行 P1/P2。其中 N1 的完整运行参数见同目录 N-sonnet5-validator-1.md评审器codex / gpt-5.6-sol / xhigh验证器 pins 为claude / claude-sonnet-5 / xhigh / None单块门限 400 / 目标 300 / 软上限追加 600墙钟总时长 3060 秒51 分钟。一个必须交代的插曲effort 参数曾经根本到不了 Codex用量表中effort一列全为xhigh这本身是实验的一个关键修复成果。FINAL_REPORT.md 的 The effort pin never reached Codex 一节指出早期 K1/K2/K3 运行中尽管配置把验证器 pin 在xhigh/max网关记录到的每个gpt-5.6-sol调用却都是$ai_effortlow——因为posthog/agent的 Codex 适配器在collaborationModeForTurn()中只携带{ model }未携带reasoning_effortCodex 便回退到其目录中该模型的默认 effortlow。修复PR #88893一行改动经本地 smoke 验证后fix-smoke.gateway_events.json 中 12 个 Codex 调用全部为xhigh后续 L/M/N/P 各臂才真正跑在钉住的 effort 上。N1 表中effort全列为xhigh正是effort 修复已生效在网关侧的旁证。逐列解读每个字段都对应一个网关事件属性这张表的每一列都能在 gateway_events.json7646 行、546 个事件中找到来源而事件字段的提取规则定义在生成脚本 kafka_ai_usage.py表列事件属性properties键含义stage family$ai_stage归类issues-review*→ reviewblind-spots*→ blind-spotvalidation*→ validation其余按原始 stage 名model$ai_model实际调用的模型名如gpt-5.6-sol、claude-sonnet-5calls计数该 (stage family, model) 组合下的事件条数input$ai_input_tokens输入 token 总数不含缓存命中部分cache read$ai_cache_read_input_tokens命中缓存读取的输入 token 数output$ai_output_tokens输出 token 总数reasoning$ai_reasoning_tokens推理 token 数仅gpt-5.6-sol有值Claude 两行均为 0gateway $$ai_total_cost_usd网关按 LiteLLM 费率算出的美元成本effort$ai_effort请求携带的 reasoning effortlow/medium/xhigh/max从 gateway_events.json 的事件样本可以看到原始形态每个事件记录ts毫秒时间戳、stage、model、session$ai_session_id、in/cache_read/out/reasoningtoken 数、cost以及keys本实验中恒为[$ai_effort, $ai_reasoning_tokens]。例如issues-review-p1-c1阶段同一session的多次调用首调in41740无缓存命中随后的调用in42017, cache_read41737——同一会话内上文被缓存复用成本从 $0.17 降到 $0.02 量级。数据如何采集直接从本地 Kafka 读$ai_generationFINAL_REPORT.md 专门说明了为什么用网关事件而非 agent 日志本地 ingestion 消费者阻塞personhog :50052导致$ai_generation事件滞留在 Kafka topicevents_plugin_ingestion_ai因此实验直接读取该 topic。脚本 kafka_ai_usage.py 的用法TOPICevents_plugin_ingestion_ai RUN_START_EPOCHepoch RUN_END_EPOCHepoch OUTjson \ python products/review_hog/eval/experiments/2026-08-validator-model-sol/scripts/kafka_ai_usage.py脚本用offsets_for_times定位时间窗口起始偏移消费到end_ms 120s为止过滤event $ai_generation随后做两级聚合先按(stage, model)、再按(stage_family, model)并输出与用量表完全一致的 Markdown 表格脚本第 92-97 行的输出格式就是这张表。FINAL_REPORT 还强调此前用 agent 日志估算的方法usage_from_logs.py已删除每轮只取最后一个 LLM 调用低估了 3–4 倍只有网关事件能看到每一次 LLM 调用这才是权威口径。N1 运行的全景漏斗、耗时与验证器裁决用量表回答花了多少钱N-sonnet5-validator-1.md 则回答这些钱买到了什么。漏斗与成本chunksreview unitsraw issuesafter deduppassed validator413272216review units 每个 (perspective|blind-spot × chunk) 的沙箱评审次数是模型持有成本恒定的代理指标缓存感知花费窗口内无遗漏的$ai_generation事件可能发往云项目或尚未摄取。各阶段墙钟耗时stagedurationfetch snapshot0schunking0sperspective selection19sreview wave (perspectives)17m 55sblind-spot sweep8m 14sdedup (incl. combine/clean)1m 45svalidation22m 30s其中评审阶段总时长selection → 最后一个 finder 单元wave blind-spot 26m09s是评审器模型速度对比的指标各阶段耗时取自工件created_at完成后持久化仅对全新的、非断点续跑有参考意义。分块chunking4 个块共 22 个文件分别覆盖 ReviewHog 后端/前端生成代码、Stamphog 后端facade、tasks、temporal、logic/reviewer.py、tools/pr-approval-agent/的评审器实现以及products/stamphog/的文档。验证器裁决结果22 条 dedup 后发现 → 16 条保留NA.score.md 给出了量化评分| | real | not real | | - | ---- | -------- | | kept | 8 | 8 | | dropped | 3 | 3 |保留中真实率precision8/16 50%真实发现保留率recall8/11 73%非真实发现剔除率3/11 27%值得注意的裁决细节均来自 N1 运行详情与 NA.score.md 的对应条目保留了真实问题如initial path does not verify that the task produced the PRmust_fix安全、Initial inbox reviews trust a caller-controlled PR URLmust_fix、Webhook linkage trusts a user-writable PR URLmust_fixN1 的 new real issue NA11等误删了 3 条真实发现包括must_fix的 The carve-out accepts any bot identityNA5与 Bind the carve-out to the fetched PRNA22以及should_fix的 Stamphog ignores opted-in secondary reviewersNA13——这正是 FINAL_REPORT 指出的 Sonnet 5N1 里被删的多半是真的保留了 8 条非真实发现broker/重试加固类cluster 58、无作用域find_task_run查找cluster 39、队列时刻 togglecluster 31等已知弱主张家族在 N2NB.score.md 所在目录中甚至一条非真实发现都没剔除。横向对比八个运行、三个验证器、单位裁决成本把 N1 放到整个实验的成本矩阵里看xhigh_summary.md 的八运行汇总表指标L1 (Opus 5)L2 (Opus 5)M1 (Sol)M2 (Sol)N1 (Sonnet 5)N2 (Sonnet 5)findings judged232219202222kept111218181622kept-real (precision)9/11 (82%)8/12 (67%)11/18 (61%)12/18 (67%)8/16 (50%)11/22 (50%)real-kept (recall)9/12 (75%)8/11 (73%)11/12 (92%)12/13 (92%)8/11 (73%)11/11 (100%)not-real dropped9/11 (82%)7/11 (64%)0/7 (0%)1/7 (14%)3/11 (27%)0/11 (0%)validation cost (gateway)$24.35$23.42$13.62$15.97$10.53$11.72cost per verdict$1.06$1.06$0.72$0.80$0.48$0.53几点源自网关数据的解读N1 的验证器成本全貌 表中两行 validation 之和claude-sonnet-5179 次调用 $9.31 claude-opus-4-86 次调用 $1.22 $10.53。后者是 Sonnet 5 会话自己派生的 Opus 4.8 子代理调用PLAN.md 明确记录 6claude-opus-4-8sub-agent calls $1.22——做任何按模型的成本拆分都必须把这类子代理调用计入验证器名下Sonnet 5 是最便宜的验证器$0.48–0.53/裁决约为 Opus 的一半比 Sol 还低约三成缓存命中率极高validationsonnet输入 24.57M token 中 23.55M 来自 cache read≈96%review 阶段同样如此说明多轮会话的上下文复用对成本曲线影响巨大——这也是网关缓存感知计费口径LiteLLM 费率$0.40/M cache read比朴素 token 计费更能反映真实账单的原因但便宜不等于划算Sonnet 5 与 Sol 一样几乎什么都保留N2 22/22 全保留非真实剔除率 0%而 Opus 5 剔除 64–82% 的非真实发现。盲评argumentation_judge_N_vs_L.json中 Opus 20 胜、Sonnet 2 胜、7 平。结论这张表在决策链上的位置FINAL_REPORT.md 的最终建议与这张成本账直接对应验证器保持 Opus——Sol xhigh 与 Sonnet 5 xhigh 的成本优势~30% 与 ~50%不足以弥补其几乎不剔除非真实发现的质量短板评审器值得以 xhigh 上线——effort 修复#88893落地后Sol 评审器每运行真实发现提升到 11–13 条低 effort 时仅 3–4 条并找到 8 个此前 18 次评审未报告过的真实问题代价是 ~$26/运行review blind-spot368–373 次网关调用与 25–35 分钟评审阶段若 xhigh 价格是障碍medium是退路~$10.50/运行、真实发现 7 条、评审阶段 12–14 分钟。N1 这张用量表正是支撑上述结论的三块证据之一质量评分、盲评、网关成本它让Sonnet 5 便宜一半从一个印象变成一个可对账的数字。如何在仓库中复现与继续阅读复现成本口径在 flox 环境、仓库根目录、可达localhost:9092的前提下用 kafka_ai_usage.py 按运行起止 epoch 重新拉取同一 topic 的事件并重算聚合表跨运行汇总summarize_runs.py 接收S:label参数如NA:N-sonnet5-validator-1把 findings 的 truth 判定与网关成本合并输出验证器混淆 评审侧 各阶段成本汇总表逐事件明细本运行的 546 个事件全部保留在 N-sonnet5-validator-1.gateway_events.json可按session还原每个多轮会话的完整调用链实验全貌运行日志见 PLAN.md含 L1 首跑的 8/8 隧道断流事故与重试/并发缓解、K1错误树教训等结论与建议见 FINAL_REPORT.md八运行完整评分表见 findings/xhigh_summary.md。【免费下载链接】posthog:hedgehog: PostHog is the leading platform for building self-driving products. Our developer tools – AI observability, analytics, session replay, flags, experiments, error tracking, logs, and more – capture all the context agents need to diagnose problems, uncover opportunities, and ship fixes. Steer it all from Slack, web, desktop, or the MCP.项目地址: https://gitcode.com/GitHub_Trending/po/posthog创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Jupyter中matplotlib保存图片空白?用gcf()解决导出问题

Jupyter中matplotlib保存图片空白?用gcf()解决导出问题

简介:这份PDF文档围绕Jupyter Notebook中的文件读写与图片处理展开,面向Python数据分析初学者及需要快速上手交互式编程的读者。内容以精简的代码示例贯穿,介绍通过pandas的read_csv读取CSV文件、使用matplotlib的imread和imshow加载并展示图…

2026/9/18 22:50:51 阅读更多 →
基于 .doc 商业策划书模板的自动化文档生成与批量填充方案

基于 .doc 商业策划书模板的自动化文档生成与批量填充方案

简介:这份商业策划书精品模板面向创业者、初创团队及需要撰写融资材料的商务人士,帮助解决从零搭建商业计划书框架、梳理投资逻辑与呈现项目价值的问题。资源包内含1个doc文档,压缩包约52KB,以Word格式呈现,便于直接编…

2026/9/18 22:50:51 阅读更多 →
给 OpenClaw 配好 TaoToken 通道后,Ollama 本地模型还能当 fallback

给 OpenClaw 配好 TaoToken 通道后,Ollama 本地模型还能当 fallback

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/18 22:50:51 阅读更多 →

最新新闻

智慧矿山数据中台建设:从编码统一到冷热分层实战

智慧矿山数据中台建设:从编码统一到冷热分层实战

简介:这套70页PPT是一份面向煤矿行业信息化建设者、智慧矿山项目规划人员与方案架构师的完整解决方案,系统梳理了智慧矿山数据中台及管控一体化平台的建设路径。内容从煤矿行业背景切入,列举神东、陕北等13个亿吨级煤炭能源基地,对…

2026/9/19 0:55:03 阅读更多 →
BMAD-METHOD 入门完全指南:Agile AI 驱动开发的 BMad 方法与模块生态

BMAD-METHOD 入门完全指南:Agile AI 驱动开发的 BMad 方法与模块生态

BMAD-METHOD 入门完全指南:Agile AI 驱动开发的 BMad 方法与模块生态 【免费下载链接】BMAD-METHOD Breakthrough Method for Agile Ai Driven Development 项目地址: https://gitcode.com/gh_mirrors/bm/BMAD-METHOD BMad Method(BMAD-METHOD&am…

2026/9/19 0:55:03 阅读更多 →
IDEA中Git回退远程提交的完整指南:Reset与Revert实战

IDEA中Git回退远程提交的完整指南:Reset与Revert实战

1. 回退这件事,为什么在IDEA里做最容易翻车先说个真实场景。你负责的模块今天要上线,下午三点发现一个紧急bug,你改了十几行代码,IDEA里一顿操作,Commit、Push一气呵成。结果五分钟后测试在群里喊:远程代码…

2026/9/19 0:55:03 阅读更多 →
Arbess集成GitLab实现Java项目Gradle自动化构建与主机部署

Arbess集成GitLab实现Java项目Gradle自动化构建与主机部署

接到一台新构建机,我第一件事不是装环境,而是先把Arbess和GitLab之间的通道打通。原因很简单:如果代码都拉不下来,后面Gradle构建、主机部署全都是空话。很多Java团队卡在自动化这一步,不是因为不会写build.gradle&…

2026/9/19 0:55:03 阅读更多 →
Transformer-LSTM混合模型在股票择时中的对比实验与PyTorch实现

Transformer-LSTM混合模型在股票择时中的对比实验与PyTorch实现

简介:在金融量化交易研究不断深化的背景下,这份PDF围绕Transformer-LSTM混合模型在股票择时策略中的对比实验展开,适合量化研究员、金融方向研究生以及对机器学习选股感兴趣的开发者阅读。文档共42页,完整覆盖从LSTM与Transformer…

2026/9/19 0:55:03 阅读更多 →
VS Code C语言环境配置:MinGW-w64编译器与gdb调试实战

VS Code C语言环境配置:MinGW-w64编译器与gdb调试实战

VS Code 现在几乎是绝大多数人接触 C 语言时的第一个编辑器,但它本身只是个编辑器,真正把.c文件变成能跑的程序的是编译器。我见过太多新手卡在“装完了却跑不起来”这一步,问题基本都不在代码上,而在于工具链没搭对、路径没配好、…

2026/9/19 0:54:02 阅读更多 →

日新闻

BP神经网络时序预测:滑窗长度与多窗口平均策略

BP神经网络时序预测:滑窗长度与多窗口平均策略

简介:面向机器学习、深度学习与数据建模学习者的一份完整研究文献,聚焦BP神经网络在农业产量预测中的应用。文档以1980—2018年全国棉花产量为样本,系统讲解数据归一化处理、激活函数原理、多层神经网络结构搭建及训练流程,展示敏…

2026/9/19 0:00:30 阅读更多 →
Transformer训练实时监控实战:基于MindSpore的损失曲线可视化方案

Transformer训练实时监控实战:基于MindSpore的损失曲线可视化方案

上个月调一个Deformable DETR模型,在单卡上要跑将近两天。第二天早上我下意识打开终端翻日志,发现loss从凌晨两点就开始往上爬,一路从0.8涨到1.35,整整六个小时没人发现。那六个小时的训练不仅白跑,还霸占着卡——等于…

2026/9/19 0:00:30 阅读更多 →
OpenCloud 中的 Go 类型安全转换库 spf13/cast:从零值回退到泛型 API 的完整实战指南

OpenCloud 中的 Go 类型安全转换库 spf13/cast:从零值回退到泛型 API 的完整实战指南

OpenCloud 中的 Go 类型安全转换库 spf13/cast:从零值回退到泛型 API 的完整实战指南 【免费下载链接】opencloud 🌤️ OpenCloud is the open source platform for file management, sharing and collaboration. Simple and sovereign. 项目地址: htt…

2026/9/19 0:00:30 阅读更多 →

周新闻

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验 【免费下载链接】ai The AI Toolkit for TypeScript. From the creators of Next.js, the AI SDK is a free open-source library for building AI-powered applications and ag…

2026/9/16 19:03:19 阅读更多 →
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化

Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化 【免费下载链接】refine A React Framework for building internal tools, admin panels, dashboards & B2B apps with unmatched flexibility. 项目地址: https://gitcode.com/GitH…

2026/9/17 7:57:36 阅读更多 →
Flutter应用改名全指南:从Android到iOS的配置与工具实践

Flutter应用改名全指南:从Android到iOS的配置与工具实践

刚接一个外包项目时,甲方要求把工程里临时用的应用名改成正式产品名。我本来觉得“改名”这种小事,打开配置文件改一行不就完了?结果真动手才发现,Flutter项目里“应用名称”根本不是一处配置,而是一整套散落在 Androi…

2026/9/17 10:19:14 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/16 22:31:27 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/15 21:39:18 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/16 22:32:59 阅读更多 →