如何读懂MingLi-Bench评测报告从整体准确率到12大命理类别的完整指南【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-BenchMingLi-Bench 是一个面向大语言模型LLM的中国传统命理评测基准专门考察模型在八字四柱与紫微斗数推理上的表现。跑完一次评测后你会得到一份包含整体准确率、类别细分、响应时间的报告。这篇文章将手把手教你读懂这份 MingLi-Bench 评测报告先看全局指标再逐项拆解 12 大命理类别最后学会下钻到单题定位问题。一、先搞懂评测在测什么MingLi-Bench 的题目全部采用四选一选择题形式以与标准答案完全一致作为评分标准。题库来自全球算命师大赛 2022–2025 年度赛题共160 道题覆盖 4 个年份原始题面存放在 data/raw/ 中。评测的核心设计是将排盘与推理两个环节解耦data/data.json —— 整理后的 160 道选择题每题都标注了类别婚姻、事业、财运等data/fortune_api_results.json —— 借助排盘引擎预先排好的 32 组八字 / 紫微斗数命盘按case_id命主索引与题目关联。开启--astro参数后命盘信息会直接注入提示词让分数反映推理能力而非排盘能力。 官方建议始终开启--cot思维链与--astro注入命盘这也是解读报告时最需要确认的前提条件。二、评测报告三件套先找对文件每次运行都会在输出目录默认logs/下生成三类文件这是读懂 MingLi-Bench 评测报告的起点文件内容适合谁看model_results.json每道题的预测结果、打分与整体统计需要二次分析的数据党model_summary.txt核心指标摘要人类可读快速了解结论推荐第一站model_responses/每道题的模型原始响应独立成文件想逐题复盘推理过程的人报告由 mingli_bench/benchmark.py 中的统计逻辑生成摘要文本对应_generate_summary()方法。三、摘要速读4 个核心指标一次看懂打开summary.txt结构非常固定从上到下依次是1. 运行配置SettingsSettings: CoTTrue, AstroTrue, Yearall, ShuffleOptionsFalse 读报告的第一步是看这行CoT / Astro 开关、评测年份、是否打乱选项顺序。不同配置下跑出的分数不可直接横向比较这是新手最容易踩的坑。2. 整体结果Overall ResultsTotal Questions: 160 Correct Answers: 58 Errors: 0 Overall Accuracy: 36.25%Overall Accuracy整体准确率就是答对题数 ÷ 总题数是报告的头号指标Errors是 API 调用或解析失败的题目数若不为 0先修环境问题再谈分数。3. 类别细分Category Breakdown这是下一节的重点先睹为快Category Breakdown: ----------------- 婚姻 : 47.73% (21/44) 事业 : 40.00% (10/25)4. 性能指标Average Response Time平均每题耗时与Total Evaluation Time总耗时用来评估模型的实际调用成本。四、逐项拆解12 大命理类别怎么看题库将 160 道题划分为12 大类别各类别的实际题量如下可通过python -m mingli_bench.cli --stats随时核对类别题量关注点婚姻44占比最大权重最高事业25职场与生意判断家庭22六亲关系推断健康17疾病与手术事件性格14性情特质分析财运13得财、投资、负债学业11学历与考试子女6生育与子女情况外貌3外形推断运势2阶段性强弱灾劫2意外与灾祸事件官非1诉讼纠纷解读技巧有三条看权重婚姻类 44 题占了总分的 27.5%一个类别的表现足以拉动整体准确率解读时优先看大题量类别看小样本陷阱官非、运势、灾劫类各只有 1–2 题对错题 1 道准确率就从 0% 跳到 50%小类别分数波动大不要过度解读做差值对比整体准确率 36% 的模型若婚姻类达到 60% 而财运仅 15%说明模型对感情宫位推理尚可、对财帛宫薄弱——这正是逐项分析的价值所在。类别统计的计算逻辑位于 mingli_bench/benchmark.py 的_calculate_statistics()按category字段分组分别累计total、correct再算出accuracy correct / total。五、进阶操作下钻单题与横向对比下钻单题responses/目录中每道题一个文件包含题目、选项、完整 Prompt、模型回复、预测答案与正确性标注。发现某类别失分集中时挑 2–3 道错题通读模型推理链就能判断是排盘理解错误还是断事逻辑错误。按类别单独评测用--categories参数只跑某一类例如python -m mingli_bench.cli --model openai/gpt-4o --categories 婚姻 财运 --cot --astro按年份单独评测--year 2024只测某年度赛题可观察模型在不同年份题目上的稳定性。横向对比多个模型各自产出summary.txt后把Overall Accuracy 12 类别表拼成一张对照表即可得到一张清晰的命理推理能力排行图。需要本地运行的话克隆仓库git clone https://gitcode.com/gh_mirrors/mi/MingLi-Bench按 README_zh.md 配置.env中的 API 密钥即可。数据加载与年份/类别过滤的实现可参考 mingli_bench/data/loader.py。六、常见问题 FAQQ1整体准确率 36% 算高还是低随机瞎猜是 25%四选一所以任何显著高于 25% 的分数都说明模型具备一定的命理知识。把 25% 当作基准线来读报告会更直观。Q2为什么两次跑分不一样检查Settings行——温度、CoT、命盘注入、选项是否打乱任一不同都会影响分数另外模型版本更新也会导致分数漂移。Q3Errors 非 0 会影响准确率吗会的。失败的题目按答错计入分母建议先调低--max-workers并发数重试拿到干净的分数再做分析。总结读懂 MingLi-Bench 评测报告只需四步核对运行配置 → 看整体准确率 → 逐项分析 12 大命理类别 → 下钻单题定位失分原因。掌握了这套读法你不仅能看懂单一模型的命理推理能力还能在多个大模型之间做出有依据的横向比较。【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考