【免费下载链接】Phocinae-Largha-150M-v1项目地址https://ai.gitcode.com/hf_mirrors/Phocinae/Phocinae-Largha-150M-v1点击查看免费下载本篇以figures/目录的图表目录文档为核心逐图讲解 Phocinae-Largha-150M-v1144.3M 参数的斑海豹 Largha 决策模型发布材料中 10 张基准图各自编码的指标、测量协议与出处并结合仓库内的 BENCHMARKS.md、calib/、docs/deployment.md 等文档与配置给出每张图数字的完整证据链与完整性校验方法。读完你可以独立核对任意一张图的来源、复现其数字并理解它们如何支撑 README 与 Model Card 中的公开声明。图 1 · C1_typed_acc_comparisontyped-decisions 主基准精度对比en 0.906 / zh 0.848README 封面缩略图图 2 · C7_routing_savingsE1 置信度门τ0.6路由节省效果图 3 · C10_hardware_tiers硬件三档4 GB 无 GPU → 3060 级 → RTX 50901. 目录构成与生成管线figures/目录是本次发布的静态图表资产仓库原始目录文档figures/README.md对其定位是 chart assets。其中包含10 个编号图系列 C1–C10另含 C4 的分家族拆分图 C4b每个系列同时提供PNG内联用 SVG矢量用成对文件渲染宽度 600–800 px官方斑海豹 Logologo_phocinae.pngREADME 记载其 1900×1900 源文件为logo_phocinae_official_20261008.png随发布准备材料留存一张动画演示S22_flip_invariance.gif选项顺序不变性演示与 docs/gallery/ 场景编号体系对应完整性清单figures/SHA256SUMS覆盖目录内全部 25 个文件11 组 PNG/SVG、logo、S22 GIF 及 README 本身。生成管线方面目录文档明确说明所有图表由发布准备工作区release-prep workspace内部路径09_常态探索/release_prep_20261007/08_发布材料_20261007/不随仓库分发中的脚本统一生成。该工作区路径只存在于上游发布流程本仓库内不可见——但从各图数字与 BENCHMARKS.md 完全一致这一点看可以推断渲染脚本的输入就是该文件的发布数值表。值得注意的是 MODEL_CARD.md 与 README.md 的修订历史2026-10-09 v1.1 refresh均记载权重升级后figures/ 与 gallery/ 全部重新渲染即当前图表对应 v1.1 权重model.safetensorssha256b6472511eea30729985374f43968cf7f4b16bbe0827de6c6ca07cf92afbb778a2026-10-09 评测。2. 完整图表清单下表完整继承原目录文档的清单file / content / used in并补充数据出处一列指向每张图数字所在的仓库文档文件内容原目录文档描述仓库内被引用处数据出处C1_typed_acc_comparisontyped-decisions 精度 vs Laya / JEV / meraGPTen 0.906 · zh 0.848README.md · BENCHMARKS.md · MODEL_CARD.mdBENCHMARKS.md §1C2_latency_comparison延迟 p50同一 40-case 协议——GPU fp16 单决策RTX 5090CPU/API 单 casePhocinaeCPU 单线程 ~1.64 s/caseREADME.md · BENCHMARKS.mdBENCHMARKS.md §2C3_flip_robustness选项顺序翻转率越低越好BENCHMARKS.mdBENCHMARKS.md §3C4_jevbench/C4b_jevbench_familiesJevBench public-231——总分 分档0.5455gate 未通过· 分家族得分BENCHMARKS.mdBENCHMARKS.md §4C5_calibrationECE——发布列 0.2519 / 0.1941随附 calib 列 0.0168 / 0.0152BENCHMARKS.mdBENCHMARKS.md §6、calib/README.mdC6_bilingual双语并排展示README.md · BENCHMARKS.mdBENCHMARKS.md §7C7_routing_savingsE1 escalate 门acc 0.906→0.9936LLM 调用 −55.0%README.md · docs/cost-savings.mddocs/cost-savings.md、BENCHMARKS.md §5C8_params_vs_latency144.3M 参数 / 288.6 MB / 1.6 GB 显存README.md · BENCHMARKS.mdBENCHMARKS.md §9C9_zh_anchor中文锚点——0.855 vs Kimi K3 0.72200 条翻译决策BENCHMARKS.mdBENCHMARKS.md §7C10_hardware_tiers硬件档位4 GB → RTX 5090docs/deployment.mddocs/deployment.md §1logo_phocinae.png官方斑海豹 LogoREADME.md · README.zh.md—3. 逐图深读指标、协议与证据链3.1 C1 · typed-decisions 精度对比C1 是主基准图。协议为每个 case 一段state 有类型的问题noul是非 /choice单选 /score2–10 评分逐决策判分en 测试集为400 cases × 5 decisions 2000 decisionszh 为同一批 case 的机器翻译。发布数值v1.1 权重2026-10-09 评测模型en 精度zh 精度备注Phocinae-Largha-150M-v10.9060.848144.3M 参数 · 专家模型在 train split 上拟合Laya 421M0.766—专家模型按对方 model card· 自测原生接口分card choice 包装口径 0.737JEV-27B0.727—通用模型zero-shot按对方 model cardmeraGPT0.768—通用模型zero-shot按对方 model card证据纪律有两点值得注意其一项目方自己做了冷重跑——独立复测得0.9055en/ 0.848zhCPU fp32与官方 0.906 / 0.848 并列展示差异 ≤1 个决策归因于 fp16↔fp32 噪声BENCHMARKS.md §1其二leaderboard 口径的补充指标为 KL from gold0.0548· Brier0.0248· ECE0.2519这些按基准方自身计分约定提交与calib/的逐面 Brier 有意不同不同 domain/convention。3.2 C2 与 C8 · 延迟与参数量级C2 对比同一 40-case 协议下的 p50 延迟C8 展示参数量级与资源占用。发布延迟表BENCHMARKS.md §2路径p50说明GPU fp16单决策RTX 509021.0 ms发布值端到端含 tokenize forward 答案组装CPU 单线程单 case5 决策一次通过1.64 s端到端CPU 8 线程 batch8–20 decisions/sb1 → 19.7b32 → 8.4CPU 8 线程 2000 行 mega-batch6.8–8.5 decisions/s需较大内存C8 对应的资源事实144.3M 参数精确 144,292,870原始张量求和一致、fp16 safetensors 288.6 MB、推理峰值约1.6 GB 显存 / 1.8 GB 内存。架构细节可在仓库根 config.json 中逐一核对hidden_size 384×num_hidden_layers 22×num_attention_heads 6vocab_size 256000max_position_embeddings 8192layer_types呈 full_attention sliding × 2 每 3 层一组的全局/滑窗混合local_attention 128RoPE θ160000——与 MODEL_CARD.md 所述 RoPE 滑窗 全注意力混合 一致。3.3 C3 · 选项顺序翻转鲁棒性C3 度量 选项重排后答案是否改变flip 率越低越好。主表为 CPU fp32、空闲机器、双重复现2026-10-09协议翻转率flip150 反转300 items0.02006/300flip400 反转600 items0.021713/600随机重排 3-seed 均值0.01443 种重排任一翻转0.0283参考值不同设备/协议不作主声明GPU fp16 空闲 0.0200/0.02171k 行 4-perm 0.0181/0.0150/0.0331。直观含义是大约每 ~46 次选项重排才会出现一次答案变化对照 MODEL_CARD.md 的诚实披露优于 Jev~9%与 Laya 域外19.4%但相对 Laya 域内3.7%仅 1.5 pp 差距不应单独依赖顺序不变性。工程侧的缓解手段已在运行时提供docs/deployment.md 记载环境变量PHOC_PERM_AVG1会对 choice 问题在 4 种选项顺序上取平均对应 docs/protocol.md 的/v1/systemone/permute端点响应中routing.perm标记为avg-k4。3.4 C4 与 C4b · JevBench public-231C4 是总分 分档图C4b 是逐家族得分。这是仓库中 诚实披露 的代表该协议为held-out训练从未接触任何评测行。指标数值overall micro0.5455126/231acceptance gate 58.4%未通过tier easy0.916744/48tier original0.500036/72tier hard0.414446/111tool_selectionk≤101.012/12docs/reproduce.md 还补充分家族 macro 为 0.5226。C4b 把 0.5455 拆到各任务家族方便读者看到强弱分布该数字在 MODEL_CARD.md 的 honest disclosure 章节被明确列为已知局限。3.5 C5 · 校准 ECE 与可选 calib/ 列C5 对比两条置信度列的 ECEExpected Calibration Error项ECEen / zh说明发布列shipped column0.2519 / 0.1941温度0.8660205 / 0.8081192 / 0.6624661choice/score/noul存于模型仓库配置 rl_agent_config.json由 phocinae-server 在推理时应用随附校准列calib/power transform γ0.0168 / 0.0152opt-in默认不启用代价是 Brier 上升en 0.0207→0.1218zh 0.0333→0.0961calib/列的实现是一个每决策幂变换calib/calibrate.py 核心仅数行def apply_gamma(probs: dict, gamma: float 1.0) - dict: # q ∝ p ** gamma逐决策、幂后归一化 if gamma 1.0: return dict(probs) powered {k: (max(float(v), 0.0) ** gamma) for k, v in probs.items()} s sum(powered.values()) if s 0: raise ValueError(apply_gamma: all probabilities are zero) return {k: v / s for k, v in powered.items()}推荐列 en γ4.33、zh γ2.512026-10-08 拟合seed 2026100825% held-out 向全网格 ECE argmin 收缩NLL 护栏 calibrated ≤ raw 0.01 满足见 calib/README.md。由于变换单调argmax 与 noul 的 0.5 阈值判定不变因此所有精度数值不变——只改置信度形状这是理解 C5 时最关键的一点。3.6 C6 与 C9 · 双语与中文锚点C6 是 en/zh 精度并排图0.906 / 0.848C9 是中文跨域锚点Largha 0.855 vs Kimi K3 0.72E5-zh同一批 200 条翻译决策Kimi K3 为自测值。关于 zh 口径必须继承 BENCHMARKS.md §7 的定性zh 评测使用机器翻译 case而训练混合中包含机器翻译中文约 2,400 行与原生中文约 1,400 行——即in-mix拟合过评测不是零样本跨语言迁移。3.7 C7 · E1 escalate 路由节省C7 是成本主张的核心图τ0.6 置信度门下保留集精度0.906 → 0.99360.0876LLM 调用100% → 45.0% 上抛−55.0%τ0.5 档为 79.6%。完整 τ 扫描发布权重 部署温度列官方集 2,000 决策证据文件exp/refresh_v1_20261009/tau_r4/tau_sweep_r4.jsonτ上抛比例节省 LLM 调用保留集精度0.403.2%96.8%0.91530.4510.0%90.1%0.93340.5020.4%79.6%0.95230.60默认45.0%官方集扫描55.0%0.99360.7065.0%35.0%0.99860.8077.0%23.0%1.0000.9086.1%13.9%1.000docs/cost-savings.md 特别强调−79.6% 与 τ0.6 不能同时成立55.0% 对应冻结默认 τ0.679.6% 对应 τ≈0.50保留集 0.9523两个阈值都真实可调。该文档的算例给出货币化口径每月 10,000 条路由决策、τ0.6 时约 4,500 次 LLM 调用按 Claude Sonnet 5 公开牌价约合$4.1/月而全部走 LLM 的基线约 $9.1/月——约 55% 的成本削减与调用削减一致牌价估算token 计数因分词器不同有 ±30% 误差。同时 BENCHMARKS.md 保留了诚实披露在上抛子集上外部模型JEV 1.13.0实测 0.5933低于本地同子集 0.7989收益依赖外部模型在困难样本上的能力旧权重时代的 0.7948 / −82% / 18% 声明已废弃不得引用。3.8 C10 · 硬件档位C10 对应 docs/deployment.md §1 的三档配置表档位内存存储GPU预期性能Baseline尝鲜4 GB 可用8 GB无需每 case ~1.5–1.7 sCPU 单线程1 case 5 决策加载 ~4 sMinimum全效8 GB20 GBSSD/NVMe≥4 GB 显存GPU 21.0–60 ms/决策RTX 3060 级 30–60 ms8 GB 显存 21.0 msRTX 5090 实测纯 CPU 8 线程 8–20 decisions/sRecommended日用16 GB32 GB 宽裕512 GB NVMe8 GB 消费卡运行其他应用时 GPU 21.0 msRTX 5090–25 ms/决策文档同时注明前提21.0 ms 是高端 GPU 的 fp16 p50CPU 单线程应按 ~1.64 s/case 预算或用 8 线程 batch权重 288.6 MB推理峰值 ~1.6 GB 显存 / ~1.8 GB 内存。4. 图表完整性SHA256SUMS 与核对方式figures/SHA256SUMS 对目录内 25 个文件逐一给出 sha256例如C1_typed_acc_comparison.png→21eac700…9433f90142校验方式是在figures/目录下执行sha256sum -c SHA256SUMS。图表与权重的绑定关系是v1.1 权重 sha256b6472511eea30729985374f43968cf7f4b16bbe0827de6c6ca07cf92afbb778adocs/reproduce.md 给出三步快速验证权重哈希 → 起服务发noul/choice/score冒烟请求 → 同请求重复两次应 bit 级一致。BENCHMARKS.md 自声明为 发布数字的单一事实来源single source of truth因此核对任意图时先对数字表、再对渲染文件是完整链条。方法论备注同文件 Methodology notes本地测量默认 CPU fp32GPU 值为 fp16GPU/CPU 差异 ≤2 个决策视为 fp16↔fp32 噪声主 flip 表双重复现于 2026-10-09。5. 配套动画docs/gallery 与 S22目录文档末尾指向 docs/gallery/27 个场景 GIFS01–S24 应用场景 G25–G27 对照与可靠性统一 800×450、无限循环首帧为结论卡关键数字、末帧为一句话要点。Gallery README 明确三点约定前缀 S应用场景、G对照与可靠性全部演示为合成场景数据虚构非真实用户数据帧内数字与 BENCHMARKS.md、MODEL_CARD.md 对齐且 S04/S15/S21 中出现的阈值是演示值随附 guard 的真实阈值以 docs/deployment.md 为准。Gallery 亦有独立校验清单 docs/gallery/SHA256SUMS。figures/内另有一张S22_flip_invariance.gif演示 flip 率 0.0217 下的 选项洗牌后裁决不变与 C3 互为静态/动态两种表达。6. 快速索引图 → 文档 → 文件图主题数字所在文档关键佐证文件C1主基准精度BENCHMARKS.md §1docs/reproduce.mdC2 / C8延迟 / 参数量BENCHMARKS.md §2、§9config.jsonC3顺序翻转BENCHMARKS.md §3docs/deployment.mdPHOC_PERM_AVGC4 / C4bJevBenchBENCHMARKS.md §4MODEL_CARD.mdC5校准 ECEBENCHMARKS.md §6calib/README.md、calib/calibrate.py、rl_agent_config.jsonC6 / C9双语 / zh 锚点BENCHMARKS.md §7docs/technical-report.mdC7escalate 路由docs/cost-savings.mdBENCHMARKS.md §5C10硬件档位docs/deployment.md §1—logo / S22品牌 / 演示README.mddocs/gallery/README.md从源码结构看figures/目录本身不含任何脚本或数据纯为发布素材全部生成逻辑在上游 release-prep 工作区仓库内可核对的只有 数字 ↔ 图表 ↔ 校验和 三者的闭环。这也正是该目录文档的设计意图每张图都能回到 BENCHMARKS.md 的表格每个表格都能回到协议与证据路径docs/reproduce.md。赞分享【免费下载链接】Phocinae-Largha-150M-v1项目地址https://ai.gitcode.com/hf_mirrors/Phocinae/Phocinae-Largha-150M-v1点击查看免费下载相关推荐复现 Phocinae-Largha-150M-v1 的全部公开数字评测协议、验证步骤与证据边界完整指南复现 Phocinae Largha 150M v1 的全部公开数字评测协议、验证步骤与证据边界完整指南 本文围绕 docs/reproduce.md httJellyfin Kodi 插件打造无缝的家庭媒体中心体验Jellyfin Kodi 插件打造无缝的家庭媒体中心体验 你是否曾经想过将强大的媒体服务器与灵活的家庭影院系统完美结合Jellyfin Kodi 插件正是Phocinae-Largha-150M-v1 技术报告精读一个 144.3M 参数本地决策模型的完整工程细节Phocinae Largha 150M v1 技术报告精读一个 144.3M 参数本地决策模型的完整工程细节 本文基于仓库内正式版技术报告 docs/tec上一篇FLUX.1 Kontext Dev开源版深度解析本地部署多模态图像编辑新范式下一篇免费 Windows 11 外壳改造教程ExplorerPatcher 4 步装好任务栏开始菜单改回 Win10 样式创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考