Laya RL Agent 评估指南:In-task / Zero-shot 指标、校准温度与延迟的源码级解读
人工智能机器学习强化学习NLP内容安全【免费下载链接】laya项目地址https://ai.gitcode.com/hf_mirrors/convaiinnovations/laya点击查看免费下载本文以仓库 eval/results.md 的评估报告为骨架系统解读 Laya 非自回归决策模型RL Agent在In-task任务族内与Zero-shot任务族完全留出两种评估协议下的精度、校准ECE / Brier / NLL与延迟表现并结合 rl_common.py、rl_agent_api.py 及 rl_agent_config.json 等源码与配置文件讲清每项指标的计算方式、校准温度的作用与延迟数据的真实含义。读完本文你将能看懂这份成绩单的每一列、每一行并能用仓库自带工具在自己数据上复现同样的评估流程。一、评估总览一份校准后的完整成绩单eval/results.md记录的是一套**校准后after calibration**的评估结果。所谓校准是指模型原始输出的概率分布经过温度缩放后让置信度与真实正确率对齐——这正是 ECEExpected Calibration Error期望校准误差等指标要量化的东西。评估分两条线In-task在训练中出现过的任务族上评测共 13 个任务族、23,024 个问题与 eval/results.json 中questions_evaluated.eval_in: 23024一致Zero-shot训练时完全留出的任务族task families held out of training entirely共 4 个任务族、2,400 个问题eval_zs: 2400。每条评估线都给出四类指标accuracy准确率、ECE校准误差、NLL负对数似然以及汇总行的Brier 分数与50% 覆盖率下的准确率。指标的具体计算方式在第四节结合源码展开。二、In-task 评估13 个任务族的完整指标eval/results.md的 In-task 部分如下数值与eval/results.json中by_task_family.eval_in一一对应task familyquestionsaccuracyECENLLconversation outcomes36000.4820.0190.693email triage26910.7320.0170.595emotion and tone18250.9060.0180.238inference and fact checking30220.8830.0540.340instruction-following tasks6000.8780.0460.302intent and routing14750.9910.0090.181moderation and safety27080.9670.0610.153reading comprehension7700.8470.0830.409response quality scoring31460.5810.0231.009robustness checks7440.8510.1081.058search relevance7330.6280.0660.728sentiment and rating9610.4420.4383.545topic classification7490.9390.0290.196Overall: accuracy 0.753, ECE 0.030, Brier 0.308, accuracy at 50% coverage 0.947几点值得注意的观察强项集中在结构化决策任务intent and routing0.991、moderation and safety0.967、topic classification0.939、emotion and tone0.906表现突出且 ECE 普遍较低0.009–0.061说明这些任务上模型既准又知道自己有多准。弱项对应主观、长尾任务sentiment and rating0.442最弱且 ECE 高达 0.438、NLL 高达 3.545——意味着该任务上模型的置信度与正确率严重脱节conversation outcomes0.482、response quality scoring0.581也明显低于均值。准与校准不一定同步robustness checks准确率尚可0.851但 ECE 0.108 是全表偏高的几个之一reading comprehension也有类似情况ECE 0.083。这说明对这些任务族模型高置信区间内混入了相当比例的错误样本恰恰是需要置信度门控或人工复核的场景。三、Zero-shot 评估完全留出的任务族eval/results.md的 Zero-shot 部分对应by_task_family.eval_zstask familyquestionsaccuracyECENLLemotion and tone6000.5830.3181.976instruction-following tasks6000.8630.0450.319moderation and safety6000.7970.1711.415sentiment and rating6000.3620.2911.798Overall: accuracy 0.651, ECE 0.204, Brier 0.532, accuracy at 50% coverage 0.818Zero-shot 的定位是泛化性探针这 4 个任务族在训练中完全未出现因此所有成绩都来自模型对任务形式的先验理解而不是对训练数据的记忆。对比 In-task准确率整体下滑0.753 → 0.651其中emotion and tone从 0.906 掉到 0.583sentiment and rating从 0.442 掉到 0.362校准显著恶化ECE 从 0.030 升到 0.204Brier 从 0.308 升到 0.532。可靠性图见上文第二张图中零样本曲线的蓝色数据点在低置信度区间明显偏离完美校准对角线——模型在零样本场景下过度自信的倾向更明显instruction-following tasks是例外0.863 / ECE 0.045与 In-task 表现0.878 / 0.046几乎持平说明该任务族的泛化能力扎实。结论很清楚Laya 在未见过的任务族上保持可用精度但概率可信度需要重新校准后再投入生产。这也呼应了仓库 README 中先在自己的数据上重拟合温度、再信任概率的建议。四、核心指标怎么算源码级解读这些指标并非黑盒全部可以在 rl_common.py 中找到实现ECE期望校准误差按置信度分箱默认 15 个箱子对每个箱子计算平均置信度与箱子内正确率的绝对差的加权平均见 rl_common.py#L161-L170 的ece_score。因此ECE 0.030意味着平均而言模型说出的置信度与真实正确率只差约 3 个百分点。NLL负对数似然模型对真实答案给出的对数概率的负值惩罚对正确项给低概率的行为。sentiment and rating的 NLL 3.545 与response quality scoring的 1.009 是全表最高说明这两个任务上模型经常把概率押错地方。Brier 分数预测分布与真实分布one-hot 或软标签的平方误差之和同时惩罚错误与过度自信。50% 覆盖率下的准确率按置信度从高到低排序只回答最自信的前 50% 样本时的准确率。In-task 为0.947、Zero-shot 为0.818远高于无条件准确率0.753 / 0.651这正是置信度门控的价值所在。仓库中对应的风险-覆盖曲线实现是aurcrl_common.py#L203-L209上述可靠性图右半部分即该曲线的可视化In-task AURC 0.083、Zero-shot AURC 0.192。这套指标与训练目标同源模型在训练时用**严格真评分规则strictly proper scoring rules**作为奖励log score spherical score序数score类问题再加 ranked probability score实现见 rl_common.py#L138-L157 的proper_reward。因为只有如实上报概率才能最大化期望奖励README 中称之为 RLCDReinforcement Learning for Calibrated Decisions所以校准能力是被训练目标直接逼出来的而不是评估时临时补的。五、校准温度results.json 里被校准的到底是什么eval/results.md强调Metrics after calibration而校准的具体参数记录在 eval/results.json 与 rl_agent_config.json 中calibration_temperature: [1.6369030475616455, 1.2514300346374512, 1.983399510383606]这是一个按问题类型question type分组的温度向量。在 rl_common.py#L17 中问题类型被编码为QTYPES {choice: 0, score: 1, noul: 2}三个温度分别对应 choice选项选择、score序数评分、noul是/否二元判断三类问题。推理时rl_agent_api.py#L62-L64 将原始 logits 除以对应温度后再做 softmaxz logits[r, :k] / self.temperature_by_options.get(temp_bucket(qt, k), self.temperature[qt]) p np.exp(z - z.max()); p p / p.sum()更精细的是temperature_by_options温度还按选项数量细分temp_bucket见 rl_common.py#L358-L361例如bucket温度choice:21.906choice:3-51.760choice:6-101.000choice:110.101score:3-51.251noul:21.983温度大于 1 会压平分布抑制过度自信温度小于 1 则锐化分布。choice:11的 0.101 值得特别注意当选项很多时模型给出的原始概率过于分散需要用小于 1 的温度把分布重新收紧。这解释了为什么 rl_agent_config.json 顶层temperature数组与results.json的calibration_temperature完全一致1.6369 / 1.2514 / 1.9834——前者就是校准后写回配置的产物。需要说明的边界这套温度是在本评估数据集上拟合的README 亦提示Ships over-confident原始 ECE 显著更高。换到自己的业务数据时应重新拟合温度再上线。六、延迟评估p50 / p95 与批处理eval/results.md的延迟部分原文如下{ 1_questions: { p50_ms: 38.4, p95_ms: 42.1 }, 10_questions: { p50_ms: 156.0, p95_ms: 158.4 }, 50_questions: { p50_ms: 721.4, p95_ms: 733.0 } }解读要点单问题延迟约 38.4 msp50/ 42.1 msp95符合 Laya 非自回归单次前向传播single forward pass的设计目标——不逐 token 生成因此没有解码延迟批处理近乎线性且 p95 与 p50 极为接近10 问 156.0 ms约 15.6 ms/问、50 问 721.4 ms约 14.4 ms/问且 p95 只比 p50 高 2–12 ms说明延迟分布非常稳定适合做服务端 SLO这套延迟来自results.json的latency_ms字段与1_questions的 38.4 ms 也直接对应了 README 中~33 ms 级单次前向的量级描述。若想了解延迟的来源可以看推理侧的实现RLAgent.system_onerl_agent_api.py#L41-L77把一次调用中的所有问题拼进同一个 batch、做一次前向collate_items后单次model(...)这正是 50 问只花 721 ms 的结构性原因。七、行动策略act policy自动化率与升级成本eval/results.json末尾还记录了行动策略评估结果act_policy: { eval_in: { automation_rate: 1.0, accuracy_when_acting: 0.8032331136738056, accuracy_when_escalating: null, accuracy_all: 0.8032331136738056 } }含义In-task 评估中模型在100% 的样本上都选择了自动执行不升级人工自动执行时的准确率为 0.803。行动头的成本结构定义在 rl_agent_config.jsonact_costs.escalate 0.5升级一次的成本、cost_wrong_act 3.0错误行动的惩罚模型在训练中需要权衡升级成本与误判代价。行动头在 DecisionModel 中实现act_head它同时看到池化后的序列表示和自身答案分布的摘要特征top-1 概率、top-1 与 top-2 差值、归一化熵等从而学会什么时候该交给人。需要留意的是README 的 Honest Limits 明确指出act_probability目前几乎恒为 1.0、携带的信号有限建议以confidence而非act_probability做门控依据。八、如何在自己数据上复现这套评估仓库是只读的但评估链路本身可以完整复现指标函数开箱即用ece_score、aurc、confidence_from_probs、spearman、auroc等全部实现在 rl_common.py纯 NumPy 实现、无 sklearn 依赖可直接对任意 (置信度, 正确标签) 二元组计算推理入口加载权重后调用RLAgent.system_one(state, questions)rl_agent_api.py#L41一次返回所有问题的choice/score/noul答案与概率分布questions采用 Jev 兼容的请求结构type/instructions/criteria批量评测predict_itemsrl_common.py#L369-L408按真实 token 长度排序、在max_tokens与max_seqs约束下分批前向并打印吞吐tok/s与 ETA适合大规模评测配置对齐评估时的上下文预算、温度、混合精度等全部来自各模型目录下的rl_agent_config.json根目录 English 版为max_len 512 / head_max_len 192 / bf16typed-decisions版为max_len 1024 / head_max_len 256复现前先核对这份配置可对照的工件eval/results.json保留了逐任务族、逐指标的原始数值与四舍五入前的精度可作为你复现结果的对照基准。九、结论与解读边界回到eval/results.md这份成绩单可以提炼出四条结论In-task 已高度可用且校准优秀总体 accuracy 0.753、ECE 仅 0.030按置信度门控到 50% 覆盖率时准确率升至 0.947适合直接部署Zero-shot 是能力下限而非生产配置0.651 精度、0.204 ECE 说明任务族泛化存在但概率必须重校准sentiment and rating0.362与conversation outcomes0.482无论 In-task 还是 Zero-shot 都是最需要人工复核的弱项校准不是免费的calibration_temperature1.637 / 1.251 / 1.983与temperature_by_options是这份报告的校准后属性的来源务必理解它只对拟合时所在的数据分布有效延迟优势来自架构38.4 msp501 问到 721.4 ms50 问的单次前向批处理是非自回归决策模型相对逐 token 生成方案的先天优势。最后提醒边界本文所有数字均以 eval/results.md 与 eval/results.json 的原始记录为准文中的图来自 eval/reliability_eval_in.png 与 eval/reliability_eval_zs.png可靠性 风险-覆盖曲线标注 ECE 与 AURC。指标实现细节可继续阅读 rl_common.py 与 rl_agent_api.py训练配置见 rl_agent_config.json。赞分享人工智能机器学习强化学习NLP内容安全【免费下载链接】laya项目地址https://ai.gitcode.com/hf_mirrors/convaiinnovations/laya点击查看免费下载相关推荐DeepOpen Research 基准测试指南Laya 检查点的 51 语言评测、T4 延迟与校准修复实战DeepOpen Research 基准测试指南Laya 检查点的 51 语言评测、T4 延迟与校准修复实战 本篇指南以 research/README.mdDeepOpen Laya 基准测试全景51 语言、六大应用工作流、延迟与校准的完整实测解读DeepOpen Laya 基准测试全景51 语言、六大应用工作流、延迟与校准的完整实测解读 本指南以仓库根目录的 BENCHMARKS.md https:/Opik 的 Equals 精确匹配指标源码级解读与评估实战Opik 的 Equals 精确匹配指标源码级解读与评估实战 导读 Equals 是 Opik 评估体系中一个简单却高频使用的启发式指标用于判断模型输出与期人工智能LLMOps模型评测可观测性AI AgentAI 应用后端前端创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

宏智树AI、ChatGPT、秘塔写作猫、文心一言:5款AI写论文工具实测,TaoToken统一API接入怎么选?

宏智树AI、ChatGPT、秘塔写作猫、文心一言:5款AI写论文工具实测,TaoToken统一API接入怎么选?

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/30 22:31:32 阅读更多 →
Copilot 能换成本地吗?—— 把 endpoint 改到 TaoToken 的本地化部署与替代方案全解析

Copilot 能换成本地吗?—— 把 endpoint 改到 TaoToken 的本地化部署与替代方案全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/30 22:30:31 阅读更多 →
CNC精密零件加工除尺寸公差外,还要明确哪些内容?

CNC精密零件加工除尺寸公差外,还要明确哪些内容?

上周一个做机器人关节的工程师找过来,第一句话就带着气:“你们能不能别像前几家那样,报价报完又加价,样品做完又返工?项目节点已经拖了三周了。” 答案其实不复杂:报价反复返工、成品跟预期对不上&#xff…

2026/9/30 22:30:31 阅读更多 →

最新新闻

如何构建支持多架构的Docker镜像?chinese-poetry-api容器化部署完整指南

如何构建支持多架构的Docker镜像?chinese-poetry-api容器化部署完整指南

如何构建支持多架构的Docker镜像?chinese-poetry-api容器化部署完整指南 【免费下载链接】chinese-poetry-api 📜 诗泉:高性能中国古诗词 API 服务 项目地址: https://gitcode.com/gh_mirrors/ch/chinese-poetry-api 📜 ch…

2026/9/30 23:09:04 阅读更多 →
JuiceFS 企业版 5.4:从千亿文件到百万客户端

JuiceFS 企业版 5.4:从千亿文件到百万客户端

继 JuiceFS 企业版 v5.3 支撑千亿文件规模之后,v5.4 进一步在超大规模场景下提升多项能力。千亿文件规模下,单次操作的细小开销也会累积成显著的资源负担,元数据分区部署后需要协调不同节点,兼顾性能、数据一致性与稳定性。围绕这…

2026/9/30 23:09:04 阅读更多 →
Python09:核心语法-数据存储与运算-字面量

Python09:核心语法-数据存储与运算-字面量

Python核心语法:数据存储与运算数据的逻辑处理数据存储容器函数面向对象基础数据存储与运算:字面量与变量常见数据类型输入与输出运算符一、字面量字面量决定数据在代码中怎么写(编写方式);变量决定数据在代码中如何存…

2026/9/30 23:09:04 阅读更多 →
I2C调试实战:从万用表到示波器,ACK异常排查全攻略

I2C调试实战:从万用表到示波器,ACK异常排查全攻略

做嵌入式这行,谁没被 I2C 折磨过?传感器不出数、EEPROM 读回来全是 0xFF、触摸屏偶尔隔三秒才响应一次……真到了排查的时候,一把万用表、一台示波器,很多人不知道先用哪个、波形抓到了又看不懂 ACK。我这些年调试 I2C 设备&#…

2026/9/30 23:09:04 阅读更多 →
I2C排查实战:用万用表、示波器与ACK定位总线故障

I2C排查实战:用万用表、示波器与ACK定位总线故障

我头一回被 I2C 卡住,是调一块触摸屏控制板。板子上电之后,我读寄存器,返回全是 0xFF,示波器探头夹上去,波形也有,时序也像模像样,偏偏就是 ACK 一直保持高电平。后来查了半天,发现是…

2026/9/30 23:09:04 阅读更多 →
对 .NET 开发者来说,Azure AD 改名为 Microsoft Entra ID 意味着什么?TaoToken 统一 Key 配置实战

对 .NET 开发者来说,Azure AD 改名为 Microsoft Entra ID 意味着什么?TaoToken 统一 Key 配置实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/30 23:08:03 阅读更多 →

日新闻

Base64 图片头部特征识别:从文件头到格式判断的完整指南

Base64 图片头部特征识别:从文件头到格式判断的完整指南

1. 项目概述:为什么说看懂 base64 图片头部是基本功这几年跟 base64 打交道的机会越来越多,后端接口返回图片、前端渲染验证码、小程序里存小图、还有一些老系统导出报表,动不动就给你一段长到怀疑人生的 base64 字符串。很多人拿到字符串就直…

2026/9/30 0:00:35 阅读更多 →
Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

简介:本资源是一份面向Java初学者与课程设计学生的公交站牌广告灯箱管理系统毕业设计文档,聚焦城市公共广告资源信息化管理痛点,提供从需求分析到技术实现的完整方案。文档采用标准学术论文结构,含摘要、英文摘要、目录及五章正文…

2026/9/30 0:00:35 阅读更多 →
用 Redis Lua 构建大模型 API 多租户原子配额治理体系

用 Redis Lua 构建大模型 API 多租户原子配额治理体系

我去年年底接了一个内部 AI 平台的治理需求,背景很直接:公司把 DeepSeek、MiniMax 这类大模型 API 统一封装成内部网关,开放给几个业务团队用。结果第一个月账单出来,额度直接超了 4 倍。仔细查日志,发现原因并不复杂—…

2026/9/30 0:00:35 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/30 13:14:22 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/30 18:13:06 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/30 13:14:49 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/29 19:29:29 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/29 5:58:00 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/30 15:27:04 阅读更多 →