Laya训练原理揭秘:RLCD如何用严格评分规则逼出诚实概率?REINFORCE与 TD(λ) 更新完整详解
Laya训练原理揭秘RLCD如何用严格评分规则逼出诚实概率REINFORCE与 TD(λ) 更新完整详解【免费下载链接】laya项目地址: https://ai.gitcode.com/hf_mirrors/convaiinnovations/layaLaya 是一个多语言、非自回归的 System 1 决策模型给它一段文本邮件、工单、JSON和若干带类型的问题它在单次前向传播约 33ms内返回带数学上校准的概率的答案。它的训练方法叫RLCDReinforcement Learning for Calibrated Decisions面向校准决策的强化学习——奖励函数采用严格 proper 评分规则模型想多拿分唯一的办法就是报告自己真实的信念。本文详解 RLCD 的评分规则、REINFORCE 更新与 TD(λ) 更新是怎么工作的并附上 Laya 概率校准的实测证据。1. Laya 是什么只输出概率的决策模型传统 LLM 做分类要生成文字再解析Laya 完全不走这条路每个选项各占一个[MASK]标记模型在每个标记位置给该选项打分再对这道题的所有选项做 softmax直接得到一份概率分布答案空间在请求时定义——新增一套业务 schema 无需重训一次前向传播同时回答所有问题10 问批量只需 72.3 msT4 GPU。结构上它是预训练双向编码器ModernBERT-large395M 从零训练的 2 层决策头总共 421M 参数。这套架构定义在 rl_common.py 的DecisionModel中。关键点Laya 不说出答案而是报出概率。整个训练系统的设计目标就是让这份概率报告尽可能诚实。2. 为什么需要诚实概率校准问题模型报 80% 不代表它真的对了 8 成 10。一个常见故障是模型明明在乱猜却报出 95% 的置信度——README 里就记录了 Laya 的英文检查点在 Khmer 文字上0.000 准确率却配 0.952 置信度的现象此时靠置信度门控根本救不了你。Laya 训练完的实测结果见 eval/results.md14 个任务族整体 ECE期望校准误差越低越好仅0.030意图路由任务 ECE 低至 0.009。上图左半部分是可靠性曲线蓝点几乎贴着灰色完美校准对角线说明模型报 0.6就大约对 0.6右半部分是风险-覆盖曲线AURC 0.083按置信度从高到低取答案错误率上升非常缓慢——概率真的可以用在路由和分流上。那么问题来了怎么让模型学会不撒谎答案在奖励函数里。3. RLCD 核心一严格 proper 评分规则什么是严格 proper严格 proper 评分规则有一个数学保证给定你对世界的真实信念唯一能最大化期望得分的报法就是照实报告这份信念。报虚高、报保守、报安全的中庸值期望分数都会更低。评分规则一旦 strict proper诚实就从道德要求变成了最优策略。Laya 的奖励由三部分构成实现见 rl_common.py 的proper_reward函数评分规则适用问题类型作用直觉Log score对数得分全部choice / score / noul重罚把正确答案概率压到接近 0——log(0.01) ≈ -4.6一次严重误判痛不欲生Spherical score球面得分全部权重 0.5惩罚概率分布整体与真实分布方向偏离鼓励分布形状贴合RPS排名概率得分仅有序 score 题权重 1.0基于 CDF 比较专治等级题上概率错位比如把 3 分的题报成 1 分以 noul是非题为例若真的真实概率是 70%报 70% 期望得分最高报 90% 或 50% 都会掉分。模型没有任何演技空间训练出来的概率分布只能越来越贴近真实。探索给 logits 加噪声RL 训练需要探索。Laya 的做法很克制在 logits 上叠加零均值高斯噪声再采样概率让模型尝试不同的报告但平均意义上不偏不倚——探索不会污染诚实的方向。4. RLCD 核心二REINFORCE 组基线GRPO 风格更新拿到奖励后权重怎么更新Laya 用的是经典REINFORCE策略梯度并加了一个关键改进——组均值基线GRPO 风格一组采样同一条数据同一状态 同一组问题采样一组概率报告组内算奖励每条报告各自按上节的 proper 评分规则打分减组均值策略梯度方向 (该条奖励 − 这组奖励的均值) × log 概率梯度。减掉组均值这个基线作用是把这道题整体容易/难的公共部分从梯度中剔除只保留这条报告比同组别的报告更好/更差的相对信号。好处是梯度方差小、不需要额外训一个价值网络这也是 GRPO 系方法的核心思想。另外训练里还藏了两个实用细节选项随机洗牌choice 题训练时每步打乱选项顺序防止模型记住第 2 个选项这种位置偏见act/escalate 决策头模型还输出自己处理 / 升级人工的动作概率答错成本在 rl_agent_config.json 里设为 3.0升级成本 0.5——训练会学会没把握就升级这本身就是概率诚实的一种体现。5. RLCD 核心三TD(λ) 更新处理多轮对话单条记录是 REINFORCE 用最终奖励回传即可但多轮对话是个序列决策同一个问题在对话第 1 轮、第 3 轮、第 5 轮看到不同长度的前缀各自要报一份概率。奖励怎么分摊到每个前缀Laya 用TD(λ)λ1.0把一段对话切成多个前缀切片配置 rl_agent_config.json 中max_prefixes 6从最后一个前缀结果已知目标就是真实结局往前递推G_t (1−λ)·V_{t1} λ·G_{t1}其中V_{t1}是模型对下一前缀自己报的概率λ1.0 时退化为蒙特卡洛回传每个前缀的软目标都被最终结果拉齐但递推路径保证了信息从后向前平滑传播。完整实现只有十几行在 rl_common.py 的td_lambda_targets函数里。它输出的软目标而非 0/1 标签会直接作为 proper 评分规则里的真值分布——每个前缀学的是在该信息量下诚实的概率应该长什么样。6. 训练成果零样本泛化与温度标定训练完成后的检查点存于仓库根目录model.safetensorsrl_agent_config.json 记录训练了 7313 步、约 2 小时、单卡。两个值得新手知道的点零样本也基本诚实完全没训过的任务族上 ECE 0.204可靠性曲线整体仍贴近对角线见下图说明诚实是 RLCD 塑造出来的通用行为而非任务内过拟合出厂略偏自信温度标定一下就好配置里按(题型, 选项数)分桶拟合了温度参数如choice:2桶 1.906、noul:2桶 1.983见 rl_agent_config.json把 ECE 从 0.466 压到 0.081。在自己的数据上复做一次温度拟合再信任它的概率。7. 总结三条设计一个诚实的决策器组件技术解决什么奖励函数Log Spherical RPS 严格 proper 评分让报真成为唯一最优策略策略更新REINFORCE 组均值基线GRPO 风格低方差地学会把分布对准真值序列任务TD(λ1.0) 前缀切片回传多轮对话中每轮前缀各自学会诚实推理输出每选项[MASK]打分 分桶温度缩放毫秒级拿到可直接用于路由的概率对新手来说Laya 最值得借鉴的思路只有一句话如果你要模型输出概率就别指望它自觉把奖励函数设计成只奖励诚实剩下的交给 REINFORCE。想深入阅读实现建议按 rl_common.py奖励与 TD 目标→ rl_agent_api.py推理与温度标定→ eval/results.md评测明细的顺序走一遍。【免费下载链接】laya项目地址: https://ai.gitcode.com/hf_mirrors/convaiinnovations/laya创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

PaddleNLP DebertaV2Tokenizer 源码级解析:基于 SentencePiece 的 DeBERTa-v2/v3 分词器实战指南

PaddleNLP DebertaV2Tokenizer 源码级解析:基于 SentencePiece 的 DeBERTa-v2/v3 分词器实战指南

人工智能大模型预训练微调LoRARLHF强化学习分布式训练 【免费下载链接】PaddleNLP Easy-to-use and powerful LLM and SLM library with awesome model zoo. 项目地址: https://gitcode.com/gh_mirrors/pa/PaddleNLP 点击查看 免费下载 DeBERTa-v2/v3 系列模型采用…

2026/9/24 14:50:02 阅读更多 →
Simulation与Emulation的区别:从芯片验证到产线仿真的选型指南

Simulation与Emulation的区别:从芯片验证到产线仿真的选型指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 14:50:01 阅读更多 →
【读卡器SD插入到电脑未自动挂载】

【读卡器SD插入到电脑未自动挂载】

问题描述:插入读卡器SD到电脑,虚拟机未自动挂载且显示图标。 解决思路:用dmesg | tail -20,和查看ls /dev/ 是否有sda*/sdb*。失败原因是是因为没卸载就硬拔未卸载就硬拔,导致拔卡后的 I/O 错误。内核认到了&#xff0…

2026/9/24 14:49:01 阅读更多 →

最新新闻

C#上位机与S7-1200通信:基于S7.net线程循环读取的实践方案

C#上位机与S7-1200通信:基于S7.net线程循环读取的实践方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 15:30:47 阅读更多 →
重装系统后C盘数据恢复:NTFS格式化原理与实操指南

重装系统后C盘数据恢复:NTFS格式化原理与实操指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 15:30:47 阅读更多 →
Hugo Blox Bootstrap 博客文章 Archetype 全解:从 Front Matter 配置到渲染机制

Hugo Blox Bootstrap 博客文章 Archetype 全解:从 Front Matter 配置到渲染机制

静态站点前端开发工具 【免费下载链接】kit 🧱 Describe your site, AI builds it, you own it as Markdown. Snap together Tailwind blocks like Lego — landing pages, blogs, portfolios, docs & more. No AI slop. Free to deploy anywhere 👇…

2026/9/24 15:30:47 阅读更多 →
Flink CALL 语句完全指南:调用存储过程(Procedure)的语法、执行方式与原理

Flink CALL 语句完全指南:调用存储过程(Procedure)的语法、执行方式与原理

大数据流处理批处理数据工程 【免费下载链接】flink 项目地址: https://gitcode.com/gh_mirrors/fli/flink 点击查看 免费下载 CALL 语句是 Flink Table API & SQL 中用于调用存储过程(Procedure)的专用 SQL 语句,通常被用来…

2026/9/24 15:30:46 阅读更多 →
RedwoodJS dbAuth 无密码登录(Passwordless)实战:用邮箱验证码替代密码存储

RedwoodJS dbAuth 无密码登录(Passwordless)实战:用邮箱验证码替代密码存储

后端前端Web框架开发工具 【免费下载链接】redwood RedwoodGraphQL 项目地址: https://gitcode.com/gh_mirrors/re/redwood 点击查看 免费下载 本文是一份完整的实战指南,讲解如何基于 RedwoodJS 内置的 dbAuth 认证方案,将传统的"用户…

2026/9/24 15:30:46 阅读更多 →
ESP01 固件烧录全攻略:Flash Download Tool 从入门到精通

ESP01 固件烧录全攻略:Flash Download Tool 从入门到精通

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 15:29:45 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →