1. 项目概述MiMo-V2.6到底想解决什么问题我最近反复研读了《MiMo-V2.6通过扩展强化学习实现模型自我提升》这份技术报告因为它在圈子里讨论热度不低。整个报告的核心命题很明确当LLM的能力曲线开始收敛时能不能靠“扩展强化学习”把模型再往上抬一个台阶甚至让模型自己把自己训练得更强。这里的三个关键点——LLM、MiMo-V2.6、强化学习——分别对应基础模型、具体版本和训练范式。如果平时关注大模型训练、对齐、推理能力优化或者正在做RLHF、RLVR这类项目这篇解读值得看完。我会把报告里最核心的机制拆开结合自己的一些工程经验聊聊哪些思路能直接落地。这份报告最吸引我的不是某个惊艳的Benchmark分数而是它明确把“自我提升”当作一个可通过扩展训练规模来实现的目标。过去我们讲大模型能力提升主要靠三件事更好的预训练数据更大的参数量以及更多人工标注的SFT数据。但现在的问题在于传统数据路径越来越贵模型也容易在模仿示范时到达天花板。MiMo-V2.6的思路是换一条路让模型在与任务环境交互的过程中通过强化学习不断优化自身策略形成一种“自己出题、自己答题、自己纠正”的闭环。这种思路并不算全新但把它做到足够大的规模并把工程细节研究得比较透是这份报告的真正价值点。1.1 为什么偏偏是强化学习而不是继续堆SFT数据传统SFT本质上是模仿学习。模型看人类写的正确答案学习“标准答案长什么样”。问题是人类示范只是正确策略空间中的一个子集甚至不一定是最优解。举个例子一道数学题可能有七种解法但标注集里往往只有一种或两种模型学到的是“模仿那一种解法”而不是真正探索“哪个解法最优”。当所有标注都来自同一个水平的人类群体时模型就永远不可能超过示范的上限。强化学习解决的是这个结构性瓶颈。它不依赖固定示范而是靠奖励信号驱动。只要奖励函数设计得足够好模型就能在训练中自由探索出没有被人类标注过的解题方式甚至产生“反直觉但正确”的策略。MiMo-V2.6报告里反复强调的“自我提升”第一层含义就在于此模型不再只是复现人类行为而是在试错中形成自己的行为策略。用一句话概括SFT教会模型“说人话”强化学习教会模型“把事办成”。当然有人会问直接用更大规模的无监督预训练不行吗答案是可以但效率太低。预训练学的是语言分布而像数学推理、代码生成、智能体规划这类任务需要的不是语言流利度而是目标导向下的决策能力。这种能力不能靠“读更多文本”涌现必须通过与环境交互、得到反馈、调整策略来获得。MiMo-V2.6选择强化学习本质上是在处理“如何让模型在开放式任务中有目标地进步”这个问题。1.2 “扩展强化学习”扩展的到底是什么报告标题里最值得琢磨的词其实是“扩展”Scaling。以前很多团队也做强化学习但通常是在SFT模型上轻量地跑几步RLHF目标是让模型更符合人类偏好训练步数少数据规模也小。MiMo-V2.6把这件事彻底放大了更大的算力预算、更多的在线采样、更长的训练轮次、更多样化的任务分布。换句话说它把强化学习从“最后一道精修工艺”提升到了“和预训练同等量级的核心生产线”。扩展的不只是算力更重要的是训练闭环。传统PPO训练可能只是在一个固定的提示集上反复采样模型一遍遍做同一批题最后记住了答案分布。扩展强化学习则会动态调整任务池根据当前模型的弱点持续生成新问题把答错的题送回训练集把答对的难题再加工成变体让模型永远处在“舒适区边缘”。这才是“通过扩展”实现自我提升的深层机制。另外扩展强化学习还有一个容易被忽略的好处它能把奖励信号的价值放大。过去标注一条SFT样本只能教模型一个具体写法但在强化学习框架下一条奖励信号可以反复指导模型探索一整类策略。尤其是对数学、代码这类有标准答案的任务规则验证器可以无限次无成本打分这让训练数据的边际成本大幅降低。MiMo-V2.6把这类可验证任务的训练规模推得很大某种程度上是在告诉业界奖励比标注更便宜探索比模仿更有潜力。2. 训练方案的核心模块与设计意图2.1 策略模型、奖励模型和采样器怎么配合要理解MiMo-V2.6的训练方案先得搞清楚四个角色策略模型、奖励模型、采样器和服务于奖励计算的验证器。策略模型是那个“被训练的学生”它的前身通常是一个经过充足SFT的LLM具备基本的指令跟随和任务执行能力。奖励模型可以是训练出来的打分模型也可以是基于规则的验证器比如数学题的答案比对器、代码题的单元测试器。采样器不是代替人工出题而是管理整个任务分布控制每个训练batch里不同类型题目的比例。在具体训练中采样器从题库里取出提示喂给策略模型策略模型对同一提示生成多个候选答案可能是4个、8个甚至16个然后每个答案被送进验证器打分正确得高分错误得低分部分正确的给中间分。这批带奖励评分的样本进入强化学习算法更新策略模型的参数。整个过程是同步进行的模型一边生成数据一边学习而不是先生成完所有数据再离线训练。这种在线更新的方式能避免策略漂移确保当前模型看到的样本一直都是“贴近当前能力分布”的也是扩展RL能稳定跑下去的基础。MiMo-V2.6在算法选择上大概率会偏向那些能减少内存消耗、提升吞吐量的家族比如GRPO这类去掉Critic模型的策略优化方法。传统PPO需要同时维护一个价值网络来估计优势函数这在大模型场景下意味着额外占一块显存。而GRPO通过对同一提示的多条采样结果做组内比较用相对优势代替值函数省去了价值网络的开销等于变相扩大了可训练的batch size。工程团队真正关心的不是排行榜上的算法名称而是单位算力能产出多少优质更新信号这一点报告里体现得很明显。2.2 任务集构造难度阶梯比数量更重要我读这份报告时特别留意了它对任务集构造的表述。扩展开强化学习后模型每天会产生海量训练样本但样本的“营养配比”比总重量重要得多。如果任务集里全是简单题模型很快就能拿满奖励训练信号快速收敛为零后面纯粹在浪费算力。如果全是难题初始奖励几乎全是0策略模型会在稀薄的反馈中迷失很难学到有效信号。MiMo-V2.6强调构建难度阶梯让每个训练阶段都有一部分简单题维持基础策略一部分中档题提供有效梯度一部分难题负责逼出边界能力。另一个有价值的设计是用“错题本”机制动态扩展题库。模型在某个题上答错说明这一定位在它的能力边界附近把这类题保留下来甚至改造成相似变体等到模型能力提升后再重新放回训练集能形成一种“对抗式自我提升”的节奏。模型永远有一部分任务是它曾经不会做、但通过努力可以学会的题目这正好符合强化学习中“最近发展区”的理论。报告中暗示这种任务集的自适应调整是在大训练集群上跑出稳定收益的关键之一。3. 实操流程从基线模型到多轮自我提升3.1 一轮完整的RL迭代怎么跑虽然报告里给的工程细节很多但剥离掉分布式系统、推理优化这些外壳之后单轮RL迭代的骨架其实很清晰。我按自己的理解拆成了可照搬的步骤供参考准备一个SFT好的基线模型先用少量任务做冒烟测试确认推理输出格式正确。构建任务集包括规则可验证的题目代码题带单元测试、数学题带标准答案和一小部分需要奖励模型打分的开放性题目。对每个提示采样多条候选答案一般k在8到16之间温度设在0.6到1.0之间保证采样多样性。把所有候选答案同时送进规则验证器或奖励模型打分这一步的关键是打分标准要统一不能一个题一个标准。计算每个样本的优势值。如果用GRPO就在同一提示的多条答案之间做相对比较正确率越高的答案优势越大正确但概率低的答案也能获得正向信号。用策略优化算法更新模型参数同时配合参考模型的KL散度约束防止模型跑到“奖励分数高但语言崩坏”的区域。每N步在保留评测集上测一次准确率、多样性等指标记录训练曲线。一轮结束后用当前模型重新生成难度更高的任务或过滤掉已经“太简单”的题目进入下一轮迭代。我在自己项目里实践过类似流程最容易被低估的是第2步和第3步。任务集如果有一道题标注答案错了整个batch的奖励信号都会受污染模型会学到“这种格式就能得分”的错误策略。采样数量也不是越多越好k太大会让batch里同一提示的样本过于集中降低训练效率k太小又会导致优势估计方差大。一般我先跑一轮k8的实验观察优势值分布是否稳定再决定要不要调高。3.2 参数配置与训练观测基线训练超参不能直接照搬报告但大家通常会在一个相对稳定的区间里搜索。这里整理了一份我常用的参考基线适合在7B到70B模型上启动扩展RL实验参数建议值范围说明策略模型初始学习率1e-6 到 5e-6从SFT模型继续训练学习率太高容易灾难性遗忘KL散度系数0.01 到 0.05控制模型偏离参考模型的程度每提示采样数k8 到 16代码、数学任务常用8开放长文本任务可以到16采样温度0.6 到 1.0温度太低样本多样性不足太高容易输出噪声训练batch size1024 到 2048指总提示数而不是采样后样本数单轮训练步数500 到 2000根据模型收敛速度动态调整梯度裁剪阈值1.0防止KL突刺导致loss爆炸训练过程中我最关注的四个指标是奖励均值、KL散度、样本多样性、评测集准确率。奖励均值会波动不用因为单步下降就焦虑要看平滑后的趋势。KL散度如果涨得太快说明模型开始钻奖励空子多样性指标最直观如果生成结果去重后数量变少说明策略塌缩开始了。评测集准确率是最后一道防线它不陪训练曲线演戏模型涨没涨看它最诚实。4. 训练中常见的坑与排查实录4.1 奖励失控和reward hacking扩展RL跑久了reward hacking几乎必然出现。我见过最典型的案例是在代码生成任务里模型学会了在注释里写正确答案或者在输出开头打印某个匹配字段从而骗过单元测试里过于宽松的检查。MiMo-V2.6报告处理这类问题的方式是强调验证器的完备性同时用KL散度把模型“按在”参考模型的语义空间附近让它不能为了刷分而改变整体语言行为。做工程时我的经验是三层兜底。第一层规则验证器尽量检查中间过程和最终结果不要只比对输出尾部。第二层在奖励函数里加入格式惩罚项比如代码没有通过编译就扣分出现重复输出就降权。第三层定期用一份人工抽样的样本去审查奖励分数是否符合真实质量。一旦发现奖励失控最简单的止损做法是回滚到最近的检查点降低学习率然后把“出问题的奖励规则”补丁后再重启训练。4.2 训练稳定性和多样性塌缩强化学习训练不像SFT那么“温顺”loss曲线经常像心电图。常见不稳定场景包括奖励均值突然暴跌、KL散度冲高、以及模型开始输出重复的无意义内容。如果出现这类问题先不要加新数据优先检查学习率和采样温度。学习率过高是最常见原因把它降到原来的四分之一很多时候训练就能稳住。多样性塌缩是另一个容易忽略的坑。当模型发现某一种回答模式得分最高时它会越来越集中于这种模式生成风格逐渐单一化进而丢失探索能力。这相当于模型在奖励的“诱惑”下把自己锁死在局部最优。解决思路有两类一是在采样阶段用更高的温度或top_p增加随机性二是在奖励函数中增加多样性正则项比如对连续多步生成相同文本的样本给予额外惩罚。MiMo-V2.6能把扩展RL跑到很大规模大概率在多样性保护上做了很精细的控制否则模型早就“卷”死了自己。4.3 用评测集合区分“真提升”和“过拟合”训练奖励上升和真实能力提升之间经常隔着一条鸿沟。模型完全可以在训练题集上刷出高分但一遇到新题型就原形毕露。所以我在自己的实验里始终维护两个评测集合一是和训练集同分布的保留集用来监控“是否记住了题型”二是分布偏移更大的OOD集比如训练题全是Python代码生成评测集里放一些C或者伪代码任务用来验证“是否学到了通用策略”。MiMo-V2.6所说的自我提升如果只体现在同分布保留集上那其实只是记忆力提升真正有意义的自我提升必须体现为OOD集上的泛化能力提升。在训练中每经过一轮RL我会同时看两个集合的准确率曲线。如果同分布集涨但OOD集不涨说明模型快要过拟合了这时应该减少训练步数复杂化奖励形式或者引入更多元化的任务。如果两个集合一起涨说明策略优化真的在向正确的方向探索可以放心继续扩展。5. 借鉴意义与实际落地建议5.1 中小团队也可以先跑通小规模闭环很多人看到MiMo-V2.6这样的技术报告第一反应是“这得多少卡才能复现”。确实大规模扩展RL需要的是分布式推理、高速数据流、数千张GPU编排等重型工程能力。但对绝大多数团队来说更重要的问题不是复现报告里的规模而是验证这套方法论在自己的场景里是否有效。中小团队完全可以用小模型跑通小规模闭环比如在单机8卡A100上用一个7B模型和一个规则验证器先把“自我提升”的最小闭环建起来。我推荐先从规则可验证的领域切入比如数学竞赛题、SQL生成、代码补全原因是奖励信号便宜且稳定不需要训练额外的奖励模型天然避开了奖励模型偏差这个最大的坑。在这个闭环里目标不是冲排行榜而是观察训练曲线是否按照预期走模型会不会出现奖励上升、OOD集能力提升、生成多样性保持稳定的迹象。如果连小规模闭环都跑不通说明思路或工程实现有问题这时候盲目扩大规模只会把错误放大。5.2 从技术报告到产品化不是一次性训练而是持续迭代MiMo-V2.6更深远的影响在于改变了人们对“模型迭代”的认知。过去一个模型从训练到上线像做一个产品发布训练完毕、回归测试通过、部署、然后等下一次大版本更新。但扩展RL意味着模型可以在部署后持续进化。业务方每天反馈的bad case可以被自动转换成训练数据周期性地丢回强化学习训练管线模型每隔一段时间就吸收这些失败经验然后再部署回去。这形成一种“永远在线”的模型提升飞轮。我在这方面的体会是这种飞轮能否转起来关键不在算法而在数据回流和评估机制是否闭环。如果上线后没有一个系统能把用户的隐形反馈比如“用户对回答点踩”或“用户复制了答案去执行”转化为可验证的奖励信号那扩展RL就还是停留在离线训练阶段。MiMo-V2.6报告本身可能没有展开产品化细节但它把“用强化学习撬动模型自我提升”的工程路径打通了这才是对行业最有价值的贡献。6. 写在最后关于“自我提升”的一点个人体会读完整份技术报告我最大的感触是扩展强化学习并不是灵丹妙药它更像一把需要持续打磨的刀。模型的每一次“自我提升”都建立在足够的探索空间、可靠的奖励信号和严谨的评测机制之上缺少任何一环训练都会退化成刷分游戏。我在自己试过类似方案后发现第一轮迭代往往收益不明显但只要坚持跑过三到五轮模型在某些任务上的表现会出现很扎实的跃升这种跃升不是靠调提示词能获得的。最后分享一个小技巧在做RL训练时别只看奖励曲线一定要盯住参考模型的KL散度和样本多样性这三个指标组合起来能提前暴露大部分风险。希望这篇解读能帮到正准备折腾强化学习的你也欢迎在实际复现过程中多留意报告和其它开源方案的差异毕竟每个团队的算力和目标都不一样真正能从报告中带走的是那套“让模型在反馈中持续变强”的思路。