不学新本领,只做对选择:ReasonMaxxer 揭示大模型推理的“无强化学习”新范式
不学新本领只做对选择ReasonMaxxer 揭示大模型推理的“无强化学习”新范式南加州大学University of Southern California, USC和美国陆军研究实验室DEVCOM Army Research Laboratory, DEVCOM ARL联合研究指出强化学习RL提升大语言模型推理能力的本质并非让模型习得新技能而是在关键决策点对已有策略进行稀疏选择。通过对不同模型及其RL算法的令牌级分析研究发现RL仅修改了约1%至3% 的令牌位置且这些修改精准集中在高熵即模型不确定的决策点上。通过仅针对这些特定位置进行微调模型能够以极低维度的参数调整找回RL带来的大部分性能增益。基于此发现作者提出了REASONMAXXER方法这是一种无需RL流程的轻量化方案。该方法仅需极少量的基础模型采样和分钟级的单显卡训练即可在多项数学基准测试中达到甚至超越完整RL的效果。最终这项工作证明了通过熵门控决策点进行针对性优化可以将训练成本降低约三个数量级。论文ReasonMaxxer: Sparse Policy Selection as an RL-Free Reasoning Paradigm挑战了当前大语言模型LLM后训练中对强化学习RL的重度依赖提出了一套全新的、极低成本的无强化学习RL-Free推理能力提升范式。一、 核心观点强化学习本质是“稀疏策略选择”而非“能力习得”传统的观点认为RL如 GRPO 或 PPO能通过大规模探索让模型学到全新的推理路径。但论文指出RL 并没有赋予模型新的推理能力而只是对基座模型本就拥有的解空间进行概率质量的重新分配即召回并提升基座模型原本就具备的正确解。RL 的本质实际上是极少数关键分叉点上的精准纠偏。修正极度稀疏、保守且集中在“高熵决策点”RL 对基座模型的改变极为微小仅影响了1% ~ 3% 的 Token 位置。而且RL 几乎从不凭空创造新词它推荐的 Token 几乎全部属于基座模型原本预测概率的前 5 名Top-5。这些被修正的位置正是基座模型在多个推理分支间犹豫不决的高熵决策点Forking Tokens。纠偏具有因果决定性且能通过基座模型自身的熵直接定位干预实验表明仅在这些极少数的分歧 Token 上强行替换为 RL 模型的选择就能100% 恢复强化学习带来的全部准确率提升。更重要的是这些关键决策点不需要 RL 教师模型来寻找仅凭基座模型自身的 token 生成熵就能完美定位。纠偏信号在参数空间具有“极低维性”RL 对模型的分布修正可以用极小的参数量进行表征。通过在仅仅 100 个问题上进行 KL 散度蒸馏一个仅占模型参数总量约0.3%~0.5% 的 rank-32 LoRA 适配器就能完整复刻 RL 教师模型的推理准确率。无 RL 替代方案REASONMAXXER 算法基于上述发现作者推出了REASONMAXXER算法。其工作流非常简单挑选“边缘能力”问题筛选出基座模型采样生成的解答中既有正确也有错误混合成功率的问题。通过基座熵定位决策点当 Token 的生成熵 HtHt​ 超过设定阈值 ττ 时判定为决策点。优势加权对比损失Advantage-Weighted Contrastive Loss在决策点上对引导向正确答案的 Token 予以奖励对引导向错误答案的 Token 进行惩罚而在非决策点位置则通过 KL 散度将输出锚定Anchor到基座分布上防止模型过拟合。二、 关键数据1. Token 级别的微观数据特征修改占比极低在不同的模型家族Qwen2.5, Qwen3 等中RL 带来的 Token 重新排序Reranked仅发生在1.0% ~ 4.1%的位置。保守性极强将 Top-5 之外的 Token 提升到第一名的概率Shifted 概率几乎为零仅为0.01% ~ 0.12%RL 推荐的 Token 在基座中的平均概率排名为2.14 ~ 2.39。熵值差异巨大这些发生修改的决策点其基座模型熵值比未修改的位置高出5 ~ 12 倍具体为 7.58x ~ 12.63x。2. 极低维适配器与超轻量训练集微型适配器复刻 RL仅用0.27% ~ 0.49%的参数量LoRA 秩为 32并在100 个随机问题上蒸馏即可复刻 RL 模型的全部精度。REASONMAXXER 极小训练集仅需50 个具有混合成功率的数学问题每个问题采样 20 个 rollout总共 1000 个训练序列即可完成训练。相比之下传统的 GRPO 训练如 SimpleRL-Zoo需要使用 8,000 个甚至多达 57,000 个问题。3. 性能表现与惊人的成本缩减 (MATH-500 评测)在数学推理基准测试MATH-500中REASONMAXXER 以极低的计算成本匹配甚至超越了全量强化学习的基线模型与配置MATH-500 准确率估计训练成本 (USD)相比完整 RL 成本缩减Qwen2.5-1.5B (基座)29.8%--↪ SimpleRL-Zoo (GRPO)49.6%\$200基准线↪ Open-Reasoner-Zero (PPO)43.6%\$1,200基准线↪ REASONMAXXER50.2%\$4降低约 50x ~ 300xQwen2.5-7B (基座)58.6%--↪ SimpleRL-Zoo (GRPO)65.6%\$600基准线↪ Open-Reasoner-Zero (PPO)73.2%\$6,300基准线↪ REASONMAXXER70.6%\$5降低约 120x ~ 1260xDeepSeek-R1-Distill-1.5B (基座)43.6%--↪ DeepScaleR (GRPO)50.2%\$4,500基准线↪ REASONMAXXER66.2%\$4降低超 1000x4. 算法消融与鲁棒性数据熵阈值 ττ 的鲁棒性当 ττ 在 1.0 至 2.2 之间变化时算法性能表现非常稳定。在 τ1.4τ1.4筛选出5.2%的决策 Token或 τ1.8τ1.8筛选出2.6%的决策 Token时模型性能达到巅峰。对比惩罚Contrastive Loss的必要性如果仅对正确路径进行正向强化即类似于 SFT而不惩罚错误路径Qwen2.5-1.5B 在 MATH-500 上的得分仅能从 29.8% 提升到 39.8%而加上惩罚错误分支的对比损失后能飙升至50.2%这证明了“惩罚错误”贡献了大约一半的性能增益。https://arxiv.org/pdf/2605.06241

相关新闻

从平台到经济体:代币经济与智能体话语如何重塑去中心化协作

从平台到经济体:代币经济与智能体话语如何重塑去中心化协作

1. 从“平台”到“经济体”:重新审视 Moltbook 的本质最近在跟几个做社区和内容产品的朋友聊天,大家不约而同地提到了一个词:“平台”。我们习惯性地把 Discord、Reddit、Notion,甚至一些新兴的 Web3 项目都称为“平台”。但当我深…

2026/8/22 2:47:20 阅读更多 →
软件包安装中断导致系统变砖的修复指南:诊断、解锁与数据保全

软件包安装中断导致系统变砖的修复指南:诊断、解锁与数据保全

在实际的系统维护和软件包管理过程中,很多开发者或运维人员都曾遇到过因软件包安装程序被意外中断或强制冻结,导致系统关键组件损坏、服务无法启动,甚至整个系统“变砖”的棘手情况。这种问题在 Linux 服务器、嵌入式设备(如路由器…

2026/8/22 2:47:20 阅读更多 →
数字员工上线之前,先把数据打通这层做扎实

数字员工上线之前,先把数据打通这层做扎实

引言 不少企业的AI改造是从"上个数字员工"开始的:找个场景,接上大模型,让Agent替人查数据、写单据。某家装备制造企业就这么干过,让数字员工回答销售最关心的问题,这个订单能不能提前三天交付。演示时一切正…

2026/8/22 2:47:20 阅读更多 →

最新新闻

多智能体系统赋能与涌现:从理论到协同围捕实践

多智能体系统赋能与涌现:从理论到协同围捕实践

1. 多智能体赋能与群体复杂行为涌现:从理论到实践的全景拆解最近在复现和优化几个多智能体强化学习的项目时,我反复琢磨一个核心问题:为什么一群能力平平、规则简单的个体,一旦组织起来,就能完成远超单个个体能力的复杂…

2026/8/22 3:50:38 阅读更多 →
低成本DIY书籍扫描仪:从硬件搭建到可搜索PDF生成全流程

低成本DIY书籍扫描仪:从硬件搭建到可搜索PDF生成全流程

最近在整理个人藏书和资料时,发现很多绝版或珍贵的纸质书籍、笔记,既想永久保存,又希望能方便地在电子设备上阅读和检索。市面上的专业扫描仪要么价格昂贵,要么操作繁琐,不适合个人或小团队使用。于是,我萌…

2026/8/22 3:50:38 阅读更多 →
ChatGPT接管短信?苹果信息应用新插件帮你自动回复

ChatGPT接管短信?苹果信息应用新插件帮你自动回复

你是否曾幻想过让别人替你回消息?如今,这个愿望成真了——不过替你打字的不是人,而是AI。TechCrunch报道,OpenAI正在推出一个全新的Apple Messages插件,让ChatGPT能够直接在你和亲友的iMessage对话中充当自动代笔。 AI…

2026/8/22 3:50:38 阅读更多 →
自建Bark推送服务:从APNs原理到Docker部署实战

自建Bark推送服务:从APNs原理到Docker部署实战

1. 为什么你需要一个自己的推送服务?如果你用过一些第三方推送服务,比如 Server 酱、PushDeer,或者一些云服务商提供的推送功能,你大概率会遇到几个痛点:要么有推送频率限制,要么需要付费才能解锁高级功能&…

2026/8/22 3:50:38 阅读更多 →
AI招聘系统变革:世纪云猎如何解决2026年人才挑战

AI招聘系统变革:世纪云猎如何解决2026年人才挑战

1. 项目概述2026年的招聘市场正在经历一场由AI驱动的深刻变革。作为从业12年的人力资源技术顾问,我亲眼目睹了传统招聘系统如何被新一代AI工具颠覆。在这个背景下,"世纪云猎"系统正在成为企业招聘技术栈中不可或缺的组成部分。2. 为什么2026年…

2026/8/22 3:50:38 阅读更多 →
GAMIT/GLOBK v10.75 在 Ubuntu 上的完整安装与高精度 GNSS 数据处理实践指南

GAMIT/GLOBK v10.75 在 Ubuntu 上的完整安装与高精度 GNSS 数据处理实践指南

这次我们来看一个在北斗/GNSS高精度数据处理领域堪称“基石”的软件套件——GAMIT/GLOBK。对于从事大地测量、地壳形变监测、精密定位研究的科研人员和工程师来说,这套由麻省理工学院(MIT)和斯克里普斯海洋研究所(SIO)…

2026/8/22 3:49:38 阅读更多 →

日新闻

沉金PCB工艺实战指南:从设计到SMT焊接的可靠性保障

沉金PCB工艺实战指南:从设计到SMT焊接的可靠性保障

在电子硬件开发领域,PCB(印制电路板)的沉金工艺是提升产品可靠性和焊接质量的关键环节。对于需要高密度互连、长期稳定运行或高频信号传输的板卡,如“黍姐仿通行证”这类可能涉及身份识别、数据交互的硬件项目,选择正确…

2026/8/22 0:00:11 阅读更多 →
电气考研电路八月强化四步法:从知识体系到真题实战的闭环攻略

电气考研电路八月强化四步法:从知识体系到真题实战的闭环攻略

这次我们来看一个针对电气考研电路科目的学习规划项目。它不是软件工具,而是一套聚焦于8月份关键节点的备考策略。对于电气工程考研的同学来说,电路分析是专业课的重中之重,也是拉开分差的关键。进入8月,复习进入强化阶段&#xf…

2026/8/22 0:00:11 阅读更多 →
消除AI代码的“AI味”:Claude Code设计优化技能配置与实战指南

消除AI代码的“AI味”:Claude Code设计优化技能配置与实战指南

大家好,我是专注于前端开发与AI工具实践的技术博主。在日常使用 Claude Code 等AI编程助手时,你是否也遇到过这样的困扰:生成的代码功能上没问题,但代码风格、组件设计、交互逻辑总透着一股“AI味”——布局单调、样式简陋、交互生…

2026/8/22 0:00:11 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/21 3:21:33 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 0:02:09 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/21 6:07:56 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/21 16:42:28 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/20 21:46:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/22 3:22:48 阅读更多 →