R1-searcher:如何通过强化学习从零激活大语言模型的搜索能力?完整技术解析
R1-searcher如何通过强化学习从零激活大语言模型的搜索能力完整技术解析【免费下载链接】R1-SearcherR1-searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning项目地址: https://gitcode.com/gh_mirrors/r1/R1-SearcherR1-searcher是一个创新的开源项目它通过强化学习技术从零开始激活大语言模型的搜索能力让模型能够在推理过程中智能调用外部搜索工具获取信息显著提升模型在知识密集型任务中的表现。 为什么大语言模型需要搜索能力大型推理模型LRMs如OpnAI-o1和Deepseek-R1已展示出强化学习在增强模型长步骤推理能力方面的显著影响。然而当面对知识密集型问题特别是多跳问题和时间敏感问题时这些模型可能缺乏必要的知识。因此让LLMs能够在推理过程中调用网络搜索获取外部信息变得至关重要。R1-searcher的核心创新我们提出的R1-searcher采用两阶段结果监督强化学习方法使模型学会在推理过程中调用网络搜索首先让模型学习如何调用网络搜索然后教它如何有效使用该搜索引擎。这种方法不需要任何冷启动的指令微调同时兼容现有的Base LLMs或Chat LLMs。图R1-searcher在HotpotQA、2WikiMultiHopQA、Bamboogle和Musique等数据集上的性能对比展示了其相对于其他方法的显著优势 R1-searcher的关键见解仅依靠结果监督强化学习我们可以仅使用查询-答案对激活模型的内在搜索能力无论我们处理的是Base LLMs还是Chat LLMs最新的强化学习算法如GRPO、PPO和Reinforce都能有效激活LLMs的内部搜索能力训练过程中不需要复杂的提示工程或过程监督Base LLMs的能力在很大程度上影响模型是否可以从零开始直接训练RL之后的LongCoT推理是比现有的基于树搜索的方法如蒙特卡洛树搜索更有效和高效的测试时间扩展方法通过使用本地检索进行RL训练模型可以很好地泛化到其他数据集和在线搜索场景最终的7B参数LLMs相比现有的复杂方法甚至闭源LLMs如GPT-4o-mini实现了显著的性能提升️ R1-searcher的实现方法整体框架我们采用两阶段奖励引导RL训练方法阶段1仅使用格式奖励学习调用搜索阶段2使用格式奖励和答案奖励学习通过调用搜索解决问题算法细节我们仅使用结果监督强化学习进行训练主要考虑两个方面(1)强化学习算法(2)奖励设计。RL算法我们使用改进版的reinforce特别是通过模仿GRPO算法。对于每个问题我们平均n个样本的奖励这稳定了训练过程。对于解决方案格式我们使用/think.../RichMediaReference标签进行思考begin_of_search...end_of_search用于调用搜索工具以及begin_of_documents...end_of_documents用于返回检索文档。奖励设计我们利用基于F1的规则奖励。我们还尝试了精确匹配EM和覆盖精确匹配CEM作为奖励然而这些指标不能作为这些任务的良好基准更详细的分析即将发布。对于答案奖励我们使用黄金答案和预测答案之间的F分数。对于格式奖励在阶段1中如果模型执行检索且解决方案满足格式要求则在答案奖励中添加0.5分。在阶段2中移除检索要求如果解决方案不满足格式要求则从答案奖励中减去2分。详细实现包括超参数可以在我们的代码中找到。图R1-searcher使用的Ray架构展示了Actor模型、Reference模型和Reward模型之间的关系及GPU分配训练数据我们选择HotpotQA和2WikiMultiHopQA训练集中的一部分作为我们的训练数据。我们使用Qwen-2.5-7B-Instruct在训练数据集上执行rollouts。根据正确回答问题所需的rollouts数量我们将数据分为三类简单10次rollouts、中等10且20次rollouts和困难20次rollouts。然后将这些类别按特定比例混合形成我们的训练数据。所有训练数据可在以下位置找到训练数据 评估结果遵循ReARTeR我们选择了四个代表性基准HotpotQA、2WikiMultiHopQA、Musique和Bamboogle。HotpotQA和2WikiMultiHopQA被视为域内数据因为我们使用了它们的训练集而Musique和Bamboogle被归类为域外数据使我们能够评估模型的泛化能力。我们从HotpotQA、2WikiMultiHopQA和Musique的开发集中随机抽取500个示例作为我们的测试集。对于Bamboogle我们使用所有测试集125个样本作为我们的测试集。所有数据集的检索语料库均为维基百科段落具体采用KILT发布的2019年8月维基百科语料库。此外由于Bamboogle包含的知识具有时效性我们还进行了在线网络搜索测试以进一步评估我们的模型与在线搜索能力的对齐程度。对于评估指标我们使用ACC_RCover-Exect-Match和ACC_LLLM-as-Judge。图R1-searcher在各数据集上的详细评估结果展示了与其他方法的对比可以看出当使用相同的LLaMA-3.1-8B-Instruct基础模型时我们的方法相比现有方法取得了显著改进甚至超过了GPT-4o-mini等闭源模型。此外当切换到更强大的基础模型Qwen-2.5-7B-Base时我们直接从零开始进行强化学习。最终我们可以取得更好的结果并在所有域内和域外数据集上获得最佳性能展示了我们模型出色的泛化能力。对于Bamboogle我们额外利用Google进行在线搜索。可以看出与仅依赖本地知识库相比结合在线搜索产生了更好的结果表明将在线搜索能力无缝集成到我们的模型中是可行的。图R1-searcher在Bamboogle数据集上使用在线搜索的性能对比 快速开始要开始使用R1-searcher首先克隆仓库git clone https://gitcode.com/gh_mirrors/r1/R1-Searcher项目的训练和推理代码主要位于以下目录训练脚本examples/scripts/核心算法实现openrlhf/trainer/数据处理openrlhf/datasets/ 引用如果我们的报告对您的研究有帮助请引用我们的报告。article{R1-searcher, title{R1-searcher: Stimulating the Search Capability of LLM from Zero via Reinforcement Learning}, author{Huatong Song, Jinhao Jiang, Yingqian Min, Jie Chen, Zhipeng Chen, Wayne Xin Zhao, Ji-Rong Wen, Yang Lu, Xu Miu}, url{https://github.com/SsmallSong/R1-searcher}, year{2025} } 许可证本项目以MIT许可证发布。 联系方式如有任何问题或反馈请通过songhuatong123ruc.edu.cn与我们联系。【免费下载链接】R1-SearcherR1-searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning项目地址: https://gitcode.com/gh_mirrors/r1/R1-Searcher创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

扩展Satellite Eyes功能:添加自定义地图源与管理地图样式的终极指南

扩展Satellite Eyes功能:添加自定义地图源与管理地图样式的终极指南

扩展Satellite Eyes功能:添加自定义地图源与管理地图样式的终极指南 【免费下载链接】satellite-eyes Mac OS X app to automatically set your desktop wallpaper to the satellite view overhead. 项目地址: https://gitcode.com/gh_mirrors/sa/satellite-eyes …

2026/9/22 5:05:42 阅读更多 →
Cocos引擎骨骼动画换装系统:附件与插槽管理架构实践

Cocos引擎骨骼动画换装系统:附件与插槽管理架构实践

1. 项目概述在游戏开发,尤其是角色扮演、换装养成类项目中,骨骼动画换装系统是提升游戏表现力和玩家沉浸感的核心技术。它允许玩家自由搭配角色的发型、服装、武器等部件,创造出独一无二的角色形象。Cocos引擎作为一款流行的跨平台游戏开发工…

2026/9/21 3:48:13 阅读更多 →
基于AI的Storybook组件文档自动化生成:从代码解析到CI/CD集成

基于AI的Storybook组件文档自动化生成:从代码解析到CI/CD集成

1. 项目概述:从“文档地狱”到“文档自由”的自动化革命 如果你是一名前端工程师,或者正在参与一个组件化程度较高的产品开发,那么对“写组件文档”这件事,大概率是又爱又恨。爱的是,一份清晰、可交互的文档是团队协作…

2026/9/15 9:07:56 阅读更多 →

最新新闻

告别低效:3步手写实现美拉德反应性能优化

告别低效:3步手写实现美拉德反应性能优化

告别低效:3步手写实现美拉德反应性能优化 看了一堆教程还是不会写项目?别急,问题不在你笨,而在没人教你怎么把理论变成跑得快的代码。今天咱们不聊虚的,直接上手 手写实现…

2026/9/22 5:05:15 阅读更多 →
活着余华源码解析:3个高频面试题坑点,看懂StackTrace不再抓瞎

活着余华源码解析:3个高频面试题坑点,看懂StackTrace不再抓瞎

活着余华源码解析:3个高频面试题坑点,看懂StackTrace不再抓瞎 昨晚改代码到凌晨三点,屏幕上滚动的红色报错让我瞬间清醒。 java.lang.NullPointerException…

2026/9/22 5:05:15 阅读更多 →
普天身份证阅读器配置卡死?这份避坑指南救急

普天身份证阅读器配置卡死?这份避坑指南救急

普天身份证阅读器配置卡死?这份避坑指南救急 配置普天身份证阅读器驱动时,是不是经常卡在半天没反应?或者设备管理器里转圈圈,最后弹出“找不到驱动”?别慌,这种 配置环境就卡半天…

2026/9/22 5:05:15 阅读更多 →
面试必问:搞懂不及卢家有莫愁,项目落地不再卡壳

面试必问:搞懂不及卢家有莫愁,项目落地不再卡壳

面试必问:搞懂不及卢家有莫愁,项目落地不再卡壳 看了一堆教程还是不会写项目?这种痛苦我太懂了。很多开发者在 CSDN 上收藏了上百篇 Java 并发或者 Python…

2026/9/22 5:05:15 阅读更多 →
3步搞定新手买房须知,从实战项目看底层逻辑

3步搞定新手买房须知,从实战项目看底层逻辑

3步搞定新手买房须知,从实战项目看底层逻辑 刚学会几行代码,却对着空白的IDE发呆?这种“学会语法却不知怎么搭项目”的无力感,是每个开发者的必经之痛。很多人以为买房只是签个合同,其实这和构建一个 实战项目…

2026/9/22 5:05:15 阅读更多 →
5个坑教你搞懂后端安全保障措施源码避坑指南

5个坑教你搞懂后端安全保障措施源码避坑指南

5个坑教你搞懂后端安全保障措施源码避坑指南 配置环境就卡半天?别急着骂娘。很多时候不是你的网络慢,也不是Docker没配好,而是你根本没看懂框架底层那些 安全保障措施 是怎么拦截你的请求的。今天这篇 避坑指南…

2026/9/22 5:04:15 阅读更多 →

日新闻

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天 配置环境就卡半天?别怪机器慢,多半是你没选对工具链。在Java、Go或Python的项目现场, 手写实现…

2026/9/22 0:00:41 阅读更多 →
剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑 面试被问原理答不上来,是不是常态?别慌。很多开发者对着 GitHub 开源仓库里的代码发呆,看似简单实则暗藏玄机。今天这份【剑帝加点】速查手册,直接带你拆解核心实现,把面试必考的原理讲透。…

2026/9/22 0:00:41 阅读更多 →
手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优 复制来的代码跑不通不知道怎么调?别慌,这种“复制粘贴地狱”在开发圈太常见了。尤其是做 图片压缩网站…

2026/9/22 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/22 4:32:41 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/22 4:38:57 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/21 4:51:05 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/21 15:36:51 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/21 15:36:51 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/22 2:43:42 阅读更多 →