RLHF 全流程拆解:SFT→奖励模型→PPO,每一步在做什么
一个只经过预训练、没经历过RLHF的模型你问它帮我写一封邮件它大概率会续写你的问题——“帮我写一封邮件这是一个很常见的需求……”预训练造出了博闻强识的人RLHF 才把他改造成能干活、有安全边界的助手。这个改造分三步监督微调SFT、奖励模型训练、强化学习优化PPO/DPO/GRPO。每一步解决一个前一步解决不了的问题。今天把整个流程彻底拆开逐步说清楚每一步在做什么、为什么这么设计、以及 2023-2025 年各家的演化方向。为什么预训练不够预训练的目标只有一个预测下一个 token。输入互联网上 TB 级别的文本让模型反复猜下一个词是什么。这个过程让模型积累了惊人的知识但造就了一个奇怪的产物——• 你问如何制造炸弹它可能真的告诉你互联网上有这类文字• 你说帮我总结这份文件它可能先重述一遍你的话再开始总结• 它懂数学但做数学题时会随机出错因为预训练没有对错反馈RLHF 的目标就是打通三道关听指令、回避有害内容、越来越好。完整流程鸟瞰RLHF 三阶段RLHF 包含三个串行阶段每个阶段的产出是下一阶段的输入Phase 3RL 优化 Phase 2奖励模型训练 Phase 1SFT 监督微调 预训练 Base Model 高质量指令→回答对\n人工标注 10k~100k 条 SFT Model\n能对话但不稳定 同问题多答案\n 人类排序偏好 Reward Model\n能打分哪个答案更好 PPO / DPO / GRPO\n用打分信号持续优化 LLM Chat Model\n对话流畅、安全、能推理下面逐阶段拆解。Phase 1SFTRLHF 的训练起点核心问题预训练模型会续写但不会回答。SFT 的数据格式很直接User: 帮我把以下英文翻译成中文Hello WorldAssistant: 你好世界每一条数据就是一个输入指令 → 正确输出的配对。由人工精心撰写或筛选数量从几千到几十万不等——OpenAI 在 InstructGPT 论文里用了约 1.3 万条高质量 SFT 数据效果就已经显著好过纯预训练模型Ouyang et al., 2022。SFT 的本质强制模型学会一种新的输入输出格式。Base Model 看到的是海量随机文本SFT Model 看到的是指令 → 帮助性回答的一致模式。SFT 之后模型已经能正经对话。但有两个残留问题不稳定同一问题多次问答案质量参差不齐“刚好够格”SFT 只能学到数据里已有的正确行为没有机制让模型主动变得更好这引出第二阶段的必要性我们需要一个能持续判断哪个回答更好的打分机制。Phase 2奖励模型RLHF 的偏好代理数据怎么来人类标注员拿到同一个问题的 4 个不同回答按质量排序问题解释一下什么是量子纠缠回答 A[详细、准确、有类比、无危险内容] → 第 1回答 C[准确但太技术性普通人看不懂] → 第 2回答 B[浅显但有轻微错误] → 第 3回答 D[完全跑题] → 第 4这样的偏好对A C B D可以拆成若干个两两比较A C、A B、A D、C B……每一个两两对都是一条训练数据。奖励模型的结构奖励模型Reward ModelRM的结构和 LLM 几乎相同区别在最后一层• LLM 最后一层输出下一个 token 的概率分布• RM 最后一层输出一个标量分数这个回答得几分训练目标让 RM 在人类认为更好的回答上打出更高分数。为什么不直接让人类打分第三阶段的 RL 训练要给模型生成的数百万条输出打分。人类来不及成本也无法承受。奖励模型是人类偏好的代理打分员一次性训练好之后无限复用。这也是 RLHF 最关键的设计取舍用有限的人类标注训练出一个可扩展的偏好代理。Phase 3PPORLHF 的强化学习核心这是三个阶段里工程复杂度最高的一步。四个角色同时在场PPO 训练同时维护四个模型角色职责权重是否更新Actor演员要训练的 LLM生成回答✅ 更新Critic评论家估计当前状态的预期价值辅助优势函数计算✅ 更新Reward Model给 Actor 的输出打分Phase 2 产物❌ 冻结Reference ModelSFT 模型的副本充当基线防止 Actor 跑偏❌ 冻结内存压力可想而知2 个同量级 LLMActor Ref 2 个辅助模型同时驻留 GPU。训练循环KL 惩罚防止奖励 Hacking这是 PPO 最核心的安全机制。假设没有 KL 惩罚模型可能发现反复输出这是个好问题您真聪明然后……能骗过奖励模型得高分。或者生成一段奇怪的重复文本恰好触发 RM 的盲点。KL 散度惩罚强制 Actor 不能与 Reference ModelSFT 模型偏离太远实际奖励 r − β × KL(Actor || Reference)β是超参数β 越大模型越保守β 越小模型探索空间越大但越容易不稳定。PPO 的 clip 机制也起到类似作用每次更新幅度不能太大保证训练稳定。演化DPO 和 GRPO 如何简化 RLHFPPO 的工程复杂度是公认的痛点。2023-2025 年出现了两个重要的简化方案。DPO干掉奖励模型2023 年斯坦福提出DPODirect Preference OptimizationRafailov et al., 2023。核心洞察奖励模型和语言模型之间存在一个解析关系可以直接用偏好对优化语言模型绕过奖励模型训练这一步。DPO 的损失函数直接接收preferred/rejected对Loss −log σ(β × [log P(preferred|x)/P_ref(preferred|x) − log P(rejected|x)/P_ref(rejected|x)])效果把 4 个模型减到 2 个LLM Reference训练代码量大幅下降。维度PPODPO需要 Reward Model✅❌需要 Critic✅❌训练稳定性高clip 机制对数据质量更敏感GPU 内存需求极高4 模型中2 模型适合场景复杂偏好、在线 RL静态偏好数据、快速迭代现在小模型和开源微调实验基本首选 DPO省去了奖励模型训练的工程量。GRPODeepSeek-R1 的推理突破2025 年初GRPOGroup Relative Policy Optimization随 DeepSeek-R1 爆出DeepSeek-AI, 2025。GRPO 的思路更激进把 Critic 也干掉。替代方案是组内相对排名一个数学问题 生成 N8 个回答 规则打分\n对1 错-1 组内得分排名\n高分 → 正向更新\n低分 → 负向更新 更新模型关键条件必须有明确的对错标准。数学题答案对不对、代码能不能运行——这类任务天然适合 GRPO。GRPO 不适合没有明确对错的开放式写作场景。DeepSeek-R1 用 GRPO 训出了长思维链推理能力——模型在解题过程中学会了先想再答的模式而不是经过复杂的 RLHF 人类偏好标注。完整演化对比一图看清三条路Base Model SFT 经典 RLHFPPO 训练 Reward Model PPO 训练\nActorCriticRMRef DPO去掉 RM 直接偏好优化\nLLMRef 两模型 GRPO去掉 CriticRM 组内相对排名\n规则打分 Chat Model\n通用对话 Chat Model\n数据驱动偏好 Reasoning Model\n长思维链推理几个常见误解误解 1RLHF 训练量很小无足轻重SFT 数据量确实比预训练小几个数量级但 RL 阶段的计算量相当可观。PPO 训练每次 rollout 都要推理 打分4 模型同驻 GPU通常需要持续数天到数周的集群计算。误解 2奖励模型很准RM 是人类偏好的代理但不是人类。它有自己的盲点对回答长度有偏更长的回答往往得分更高哪怕质量差、对自信语气有偏。这就是奖励 Hacking问题持续被研究的原因。误解 3DPO 已经完全替代 PPO没有。对于需要在线反馈、复杂偏好建模比如同一个用户不同场景有不同偏好的场景PPO 的在线 RL 优势仍然成立。两者在不同场景下各有用武之地。写在最后RLHF 是一个系统工程而不是一个算法。SFT 解决格式问题奖励模型解决好坏标准问题PPO/DPO/GRPO 解决持续优化问题——三者缺一不可但也可以按场景取舍组合。趋势很清楚后训练流水线正在向更简单、更高效的方向演化。DPO 干掉了奖励模型GRPO 干掉了 Critic未来也许有更极简的方案出现。但核心思路不会变——“根据好坏反馈调整模型行为”这是让 LLM 从知识库变成助手的根本机制。你现在团队用的是哪条路线A. 经典 PPO稳定性最重要B. DPO数据够好就用这个C. GRPO我们做数学/代码任务D. 还在研究中看完文章有点开窍了 这部分建议收藏——三条路线的对比表下次讨论后训练方案直接调出来。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

字节二面被问:prompt到头了,你会尝试哪些做法来提升效果呢?我直接说:肯定微调上起来啊。面试官说我太武断了。

字节二面被问:prompt到头了,你会尝试哪些做法来提升效果呢?我直接说:肯定微调上起来啊。面试官说我太武断了。

事情是这样的 大模型岗位的二面嘛,面试官抛出了一个挺经典的问题: “如果你发现 prompt 已经优化到头了,效果还是上不去,你会怎么做?” 我当时几乎没怎么犹豫,脱口而出: “那肯定上微调啊。” …

2026/8/5 0:46:39 阅读更多 →
【图像分割】基于局部质心的无监督的2D 和 3D 图像分割(Matlab代码实现)

【图像分割】基于局部质心的无监督的2D 和 3D 图像分割(Matlab代码实现)

💥💥💞💞欢迎来到本博客❤️❤️💥💥 🏆博主优势:🌞🌞🌞博客内容尽量做到思维缜密,逻辑清晰,为了方便读者。 &#x1f381…

2026/8/5 0:46:37 阅读更多 →
三步打造你的专属象棋AI教练:Vin象棋智能分析助手完全指南

三步打造你的专属象棋AI教练:Vin象棋智能分析助手完全指南

三步打造你的专属象棋AI教练:Vin象棋智能分析助手完全指南 【免费下载链接】VinXiangQi Xiangqi syncing tool based on Yolov5 / 基于Yolov5的中国象棋连线工具 项目地址: https://gitcode.com/gh_mirrors/vi/VinXiangQi 还在为棋局复盘而烦恼?想…

2026/8/4 0:27:50 阅读更多 →

最新新闻

TinyInst:轻量级动态二进制插桩框架的原理与实战应用

TinyInst:轻量级动态二进制插桩框架的原理与实战应用

1. 项目概述:从零理解TinyInst的价值与定位如果你是一名安全研究员、逆向工程师,或者对软件漏洞挖掘和二进制分析感兴趣,那么你一定听说过Google Project Zero这个“漏洞猎人”团队。他们不仅以发现和报告高价值漏洞闻名,更以开源…

2026/8/5 3:00:22 阅读更多 →
Python自动化实战:Selenium与WeasyPrint实现付费网页文档转PDF

Python自动化实战:Selenium与WeasyPrint实现付费网页文档转PDF

1. 项目缘起与核心挑战最近在帮朋友整理一份行业资料,发现一个挺有意思的需求:某个专业文档网站上有不少高质量的付费文档,但网站本身只提供在线阅读,没有直接的PDF下载按钮。朋友需要把这些文档整理成PDF,方便离线阅读…

2026/8/5 3:00:22 阅读更多 →
VC6.0在Win10/11系统安装配置全攻略:解决兼容性问题与编译调试

VC6.0在Win10/11系统安装配置全攻略:解决兼容性问题与编译调试

1. 项目概述:为什么今天还要折腾VC6.0? 如果你在搜索引擎里敲下“VC6.0下载安装”,大概率会看到两种截然不同的声音:一种是怀旧派,认为它是C启蒙的经典,简单纯粹;另一种则是现代派,直…

2026/8/5 3:00:22 阅读更多 →
OpenClaw AI Agent安全实战:防御提示词注入攻击的架构与工程指南

OpenClaw AI Agent安全实战:防御提示词注入攻击的架构与工程指南

1. 项目概述:当你的AI助手成为“内鬼”最近在折腾AI Agent和自动化工作流的朋友,估计不少人都听说过或者正在用OpenClaw。这东西确实方便,能帮你处理邮件、整理文档、甚至调用各种API,像个不知疲倦的数字助理。但不知道你有没有想…

2026/8/5 3:00:22 阅读更多 →
Kali Linux更换国内源后解决NO_PUBKEY数字签名错误的完整指南

Kali Linux更换国内源后解决NO_PUBKEY数字签名错误的完整指南

1. 问题场景与核心痛点刚装好Kali Linux,第一件事肯定是想换个国内的软件源,让apt update和apt upgrade飞起来。但很多朋友在按照网上教程修改完/etc/apt/sources.list文件,满怀期待地输入sudo apt update后,迎头就是一盆冷水——…

2026/8/5 3:00:22 阅读更多 →
Unity引擎导入与渲染高精度3D模型全流程实战:以赛车模型为例

Unity引擎导入与渲染高精度3D模型全流程实战:以赛车模型为例

在实际游戏开发、数字资产管理和虚拟内容创作中,如何高效地获取、导入、配置并最终在引擎中渲染一个高质量的3D模型,是一个贯穿项目始终的工程问题。本文将以一个具体的案例——将《极限竞速:地平线5》中的“Spark兰博基尼Huracan GT3 EVO2”…

2026/8/5 2:59:21 阅读更多 →

日新闻

Java缓存框架:JetCache

Java缓存框架:JetCache

TOC 一、简介 JetCache 是一个 Java 缓存抽象框架,为不同的缓存解决方案提供了统一的使用方式。 它提供的注解比 Spring Cache 更加强大。 JetCache 的注解支持原生 TTL、两级缓存以及在分布式环境中的自动刷新功能,同时你也可以通过代码直接操作 Cach…

2026/8/5 0:00:43 阅读更多 →
AD 铺铜设置十字连接,过孔全连接,新版AD的简单设置

AD 铺铜设置十字连接,过孔全连接,新版AD的简单设置

需求:通孔焊盘 十字花;过孔 Via 实心直连;贴片焊盘按需设置 AD 测试版本AD24 很多工程师踩坑:全部统一十字,导致接地过孔阻抗高、大电流发热! 一、快捷键打开规则 PCB 界面按下:D R 展开…

2026/8/5 0:00:43 阅读更多 →
AI素描转换技术深度拆解(2024最新论文+工业级落地代码):从Stable Diffusion ControlNet到LoRA微调全链路解析

AI素描转换技术深度拆解(2024最新论文+工业级落地代码):从Stable Diffusion ControlNet到LoRA微调全链路解析

更多请点击: https://kaifayun.com 第一章:AI生成素描效果 AI生成素描效果是计算机视觉与风格迁移技术融合的典型应用,其核心在于将彩色照片或RGB图像转换为具有手绘质感、明暗对比强烈、边缘清晰的单色素描图像。该过程通常依赖于深度学习模…

2026/8/5 0:00:43 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/4 13:24:41 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/4 11:41:39 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/4 5:26:40 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/4 13:38:24 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/4 11:09:16 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/4 13:38:40 阅读更多 →