大语言模型训练范式:从 GPT 到 Llama 的 RLHF 演进
本文整理自一次关于大语言模型训练范式的学习笔记结合 GPT 系列与 Llama 2/3 的训练流程梳理预训练、SFT、Reward Model、RLHF、DPO 等核心概念并辨析自监督学习与无监督学习的关系。一、为什么大语言模型需要多阶段训练大语言模型LLM并不是一次性训练完成的。如果只进行预训练模型虽然具备强大的语言建模能力但并不会乖乖地按照人类期望的方式回答问题如果直接用人类标注数据进行端到端训练又难以获得通用的世界知识和语言理解能力。因此现代 LLM 的训练通常被拆分为几个阶段Pretrain预训练学习语言和世界知识构建通用基座。SFT有监督微调让模型学会按指令回答问题的格式和风格。Reward Model / RLHF让模型的输出对齐人类偏好变得更有用、无害、诚实。下面分别展开 GPT 和 Llama 两大家族的训练范式。二、GPT 训练范式Pretrain → SFT → RM → PPOOpenAI GPT 系列尤其是 GPT-3、InstructGPT、ChatGPT 的早期版本的训练流程可以概括为四个阶段1. Pretrain自监督预训练预训练阶段使用大规模无标注文本通过自回归方式训练模型给定前 n 个 token预测第 n1 个 token。训练目标可以形式化为最大化序列的联合概率\max_{\theta} \sum_{x \in \mathcal{D}} \log P_\theta(x_1, x_2, ..., x_T)通过这种方式模型在数万亿 token 的自问自答中学会了语法、语义、常识、推理能力等。注意这里的自监督意味着数据本身既是输入又是标签——不需要人工标注模型自己预测下一个 token 即可。2. SFT有监督微调预训练后的模型虽然能续写文本但不一定能按照用户的指令给出高质量回答。因此需要用小规模的一问一答人工标注数据对模型进行微调。SFT 的训练目标很简单对于输入 prompt x 和期望输出 y最大化 P_\theta(y|x)。可以理解为让模型模仿人类给出的优质回答。3. Reward Model奖励模型更像评委SFT 之后模型已经能给出像样地回答但质量参差不齐。此时需要引入一个奖励模型Reward Model, RM来评分。训练 RM 的典型做法是用 SFT 后的模型对同一问题生成 4 个不同答案让人类标注员对这 4 个答案进行排序或打分用这些偏好数据训练一个独立的评分模型。关键点RM 不是生成模型也不是 LLM 的对抗对手而是一个独立的评分器/评委。它学会的是人类更喜欢哪种回答。4. PPO基于 RLHF 的强化学习优化有了 RM 后就可以用强化学习来进一步训练 LLM。OpenAI 使用的是PPOProximal Policy Optimization一种稳定、高效的策略梯度算法。RLHFReinforcement Learning from Human Feedback 强化学习RL 人类反馈HF。RM 是 RLHF 的核心组件它为 LLM 生成的回答打分引导 LLM 生成人类更喜欢的回答。三、Llama 训练范式Pretrain → SFT → RM → Rejection Sampling → RLHF → DPOMeta 的 Llama 系列在 GPT 范式基础上做了扩展尤其是 Llama 2 引入了Rejection Sampling拒绝采样环节Llama 3 又加入了DPODirect Preference Optimization。1. Pretrain与 GPT 类似使用大规模文本进行自回归预训练学习通用表示能力。2. SFT使用高质量指令数据进行有监督微调让模型学会对话和指令遵循能力。3. Reward Model训练一个奖励模型用于评估模型输出的质量。4. Rejection Sampling拒绝采样生成高质量 SFT 数据这是 Llama 2 相比 GPT 的一个重要区别。它的核心思想是用已经训练好的 RM自动生成更多高质量的问答对再回喂给 SFT。具体流程针对一个 prompt让当前模型采样生成 K 个候选回答用 RM 对每个候选回答打分选出分数最高的那个回答best-of-K将这个 (prompt, best\_answer) 对加入 SFT 训练数据再次微调模型。注意Rejection Sampling 必须在训练好 RM 之后才能进行否则没有评分依据。5. RLHFRejection Sampling PPOLlama 2 的 RLHF 阶段结合了 Rejection Sampling 和 PPO让模型在探索与利用之间取得平衡持续提升输出质量。6. DPODirect Preference OptimizationLlama 3 的新加入Llama 3 在 RLHF 之后进一步加入了DPO直接偏好优化。DPO 是一种不依赖显式奖励模型的对齐方法。它直接使用人类偏好数据通过对比被偏好的回答和不被偏好的回答来优化策略模型。相比 PPODPO 更简单高效训练更稳定近年来被广泛应用于开源模型对齐。四、关键概念辨析1. SFT 和 RL 的区别维度SFT有监督微调RL强化学习训练数据一问一答的成对数据奖励信号 / 偏好信号优化目标让模型输出尽可能接近标准答案让模型输出获得更高的奖励分数学习方式模仿学习探索-反馈-优化典型算法交叉熵损失PPO、DPO、RLHF简单来说SFT 是照着答案学RL 是根据评分自己摸索更好答案。2. 自监督学习与无监督学习的区别这是很多人容易混淆的一对概念。无监督学习Unsupervised Learning的核心假设是数据本身在空间中具有分布规律算法不需要知道样本的类别标签只需要衡量样本之间的相似度或距离进行聚类、降维、密度估计等。自监督学习Self-supervised Learning的精妙之处在于把无监督问题转化为监督学习的架构。它通过构造预训练任务Pretext Task让数据自己生成标签在 NLP 中典型做法是Mask Language Model或Next Token Prediction遮住文本的一部分让模型预测被遮住的内容在 CV 中典型做法包括预测图像旋转角度、拼图顺序、掩码像素等。训练完成后模型学到的通用表征能力可以迁移到各种下游任务Downstream Task只需要少量标注数据进行微调即可取得出色效果。关系总结自监督学习可以看作是无监督学习的一种延伸或特殊形式——它同样不需要人工标注但巧妙地通过数据自身构造了监督信号。近年来的大模型如 GPT、BERT、Llama正是靠自监督预训练才获得了海量的通用知识。五、总结大语言模型的训练是一个由浅入深、由通用到对齐的过程Pretrain让模型懂语言、懂世界SFT让模型学会回答问题的格式Reward Model让模型知道什么是好回答RLHF / PPO / DPO让模型主动优化对齐人类偏好Rejection Sampling则提供了一条自动生成高质量训练数据的路径。理解这些训练范式不仅能帮助我们更好地使用 LLM也能在构建自己的 Agent 应用时做出更合理的选型与优化决策。参考OpenAI InstructGPT / ChatGPT 相关论文与技术博客Llama 2 / Llama 3 技术报告RLHF、PPO、DPO 相关论文本文为个人学习整理如有疏漏欢迎指正。

相关新闻

JSON与JSONPath:高效数据查询的黄金组合

JSON与JSONPath:高效数据查询的黄金组合

1. JSON与JSONPath:数据查询的黄金搭档 作为一名常年和API打交道的开发者,我处理过无数JSON数据格式。JSON(JavaScript Object Notation)早已成为现代Web开发中数据交换的事实标准,而JSONPath则是处理复杂JSON结构时不…

2026/9/22 0:46:45 阅读更多 →
中科院科技查新收费标准与服务内容详解

中科院科技查新收费标准与服务内容详解

我朋友上次想开中科院科技查新报告,完全懵了, 说实在搞不明白这些查新收费标准与服务内容…… 如果你也有同样的烦恼,别急! 今天这篇文章我就把收费标准、服务内容和完整流程一次给你讲清楚。 1.中科院科技查新收费标准是怎样的…

2026/9/18 12:31:57 阅读更多 →
如何快速配置PrismLauncher:面向Minecraft玩家的完整指南

如何快速配置PrismLauncher:面向Minecraft玩家的完整指南

如何快速配置PrismLauncher:面向Minecraft玩家的完整指南 【免费下载链接】PrismLauncher A custom launcher for Minecraft that allows you to easily manage multiple installations of Minecraft at once (Fork of MultiMC) 项目地址: https://gitcode.com/gh…

2026/9/21 11:39:11 阅读更多 →

最新新闻

5个新手避坑技巧,看说实战让公路项目代码跑通

5个新手避坑技巧,看说实战让公路项目代码跑通

5个新手避坑技巧,看说实战让公路项目代码跑通 学会语法却不知怎么搭项目,这是很多刚入行公路工程信息化开发的兄弟最头疼的事。你背下了 Python 的 if-else ,记住了 Java…

2026/9/22 0:46:12 阅读更多 →
3个坑让你等额计算代码崩盘,一文搞懂底层逻辑

3个坑让你等额计算代码崩盘,一文搞懂底层逻辑

3个坑让你等额计算代码崩盘,一文搞懂底层逻辑 复制来的等额还款或分期代码跑不通,报错信息看得头大,参数传对了却算出离谱数字,这种崩溃感谁懂?别急着删库跑路,问题往往出在对 等额…

2026/9/22 0:46:12 阅读更多 →
3分钟搞懂伺服电机尺寸:图解原理避坑指南

3分钟搞懂伺服电机尺寸:图解原理避坑指南

3分钟搞懂伺服电机尺寸:图解原理避坑指南 看了一堆教程还是不会写项目?别慌,这不是你的问题,是资料太碎。今天这篇【伺服电机尺寸】图解原理,直接把房建工程里的电机选型和移动端监控代码打通。你不需要是机械专家,只需要知道怎么在App里准确展示电…

2026/9/22 0:46:12 阅读更多 →
叉车限速器入门到精通:3步搞定嵌入式控制逻辑

叉车限速器入门到精通:3步搞定嵌入式控制逻辑

叉车限速器入门到精通:3步搞定嵌入式控制逻辑 看了一堆教程还是不会写项目?这是很多刚接触嵌入式控制的工程师最真实的写照。理论背得滚瓜烂熟,一到实际设备上,面对传感器数据波动、执行机构响应延迟,脑子瞬间一片空白。从 入门到精通…

2026/9/22 0:46:12 阅读更多 →
跑跑卡丁车挂源码解析:3步吃透内存读写,告别文档迷宫

跑跑卡丁车挂源码解析:3步吃透内存读写,告别文档迷宫

跑跑卡丁车挂源码解析:3步吃透内存读写,告别文档迷宫 官方文档太长抓不住重点,这是很多想深入底层机制的同学最大的痛点。别慌,今天我们不啃那些晦涩的理论,直接上 源码解析…

2026/9/22 0:46:12 阅读更多 →
蓝绿厂是指什么手机?3个代码案例搞定性能优化痛点

蓝绿厂是指什么手机?3个代码案例搞定性能优化痛点

蓝绿厂是指什么手机?3个代码案例搞定性能优化痛点 你复制来的代码跑不通,报错信息一片红,完全不知道从哪调起?别慌,这不是你代码写得烂,而是没掌握 性能优化…

2026/9/22 0:45:11 阅读更多 →

日新闻

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天 配置环境就卡半天?别怪机器慢,多半是你没选对工具链。在Java、Go或Python的项目现场, 手写实现…

2026/9/22 0:00:41 阅读更多 →
剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑 面试被问原理答不上来,是不是常态?别慌。很多开发者对着 GitHub 开源仓库里的代码发呆,看似简单实则暗藏玄机。今天这份【剑帝加点】速查手册,直接带你拆解核心实现,把面试必考的原理讲透。…

2026/9/22 0:00:41 阅读更多 →
手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优 复制来的代码跑不通不知道怎么调?别慌,这种“复制粘贴地狱”在开发圈太常见了。尤其是做 图片压缩网站…

2026/9/22 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/21 3:13:20 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/21 2:19:36 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/21 4:51:05 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/21 15:36:51 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/21 15:36:51 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →