后训练不等于微调:一文讲清大模型 Post-training、SFT、LoRA、DPO 和 RLHF
摘要预训练完成后模型还远远谈不上“好用”。它可能会续写文本却不一定听得懂指令可能知道很多知识却不会按照固定格式输出甚至给出了正确答案置信度也未必可信。把基础模型改造成聊天助手、推理模型或决策模型的过程通常统称为后训练。本文将解释后训练与微调的关系并梳理 SFT、LoRA、DPO、RLHF、蒸馏和概率校准各自解决的问题。一、先给结论后训练是阶段微调是方法很多文章把“后训练”和“微调”当作同义词日常交流中问题不大但严格来说二者不是同一个概念。后训练Post-training基础模型完成预训练以后为了让它更有用、更可控、更适合某类任务而进行的一整套训练与优化阶段。微调Fine-tuning在已有模型参数的基础上继续训练使模型适应特定数据、任务或行为要求的一类方法。因此更准确的关系是微调是后训练的一部分但后训练不只有微调。可以把大模型的训练过程简化为下面这条流水线海量通用数据 ↓ 预训练获得语言、知识与基础能力 ↓ 监督微调 SFT学会遵循指令 ↓ 偏好优化 DPO / RLHF回答更符合人类偏好 ↓ 蒸馏、领域适配、概率校准与安全对齐 ↓ 可部署的聊天、推理或决策模型这里从预训练结束之后开始的部分都可以纳入“后训练”这个大概念。二、预训练到底训练了什么预训练通常使用规模巨大的文本、代码或多模态数据让模型反复完成“预测下一个 token”等自监督任务。经过预训练模型会获得语言结构和表达能力数据中蕴含的大量知识一定程度的推理、归纳和代码能力根据上下文继续生成内容的能力。但“会续写”不等于“会当助手”。一个只经过预训练的基础模型面对用户问题时可能继续模拟网页、补写问题或者生成多个互相矛盾的答案。它并不知道开发者希望它扮演什么角色也没有稳定遵循指令的习惯。后训练的核心任务就是把“能力”组织成可用的“行为”。三、后训练通常包括哪些技术1. 监督微调让模型学会按要求回答监督微调Supervised Fine-TuningSFT使用成对的示例训练模型例如{ instruction: 判断用户意图, input: 帮我把这句话翻译成英文, output: translation }模型通过大量示例学习指令与标准答案之间的映射。SFT 常被用于建立问答和对话格式学习行业术语与业务规则固定 JSON 等结构化输出适配分类、抽取、路由等具体任务。SFT 是最典型的微调也是后训练中最常见的一步。2. LoRA 和 QLoRA它们解决的是“怎么训得更省”全参数微调会更新模型的全部参数训练效果上限较高但显存、计算和存储成本也很高。LoRA 不直接大规模修改原模型参数而是在部分网络层旁边增加小型、可训练的低秩矩阵。训练时主要更新这些新增参数因此成本明显降低。QLoRA 又进一步将底座模型量化以减少显存占用。需要注意SFT 描述的是训练目标和数据形式LoRA 描述的是参数更新方式。二者不是二选一。完全可以使用 LoRA 来完成一次 SFT也可以使用全参数更新来完成同样的 SFT。3. 偏好优化让模型不只“答对”还要“答得合适”对于很多问题并不存在唯一标准答案。例如两个回答都没有事实错误但一个更清晰、简洁和安全。偏好数据通常由同一问题下的多个候选回答以及它们的优劣关系构成。DPODirect Preference Optimization等方法可以让模型更倾向于生成被偏好的回答。它主要优化的是模型行为而不是简单灌入知识。4. RLHF利用反馈信号进一步优化行为RLHF 即基于人类反馈的强化学习。经典流程会先收集人类偏好再训练奖励模型最后使用强化学习优化语言模型。现代后训练流程还可能使用可验证奖励、规则奖励或 AI 反馈。对于数学和代码任务答案是否正确往往可以由计算器、测试用例或验证器直接检查这为强化学习提供了相对明确的奖励信号。强化学习更适合优化复杂策略但训练难度和成本通常也高于普通 SFT。5. 蒸馏把大模型能力迁移给小模型蒸馏通常让能力较强的教师模型生成答案、标签、推理轨迹或概率分布再用这些数据训练较小的学生模型。它常用于降低推理成本缩短响应时间将通用模型能力迁移到专用模型为特定任务批量生产训练数据。蒸馏得到的小模型不一定全面超越教师模型但可能在目标任务上以更低成本达到足够好的效果。6. 概率校准让“80% 把握”真的接近 80%分类和决策模型不仅要给出选项还经常需要输出每个选项的概率。概率值如果不可靠业务系统就很难设置自动处理阈值。例如系统可能规定置信度高于 0.90自动执行0.600.90交给更强模型复核低于 0.60转人工处理。如果模型总是过度自信这套流程就会失效。概率校准的目标是让预测置信度与真实正确率尽量一致。这也是决策类模型后训练中的重要环节。四、用 Microsoft Decision-1 理解“后训练”Microsoft Decision-1 是一个很直观的案例。根据微软公开资料它建立在 Qwen3.5-9B 的开放权重之上并针对固定选项的决策评分进行了后训练。它接收上下文、问题和候选答案返回各个候选项的概率而不是像普通聊天模型那样生成一段开放文本。这类模型可用于意图分类、请求路由、优先级判断、结果验证和工作流控制。从这个案例可以看出后训练并不是简单地“再喂一点数据”。它可能同时涉及将通用生成模型改造成专用决策模型让模型遵循固定的输入输出协议优化单次决策的准确率与延迟校准各候选选项的概率增加拒答或“不确定”机制。微软并未公开全部训练配方因此不能断言其中具体采用了哪些未披露算法。但用“后训练”描述整个能力改造过程比只说“微调”更准确。五、常见概念对照概念它描述什么主要目的预训练从大规模数据学习通用能力获得语言、知识和基础推理能力后训练预训练后的整体优化阶段让模型有用、可控并适合部署SFT使用输入与标准答案训练学会指令和任务格式全参数微调更新模型的全部参数充分改变模型能力与行为LoRA / QLoRA参数高效的训练方式降低显存、计算和存储成本DPO直接使用偏好对优化让输出更符合期望偏好RLHF使用反馈和奖励进行强化学习优化复杂行为与策略蒸馏从教师模型向学生模型迁移能力获得更小、更快的模型概率校准调整预测概率的可信程度支持阈值控制和风险管理六、什么时候只做微调什么时候需要完整后训练如果需求只是让模型识别内部术语、适应固定格式或者提升某个垂直任务的效果一次高质量的 SFT 或 LoRA 微调可能已经足够。如果要把模型投入复杂生产系统还需要考虑模型是否遵循业务规则遇到证据不足时是否会拒绝判断输出概率是否可信是否存在安全与合规风险低置信度结果如何升级处理延迟、吞吐和部署成本是否达标。这时需要的往往不是一次孤立的微调实验而是一套包含数据构建、监督训练、偏好优化、评测、校准和安全治理的后训练工程。七、三个常见误区误区一后训练就是 LoRALoRA 只是一种参数高效训练技术。后训练还可能使用全参数微调、偏好优化、强化学习、蒸馏和校准等方法。误区二微调可以可靠地给模型灌入大量新知识微调更擅长改变模型的行为、格式与任务偏好。对于频繁变化、必须准确追溯的知识检索增强生成RAG或数据库查询通常更合适。误区三训练集准确率高就可以直接上线生产环境中的数据分布、边界案例和风险远比训练集复杂。独立测试集、压力测试、概率校准、人工升级机制和线上监控都不可缺少。总结如果只记住一句话可以记住预训练决定模型“有什么基础能力”后训练决定这些能力“以什么方式被使用”微调则是实现后训练目标的一类重要手段。随着大模型从聊天工具进入代理、路由和自动化工作流后训练的重点也在变化不仅要追求模型会不会回答还要关心它是否稳定、可信、低成本以及系统能否安全地使用它的结果。理解后训练不只是理解一种算法而是在理解基础模型如何真正变成产品。参考资料MicrosoftMicrosoft-Decision-1 模型介绍https://commandline.microsoft.com/microsoft-decision-1-model-foundry/Microsoft FoundryMicrosoft-Decision-1 模型目录Microsoft-Decision-1 | Model Catalog | Microsoft FoundryQwenQwen3.5-9B 模型页https://huggingface.co/Qwen/Qwen3.5-9B

相关新闻

多隐层网络梯度消失与Xavier、He初始化的数理推导

多隐层网络梯度消失与Xavier、He初始化的数理推导

多隐层网络的训练困难,十次里有九次出在梯度在层与层之间传递时出了问题。最近帮一位朋友排查一个四层全连接网络,结构不复杂,数据也正常,但损失就是卡在某个值附近下不去。我当时第一反应不是调学习率,而是让他把每一…

2026/10/12 3:57:23 阅读更多 →
mahjong-helper实战指南:牌效分析、防守判断与记牌技巧详解

mahjong-helper实战指南:牌效分析、防守判断与记牌技巧详解

简介:mahjong-helper是一款面向雀魂、天凤玩家的日本麻将实时辅助工具,核心解决对局中的牌效判断、防守安全度与记牌需求。它能自动分析手牌,综合进张与打点给出推荐舍牌,并在有人立直或多副露时标注各牌危险度,同时记…

2026/10/12 3:57:23 阅读更多 →
从 ABAP CDS 到 Joule,SAP Knowledge Graph 如何把企业数据变成 AI 能理解的业务世界

从 ABAP CDS 到 Joule,SAP Knowledge Graph 如何把企业数据变成 AI 能理解的业务世界

在 SAP 项目里,我们其实早就拥有大量看起来很有语义的数据。 一个 SalesOrder 不只是数据库里的一行记录,它和 BusinessPartner、SalesOrganization、DistributionChannel、Material、Plant、Delivery、BillingDocument、AccountingDocument 都存在明确的业务关系。一个 Pur…

2026/10/12 3:56:23 阅读更多 →

最新新闻

DJL与Spring集成:Java后端部署深度学习模型的实践指南

DJL与Spring集成:Java后端部署深度学习模型的实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 6:01:32 阅读更多 →
Unity实时摄像头画面处理:RenderTexture管线与Shader后处理实战

Unity实时摄像头画面处理:RenderTexture管线与Shader后处理实战

做Unity实时摄像头画面处理这个需求,我猜你大概率是被"实时"这两个字折磨了很久才搜到这里的。这个项目我前前后后折腾过三轮,从最初简单的USB摄像头画面采集,到后来接工业相机和RTSP网络流,再到把画面处理成美颜、风格…

2026/10/12 6:01:32 阅读更多 →
SVM三分类实战:从OvO/OvR策略到RBF核调参与避坑指南

SVM三分类实战:从OvO/OvR策略到RBF核调参与避坑指南

简介:一份基于MATLAB的SVM三分类完整实现,面向机器学习初学者、算法研究者以及需要在不平衡或多类别数据上快速验证分类效果的工程人员。压缩包仅有6个文件,包括5个m脚本与1份iris.data标准鸢尾花数据集;其中训练、分类、核函数、…

2026/10/12 6:01:32 阅读更多 →
嵌入式板级调试第六天:信号验证的坑与套路

嵌入式板级调试第六天:信号验证的坑与套路

如果你正在调一块嵌入式板子,并且到了项目的第六天,你会发现“信号相关功能验证”这几个字的分量很重。前面几天,你可能已经把板子点亮了:串口能打印、LED能闪烁、芯片能启动,一切看起来挺正常。但真正到了信号验证这一…

2026/10/12 6:01:32 阅读更多 →
Gradle 8.3 下载慢、下不动?本地离线安装与 IDEA/Android Studio 集成完整指南

Gradle 8.3 下载慢、下不动?本地离线安装与 IDEA/Android Studio 集成完整指南

简介:Gradle 8.3 完整发行包,面向 Java/Android 开发者与构建系统维护者,解决大型项目构建编译慢、依赖解析内存占用高的问题。本版本支持持久性 Java 编译器守护进程以显著加速 Java 编译,并通过优化减少依赖解析内存消耗&#x…

2026/10/12 6:01:32 阅读更多 →
PLC工程师入行避坑指南:90条实战经验,从电气调试到职业成长

PLC工程师入行避坑指南:90条实战经验,从电气调试到职业成长

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 6:00:31 阅读更多 →

日新闻

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

在数码相机、高清显示屏与现代矢量图形技术高度发达的今天,画面可以做到绝对的锐利、平滑与无瑕。然而,当一张秋日手账插画或拍立得照片过于“平整无瑕”时,往往会散发出一种冰冷生硬的“数码塑料感(Digital Plasticity&#xff0…

2026/10/12 0:00:59 阅读更多 →
活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

在现代网页与移动端设计中,横排(Horizontal Layout)早已经成为了绝对的主流。然而,当我们翻开泛黄的线装古籍、宋版木刻诗集,或是欣赏一张茶道雅集的手写便签时,那种**自上而下纵向书写、自右向左逐列铺展&…

2026/10/12 0:00:59 阅读更多 →
周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

每到周日的晚上八点到十点,很多人心里都会悄悄亮起一盏警示灯。 在心理学上,这种现象有一个专门的称谓——“周日夜晚焦虑症(Sunday Scaries)”。明天又是周一,闹钟又要重新在七点响彻卧房;脑海里仿佛有一个…

2026/10/12 0:00:59 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/12 0:16:30 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/12 0:16:38 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/12 0:16:43 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →