笔记七:大模型微调与高效训练——从 SFT 到 MoE 的完整指南
目录第一部分:监督微调(SFT)与损失计算1.1 SFT 是什么?1.2 SFT 的损失是怎么计算的?(重点)1.3 预训练(CLM)和微调(SFT)的损失计算有什么区别?1.4 SFT 训练的最佳实践第二部分:LoRA 与参数高效微调2.1 为什么需要 LoRA?2.2 LoRA 的核心思想2.3 LoRA 的两个模块加在哪里?2.4 为什么只改 1% 的参数,影响却不小?2.5 为什么推理时要"吸收(合并)"LoRA?2.6 LoRA 的秩(Rank)怎么选?2.7 LoRA 的变种们2.8 QLoRA 和 DoRA 的区别2.9 QLoRA 的显存账单第三部分:混合专家模型(MoE)3.1 为什么需要 MoE?3.2 MoE 的架构拆解3.3 速度悖论3.4 负载均衡3.5 训练的核心谜团:TopK 不可导,路由器怎么学?3.6 著名的 MoE 模型3.7 总结:MoE 的优缺点摘要:本文系统梳理了大模型训练中的三大核心主题:监督微调(SFT)的损失计算原理与最佳实践、参数高效微调方法 LoRA 及其变种的核心思想与选型指南,以及混合专家模型(MoE)的架构设计、训练谜团与工业界方案。文章以通俗易懂的比喻和手算示例,帮助读者从原理到实战全面理解这些关键技术。第一部分:监督微调(SFT)与损失计算1.1 SFT 是什么?SFT(Supervised Fine-Tuning,监督微调),就是把一个已经会“文字接龙”的预训练大模型,调教成一个能听懂人话、按指令办事的智能助手。预训练模型:像个看过海量书籍的“书呆子”,只会根据上文猜下文(比如看到“今天天气真”,会接“好”)。SFT 之后:变成了能回答问题的“助理”。你问它“今天天气怎么样?”,它能回答“今天天气晴朗,适合出游”。这个过程需要给它看大量的“问题-标准答案”对,让它学习如何给出高质量的回答。1.2 SFT 的损失是怎么计算的?(重点)这是很多人的困惑:模型是一字一字地预测,那损失也是一字一字算的吗?答案是:是的,数学上是“一字一字”算的,但显卡是“一眼”全看完一起算的(矩阵并行计算)。它的核心机制叫做“教师强制(Teacher Forcing)”。1.2.1 什么是“教师强制”?在训练时,我们把“问题”和“答案”拼成一条完整的序列送进模型。模型会并行地预测每一个位置的下一个字。但关键点在于:模型预测时看到的“上文”,永远是正确的原文,而不是自己猜错的结果。举个具体例子,我们要训练模型回答“我爱你”:训练数据:输入是 [我, 爱, 你]。模型内部计算:看到 [我],预测下一个字是爱。看到 [我, 爱],预测下一个字是你。注意:在预测你的时候,模型看到的输入是 [我, 爱],其中“爱”是数据里给的正确答案,而不是模型自己在第一步预测出来的结果(哪怕它第一步预测错了,算第二步时依然用正确的“爱”)。打个比方:这就像老师给你做完形填空,句子是“我( )你”。训练时(Teacher Forcing):老师直接把正确答案“爱”写在括号里,让你看着“我爱”去填后面的“你”。就算你第一空填了“恨”,老师也会用板擦把“恨”擦掉,强行把“爱”写回去,再让你填第二空。推理时(生成答案):没有老师管你了,你第一空填了“恨”,第二空就只能基于“我恨”去填,所以会生成“我恨你”。1.2.2 那损失到底怎么算?我们用上一步的例子来手算一遍。第一步:看位置 1(预测“爱”)模型根据输入的[我],预测下一个词。模型输出的原始分数(Logits)经过 Softmax 变成概率:概率(我)=0.4,概率(爱)=0.5,概率(你)=0.05,概率(EOS)=0.05计算这个位置的损失(负对数似然):Loss₁ = -log(概率_爱) = -log(0.5) ≈ 0.693第二步:看位置 2(预测“你”)模型根据输入[我, 爱],预测下一个词。输出的概率:概率(我)=0.1,概率(爱)=0.2,概率(你)=0.6,概率(EOS)=0.1计算这个位置的损失:Loss₂ = -log(概率_你) = -log(0.6) ≈ 0.511第三步:算出最终的 Loss因为答案长度是 2,所以总损失 = (Loss₁ + Loss₂) / 2 = (0.693 + 0.511) / 2 = 0.602这个 0.602,就是最终传回给模型、用来更新参数的那一个数字(标量)。1.2.3 提示词(Prompt)有损失吗?绝对没有!在 SFT 中,我们只计算“答案部分”的损失,提示词部分的标签会被设为 -100。PyTorch 的 CrossEntropyLoss 函数看到 -100 就会自动跳过,不计算损失,也不传回梯度。打个比方:这就像老师改卷子,只改学生在答题卡上写的答案(Response),至于试卷上的题目(Prompt)本身写了什么,看都不看,更不会扣分,因为题目是本来就印在上面的!1.3 预训练(CLM)和微调(SFT)的损失计算有什么区别?对比维度预训练 (CLM)微调 (SFT)数据长什么样连续的一段话:[A, B, C, D]拼凑的两段话:[问题, 答案]标签(Label)设置[B, C, D, EOS](全是正常ID,没有-100)[-100, -100, 答案, 答案](问题部分挖掉,答案部分保留)哪些位置算损失每个位置(除了开头的第一个字)只有“答案”部分的位置学习目标学会预测任何一个下文单词(学语法、常识)只学会预测针对特定问题的回答(学指令跟随)一句话总结:CLM 算所有位置,是因为全是正文;SFT 只算答案,是因为人为把前半段标记成了只读的“上下文”。1.4 SFT 训练的最佳实践1.4.1 数据质量:LIMA 原则重质不重量:论文证明,1000 条极其精良的问答数据,训练效果能超过 5 万多条的粗糙数据。好数据必须满足:多样性:涵盖问答、摘要、代码、数学、创意写作、多轮对话等。正确性:每个回答必须事实准确、格式规范。长度平衡

相关新闻

电子电路分压器设计原理与应用指南

电子电路分压器设计原理与应用指南

1. 电源分压器的基本概念与工作原理 分压器是电子电路中最基础也最重要的组成部分之一,它的核心功能是将输入电压按特定比例降低到所需的输出电压。这个看似简单的功能背后,却蕴含着丰富的电子学原理和实际应用技巧。 在直流电源系统中,分压…

2026/7/26 22:29:51 阅读更多 →
源码交付!混合存储+对象化组织+流批一体+数据治理:煤机制造工业数据中台

源码交付!混合存储+对象化组织+流批一体+数据治理:煤机制造工业数据中台

在煤机制造这个行业:厂里的设备越来越先进,系统越上越多,但数据却越来越“散”。MES管生产、ERP管财务、PLM管研发、SCADA管设备——每个系统都在兢兢业业地记录着自己的那一亩三分地。可当你想把设备的实时运行数据和当天的生产工单关联起来…

2026/7/28 6:48:17 阅读更多 →
单片机数字滤波算法详解与工程实践

单片机数字滤波算法详解与工程实践

1. 单片机滤波算法概述 在嵌入式系统开发中,传感器数据采集是基础但至关重要的环节。我从业十余年,见过太多因为数据抖动导致系统误动作的案例——从工业生产线上的误停机到医疗设备的误报警。滤波算法就是解决这类问题的"数字稳定器"。 滤波…

2026/7/28 17:40:28 阅读更多 →

最新新闻

【后端实战】超详细用户在线状态系统设计(心跳机制+Redis+分布式+多端登录+避坑指南)

【后端实战】超详细用户在线状态系统设计(心跳机制+Redis+分布式+多端登录+避坑指南)

文章简介:用户在线状态是IM聊天、社交软件、协同办公、客服系统的核心基础功能。90%的新手都会踩坑:闪退、断网、杀进程导致状态卡死在线。本文从需求分析、状态定义、技术方案演进、核心心跳原理、Redis存储设计、多端登录、分布式适配、推送策略、生产…

2026/7/28 23:19:53 阅读更多 →
贡献指南:如何参与 go-nebulas 开源项目并成为核心开发者

贡献指南:如何参与 go-nebulas 开源项目并成为核心开发者

贡献指南:如何参与 go-nebulas 开源项目并成为核心开发者 【免费下载链接】go-nebulas Official Go implementation of the Nebulas protocol. 项目地址: https://gitcode.com/gh_mirrors/go/go-nebulas go-nebulas 是Nebulas协议的官方Go实现,当…

2026/7/28 23:19:53 阅读更多 →
C++ vector内存陷阱:浅拷贝与迭代器失效的深度解析与实战解决方案

C++ vector内存陷阱:浅拷贝与迭代器失效的深度解析与实战解决方案

1. 项目概述:从一次内存泄漏事故说起那天下午,线上服务突然告警,内存使用率在几分钟内飙升到90%以上,服务响应变得极其缓慢。经过紧急排查和内存Dump分析,罪魁祸首锁定在一段处理批量数据的C代码上。代码里大量使用了s…

2026/7/28 23:19:53 阅读更多 →
私域数字化避坑指南:从SaaS模板到自研源码系统,慧米云落地实战解析

私域数字化避坑指南:从SaaS模板到自研源码系统,慧米云落地实战解析

一、引言:私域数字化落地,为何多数企业做不长久?当下私域运营已经贯穿零售电商、实体门店、生产制造、本地服务等全行业,几乎所有企业都意识到了自主私域流量的重要性,纷纷搭建专属小程序、商城系统、分销平台。但从实…

2026/7/28 23:19:53 阅读更多 →
中文意图识别模型微调:BGE-M3与SetFit实践

中文意图识别模型微调:BGE-M3与SetFit实践

1. 项目概述:中文意图识别模型的微调实践在自然语言处理领域,意图识别是对话系统和智能助手的核心技术之一。最近我完成了一个基于Embedding模型微调的中文意图识别项目,能够准确区分18种常见用户意图。与传统的分类模型不同,这个…

2026/7/28 23:19:53 阅读更多 →
风光储微电网下垂控制与并离网切换技术详解

风光储微电网下垂控制与并离网切换技术详解

1. 项目概述:风光储微电网的协调控制挑战风光储微电网作为分布式能源系统的典型代表,正逐步从实验室走向规模化应用。我在参与某海岛微电网项目时深刻体会到,如何实现光伏、风机、储能单元之间的功率平衡,特别是在并网/离网模式切…

2026/7/28 23:18:51 阅读更多 →

日新闻

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生 【免费下载链接】OmenSuperHub Control Omen laptop performance, fan speeds, and keyboard lighting, and unlock power limits. 项目地址: https://gitcode.com/gh_mirrors/om/OmenSuperHub 你是否也曾为官方Om…

2026/7/28 0:00:43 阅读更多 →
RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

做 RAG 的人应该都踩过这个致命的坑:把几百页的财报、法规、技术手册扔给向量库,问一个具体问题,搜出来的全是沾边但没用的内容 —— 关键信息要么被硬切块拆碎了,要么藏在几十条结果的最下面。语义相似≠真正相关,这个…

2026/7/28 0:00:43 阅读更多 →
抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

2026年做短视频运营,从抖音上扒文案早就不是偷偷抄笔记的事了。我刚开始做内容的时候,每天刷半小时抖音,手动把爆款视频的口播敲进备忘录,一条2分钟的视频得花十来分钟,碰到语速快的还要反复回听。后来试了一圈工具&am…

2026/7/28 0:00:43 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻