大模型微调完整分类
一、按训练目标 / 训练阶段日常说的 SFT、偏好、强化微调1. 普通微调SFT 监督指令微调就是你说的「普通微调」最基础一环全称Supervised Fine-Tuning 监督微调数据标准问答、对话、领域标准答案单条正样本作用教会模型听懂指令、固定输出格式、学习行业知识法律 / 医疗 / 代码例子给模型几千条客服问答让它学会标准回复2. 继续预训练微调 CPT领域知识扩充微调很多人容易忽略属于前置知识微调数据无标注领域长文本行业文档、书籍、论文作用给底座模型灌入全新专业知识先扩充知识库再做 SFT场景垂直行业专用大模型如医疗、金融专属底座3. 偏好微调离线偏好对齐DPO/ORPO/KTO你说的「偏好微调」不带强化学习现在工业主流替代 RLHFDPO 直接偏好优化最常用 用「同一个问题好回答 vs 差回答」成对偏好数据纯监督损失不用奖励模型、不用 PPO 强化。ORPO 对比偏好优化 一步融合 SFT 偏好对齐省去单独 SFT 阶段轻量化训练。KTO 知识偏好优化 侧重区分有用 / 无用回答适合客服、知识库场景。4. 强化微调RLHF 人类反馈强化学习PPO你说的「强化微调」唯一带奖惩函数 强化训练的对齐方案 完整三步SFT 基础微调 → 2. 训练奖励模型打分 / 奖惩函数 → 3. PPO 强化学习迭代优化特点依靠奖惩函数引导模型生成人类更喜欢的回答对齐价值观、安全、人性化缺点算力大、训练不稳定。 衍生强化对齐GRPO推理专用强化微调数学 / 代码提升巨大5. 对比微调 CPT Contrastive Prompt Tuning小众辅助微调区分正负样例提升意图识别、上下文区分能力。二、按参数更新方式PEFT 参数高效微调所有上面的微调都能搭配不是训练目标但日常开发都会区分「全量微调 / LoRA 微调」全参数微调 Full FT 更新模型全部权重效果最好显存成本极高仅 7B 以下小模型偶尔使用。LoRA 低秩适配器微调主流 冻结主模型只训练少量低秩矩阵显存消耗极低单卡可训 70B。QLoRA 量化 LoRA 4bit 量化底座极致省显存低配显卡微调超大模型。Adapter / P-Tuning v2 前缀微调 插入额外小网络 / 可学习 prompt适合分类、小样本任务。最简流水线顺序通用大模型训练流程底座预训练 → CPT 领域预训练可选→SFT 普通微调→DPO 偏好微调/RLHF 强化微调一句话区分你提到的三类普通 SFT教模型「标准答案怎么说」偏好 DPO教模型「哪个回答更好」纯监督无强化强化 RLHF用奖惩函数 PPO 反复试错强制模型往高分回答靠拢带强化训练RLHF为例1. 环境准备首先确保安装了必要的库bashpip install trl peft transformers datasets2. 完整的修正版代码pythonimport re from datasets import Dataset from transformers import AutoTokenizer, AutoModelForCausalLM from peft import LoraConfig from trl import GRPOConfig, GRPOTrainer # 1. 准备数据集 # 模拟一个包含 prompt 和 ground_truth 的数据集 data [ {prompt: 11等于几, ground_truth: 2}, {prompt: 中国的首都是哪里, ground_truth: 北京}, ] dataset Dataset.from_list(data) # 2. 编写正确的奖惩逻辑 # 注意trl 的 reward_funcs 接收的参数是 (completions, **kwargs) # kwargs 中会自动包含数据集里的其他字段如 ground_truth # 返回值必须是一个包含浮点数的列表长度等于 completions 的数量 # 奖惩逻辑1格式奖励强制模型使用 answer 标签 def format_reward(completions, **kwargs): pattern ranswer(.*?)/answer rewards [] for completion in completions: # 检查模型输出是否包含正确的标签 match re.search(pattern, completion[0][content]) if match: rewards.append(0.5) # 格式正确给 0.5 分好的 else: rewards.append(0.0) # 格式错误给 0 分坏的 return rewards # 奖惩逻辑2准确率奖励检查答案是否与标准答案一致 def accuracy_reward(completions, ground_truth, **kwargs): rewards [] for completion, gt in zip(completions, ground_truth): content completion[0][content] match re.search(ranswer(.*?)/answer, content) if match and match.group(1).strip() str(gt).strip(): rewards.append(1.0) # 答案正确给 1 分极好 else: rewards.append(0.0) # 答案错误给 0 分坏 return rewards # 3. 配置并启动微调 # 这里使用一个小模型作为示例实际可替换为 Qwen 等模型 model_id Qwen/Qwen2.5-0.5B-Instruct # 配置 GRPO 训练参数 training_args GRPOConfig( output_dir./qwen-grpo-output, num_train_epochs3, per_device_train_batch_size2, logging_steps5, learning_rate5e-5, ) # 配置 LoRA 进行高效微调 peft_config LoraConfig( task_typeCAUSAL_LM, r8, lora_alpha16, lora_dropout0.05, ) # 初始化 GRPO 训练器 trainer GRPOTrainer( modelmodel_id, argstraining_args, train_datasetdataset, reward_funcs[format_reward, accuracy_reward], # 【核心】注入奖惩逻辑 peft_configpeft_config, ) # 开始训练模型会根据奖惩函数的反馈不断调整权重 if __name__ __main__: trainer.train() 核心修正点说明奖励函数签名trl的奖励函数必须接收completions作为第一个参数数据集里的其他字段如ground_truth会通过**kwargs自动传入。返回值格式奖励函数必须返回一个列表列表的长度必须与传入的completions长度严格一致。数据结构completions是一个嵌套列表每个元素是[{content: 模型生成的文本}]所以提取文本时需要用completion[0][content]。

相关新闻

AI日报:自动化采集与专业筛选的技术实践

AI日报:自动化采集与专业筛选的技术实践

1. 项目概述2026年6月30日AI日报是一个聚焦人工智能领域最新动态的资讯项目。作为长期跟踪AI技术发展的从业者,我每天都会整理行业内的突破性进展、重要论文发布、企业动态和开源项目更新。这个日报不同于普通的新闻聚合,而是经过专业筛选和深度解读的技…

2026/10/11 20:41:17 阅读更多 →
n8n运维实战:日志管理、监控与安全配置

n8n运维实战:日志管理、监控与安全配置

1. 为什么n8n实例需要完整的运维体系 当你在生产环境运行n8n工作流引擎时,会发现这个看似简单的工具背后隐藏着复杂的运维需求。我部署的第一个n8n实例就曾因为日志堆积导致磁盘爆满,整个服务突然崩溃。那次事故让我意识到:n8n作为自动化枢纽…

2026/10/11 20:41:17 阅读更多 →
SkillCorpus:大语言模型智能体的技能生态系统与标准化实践

SkillCorpus:大语言模型智能体的技能生态系统与标准化实践

今天来看一个专门为大语言模型智能体设计的技能生态系统项目——SkillCorpus。这个项目由研究团队开源,旨在解决当前LLM智能体在真实世界任务中技能管理和检索的痛点。SkillCorpus的核心价值在于它提供了一个统一的技能语料库,能够帮助智能体更好地理解和…

2026/10/10 15:12:58 阅读更多 →

最新新闻

OpenClaw 2026.3.1 Ubuntu 部署指南:Teams 与 Obsidian 接入及锁报错排查

OpenClaw 2026.3.1 Ubuntu 部署指南:Teams 与 Obsidian 接入及锁报错排查

如果你最近刷 GitHub 趋势榜单、逛 AI 技术社区,大概率已经瞄到过 OpenClaw 这个名字。作为一个从早期版本一路折腾到 2026.3.1 的老用户,我可以直接说:这个版本是现阶段最值得入坑的一个,但前提是你得把部署和接入的坑提前摸清。…

2026/10/11 20:41:28 阅读更多 →
Python中文文本关键词抽取:TF-IDF、TextRank与Word2Vec三种方法实战

Python中文文本关键词抽取:TF-IDF、TextRank与Word2Vec三种方法实战

简介:这份资源面向Python初学者、NLP入门者及需要完成课程设计的学生,系统讲解中文文本关键词抽取的三种经典方法:TF-IDF、TextRank与Word2Vec词向量聚类。内容从原理、流程到代码实现逐层展开,并附课程论文、项目源码及运行截图&…

2026/10/11 20:41:28 阅读更多 →
OpenClaw浏览器自动化实战:四种方式从脚本到AI代理

OpenClaw浏览器自动化实战:四种方式从脚本到AI代理

说实话,我第一次接触OpenClaw就是被浏览器自动化这个点吸引的。之前我的“自动化”基本靠写死脚本:需求一变,改选择器、改等待时间、改输出格式,代码维护成本比手动操作还高。后来把OpenClaw部署到一台Ubuntu小主机上,…

2026/10/11 20:41:27 阅读更多 →
Scala函数基础全解析:从一等公民到高阶函数与闭包实战

Scala函数基础全解析:从一等公民到高阶函数与闭包实战

1. 为什么Scala的函数基础值得专门写一篇先问个问题:你写过Java,也写过Python,现在打算认真学Scala,那我猜你大概率有个直觉——"函数嘛,不就是def加个括号加个花括号?这有什么好学的"。说实话&a…

2026/10/11 20:41:27 阅读更多 →
Hotdata CLI 地理空间查询完全指南:PostGIS风格SQL玩转WKB几何数据

Hotdata CLI 地理空间查询完全指南:PostGIS风格SQL玩转WKB几何数据

【免费下载链接】hotdata-cli CLI for Hotdata 项目地址: https://gitcode.com/gh_mirrors/ho/hotdata-cli 点击查看 免费下载 想在命令行里做 GIS 分析,却不想自己搭一套 PostGIS 环境?🗺️ Hotdata CLI 让你在熟悉的 SQL 里直接…

2026/10/11 20:41:27 阅读更多 →
HyperQwen 上下文复述加速:lookup 草稿如何把 25k 文档复读推到 381 tok/s

HyperQwen 上下文复述加速:lookup 草稿如何把 25k 文档复读推到 381 tok/s

HyperQwen 上下文复述加速:lookup 草稿如何把 25k 文档复读推到 381 tok/s 【免费下载链接】HyperQwen Serve large Qwen models fast on the GPUs you actually own. Qwen3.8-27B on a single 24 GB card with vLLM: 127 tok/s single-user (381 when the answer q…

2026/10/11 20:40:27 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →