预训练+微调的训练范式
语言模型训练范式一、常见的训练阶段划分LLM都是怎么训练出来的以GPT为例1.pretrain2.SFT3.reward model4.PPOPretrainpretrain预训练内里包含大量的数学公式。不停的阅读大量资料然后学习如何使用文字。需要最大的数据量消耗最大的显卡算力。m百万b十亿t万亿eg. llama 3 使用了15t tokensllama 4 Scout使用了40t tokens大语言模型输出的每一话都需要学习人类语言后逐字表达计算下一个字在人类语言规范中的可能性然后结合训练和语境给出他的答案。本质上是一个续写的工具最初什么都不会怎么学呢这个时候逐字表达等于瞎蒙给他参考数据。段落联合概率让一个模型能一字不落的生成整个段落的概率。将所有的段落联合概率相乘已知第一个字求第二个字相匹配的概率、已知前两个字求第三个字相匹配的概率、已知前三个字求第四个字相匹配的概率.......依次相乘让模型学习人类的表达方式。对每一条数据得出的段落联合概率可以看出模型对人类语言和知识的掌握程度。不同的段落联合概率按照不同的要求调整LLM从而整体提升段落联合概率让他们达到一个可观的值 。SFT预训练模型说话像接话茬而不是在做任务希望做什么类型的任务就用什么样的数据做指令微调instruction tuning。SFT有监督的微调训练有监督使用有标签的数据进行训练学习过程叫做有监督学习。标签包括对文字的正负向判断、相似程度判断、排序等。使用无标签的数据进行训练学习过程叫做无监督学习。pretrain叫自监督自己进行训练pretrainSFT两个阶段组合起来就叫半监督不缺数据但缺标签、需要人工标注llama 3使用了15t tokensSFT阶段使用的数据量大概只有几十万条为预训练阶段的五千分之一数据量普遍不大。Reward Modelreward model训练一个奖励模型在旁边当教练。评估是一个很难的事情评估一个模型的整体能力评估一个问题回答的如何。如何判断大模型干的好不好需要我们事先训练一个教练进行打分。1、准备一系列prompt让模型给每个prompt生成多个response(几万到几十万2、设计一下如何标注打分、评级、排序3、招一批人来做标注工作训练出一个教练员。PPO强化学习PPO用上一步的教练模型对工作进行优化当优化趋于饱和之后再重新训练一个教练重复这两个步骤直到都难以取得进展。reward model和PPO不断循环的过程就是强化学习的过程叫做RLHF“对齐”给予人类反馈的强化学习。纯粹课程笔记。

相关新闻

【课程设计/毕业设计】数字化宠物生活服务管理平台 基于 Django 的宠物临时寄养互助共享服务系统【附源码、数据库、万字文档】

【课程设计/毕业设计】数字化宠物生活服务管理平台 基于 Django 的宠物临时寄养互助共享服务系统【附源码、数据库、万字文档】

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/23 21:56:08 阅读更多 →
集采政策下医用耗材怎么选?

集采政策下医用耗材怎么选?

随着国家和地方联盟持续推进医用耗材集中带量采购,医院采购逻辑正在发生深刻转变。对于临床科室和采购部门而言,过去单纯比价格、认品牌的习惯已经行不通了,合规资质、供应韧性以及产品在复杂术式中的表现,构成了新的评价三角。在…

2026/7/23 21:56:08 阅读更多 →
第 20 篇:EdgeRuntimeSDK 内部架构——多客户端、连接流程与回调分发

第 20 篇:EdgeRuntimeSDK 内部架构——多客户端、连接流程与回调分发

前面的文章讲的都是平台本身怎么设计。但业务开发者不关心这些——他们只想知道"我怎么把自己的代码跑在边缘平台上"。EdgeRuntimeSDK 就是给他们用的工具箱。本文拆解 SDK 的分层架构、六种 Client 的能力矩阵、连接流程、令牌刷新和回调分发机制——读完你会理解&q…

2026/7/23 21:56:08 阅读更多 →

最新新闻

C/C++每日一练5

C/C++每日一练5

1.游游的 you题意游游有 a 个 y,b 个 o,c 个 u。连续三个字符 you → 获得 2 分(每组消耗 1y、1o、1u)连续两个字符 oo → 获得 1 分注意:ooo 有两处相邻 oo,得 2 分;oooo 得 3 分。也就是一段连…

2026/7/23 22:04:10 阅读更多 →
【头部电商AI客服降本增效白皮书】:6个月砍掉62%人工坐席,却将CSAT提升11.3%的底层逻辑

【头部电商AI客服降本增效白皮书】:6个月砍掉62%人工坐席,却将CSAT提升11.3%的底层逻辑

更多请点击: https://kaifayun.com 第一章:AI自动化客服流程的演进与战略定位 AI自动化客服已从早期基于规则的简单问答系统,演进为融合大语言模型、多模态理解与实时决策能力的智能服务中枢。这一演进并非技术叠加,而是客户服务…

2026/7/23 22:04:10 阅读更多 →
美化Xfce登陆界面

美化Xfce登陆界面

1.安装必要组件sudo apt update sudo apt install lightdm-webkit2-greeter lightdm-gtk-greeter-settings2. 打开设置工具-LightDM GTK Greeter 设置在界面中可以进行设置3.使用WhiteSur主题# 可以无法找到主题、图片,需要再安装,会安装到/usr/share下 …

2026/7/23 22:04:10 阅读更多 →
AI Agent 开发实战(二):调用 LLM 不只是发个 HTTP 请求,Prompt 工程才是真功夫

AI Agent 开发实战(二):调用 LLM 不只是发个 HTTP 请求,Prompt 工程才是真功夫

AI Agent 开发实战(二):调用 LLM 不只是发个 HTTP 请求,Prompt 工程才是真功夫这是「AI Agent 开发实战」系列的第 2 篇。上一篇讲了 Agent 的核心概念和架构,这一篇开始拆"三大基石"中最底层的一个——LLM …

2026/7/23 22:04:10 阅读更多 →
建冷库这件事,让我重新理解了一站式服务的价值 当冷库不再只是“冷”,而是利润的守护者

建冷库这件事,让我重新理解了一站式服务的价值 当冷库不再只是“冷”,而是利润的守护者

在食品加工、生鲜零售甚至医药仓储领域,冷库早已不是简单的“冰柜放大版”。它关乎食材损耗、运营成本,甚至企业生死。然而,许多用户仍困于设备高耗能、安装无保障、售后响应慢的泥潭。博尔制冷凭借自研生产、工程安装、维保售后于一体的一站…

2026/7/23 22:04:10 阅读更多 →
八大排序代码

八大排序代码

冒泡排序交换排序希尔排序堆排序基数排序归并排序快速排序

2026/7/23 22:03:10 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻