system-design-101 详解:ChatGPT 是如何工作的——从预训练、微调到内容审核的完整链路
后端文档教程【免费下载链接】system-design-101Explain complex systems using visuals and simple terms. Help you prepare for system design interviews.项目地址https://gitcode.com/GitHub_Trending/sy/system-design-101点击查看免费下载本指南基于 system-design-101 仓库的 ChatGPT 工作原理 一文展开用可视化与简单术语拆解 ChatGPT 的完整运行机制。读完本文你将掌握 ChatGPT 从「互联网语料预训练」到「人类反馈微调」再到「线上问答全流程」的两阶段训练管线与七步推理链路并能从系统设计的角度理解内容审核、模板响应等安全组件为何必不可少。说明OpenAI 并未公开全部实现细节仓库原文也指出「diagram 中部分细节可能不完全准确」。因此本文基于仓库文档描述的原理框架进行展开涉及具体数字与内部实现的部分均以「推测 / 业界通用做法」表述而非未经证实的事实。总览ChatGPT 的工作可以拆成两大部分正如 原文档 所述ChatGPT 的完整工作流程可以拆分为两个部分训练Training把一个大语言模型从「会补全句子」训练成「会回答问题」的对话助手推理Answer a Prompt用户输入问题后模型结合内容审核组件安全地生成回答。这两个部分分别对应了机器学习的「模型构建期」与「服务运行期」也是系统设计面试中常被考察的 AI 应用分层。下文先讲训练再讲推理。第一部分训练——两个阶段把补全器变成问答助手训练 ChatGPT 模型需要经历两个阶段预训练Pre-training与微调Fine-tuning。阶段一预训练——在互联网语料上学会「续写」在预训练阶段我们训练一个GPT 模型decoder-only transformer仅解码器 Transformer输入是海量的互联网文本数据。训练目标是让模型学会给定一个句子预测接下来最可能出现的词并且预测结果在语法正确性和语义合理性上都接近互联网数据本身的分布。模型架构decoder-only transformer。Transformer 架构源自 2017 年论文《Attention Is All You Need》通过自注意力机制与并行化大幅缩短训练时间是生成式 AI 的基础这一点在仓库的 ChatGPT 时间线 中也有对应描述。训练目标自回归式的「下一个词预测next-token prediction」。模型每次只看到前文预测下一个 token再与真实的下一个 token 计算交叉熵损失并反向传播更新参数。阶段产物经过预训练后模型已经具备很强的续写能力——给定任意半句话它能补出语法通顺、语义合理的后续内容。但它还不能回答问题你问它一个问题它只会顺着问题「接着写」而不是给你一个答案。这是预训练与微调之间最关键的能力鸿沟预训练解决「懂语言」微调解决「懂对话」。阶段二微调——三步把模型变成问答助手微调阶段是一个 3 步流程对应 OpenAI 在 InstructGPT 论文中提出的 InstructGPT 路线把预训练模型改造成能回答问题的 ChatGPT 模型第 1 步收集「问题-答案」数据做监督微调SFT收集大量问题答案训练数据用这些数据对预训练模型做监督式微调。模型以问题为输入学习生成与训练数据中答案相似的回答。这一步的本质是模仿学习让模型学会「面对提问时应该输出答案而不是继续追问」。第 2 步训练奖励模型Reward Model来给回答打分收集更多数据对同一个问题收集多个候选答案并由人工或规则将这些答案从最相关到最不相关排序。用这些排序数据训练一个奖励模型reward model让它学会预测「哪个回答更好」。奖励模型不是生成器而是一个打分器——它给任意「问题 回答」组合输出一个标量分数分数越高表示回答质量越高。第 3 步用强化学习PPO优化模型回答的准确性使用强化学习具体算法为PPOProximal Policy Optimization近端策略优化继续微调模型。流程是让策略模型针对某个问题生成回答 → 奖励模型对这个回答打分 → 用 PPO 更新策略模型参数使模型学会生成更容易获得高分的回答。反复迭代后模型的回答在相关性、准确性、符合人类偏好等方面持续提升。这 3 步组合起来就是业界常说的RLHFReinforcement Learning from Human Feedback基于人类反馈的强化学习的标准配方SFT 对齐对话形式奖励模型对齐人类偏好PPO 把偏好固化成策略。训练阶段的仓库佐证这一路线在开源生态中的位置仓库中 DeepSeek 一页纸 对这条技术路线的变体做了很好的注脚多数 AI 模型采用监督微调模仿大量人工标注示例但这种方式有局限DeepSeek R1 改用 GRPOGroup Relative Policy Optimization这类强化学习技术通过在同一上下文内比较多个候选答案来提升推理效率。这说明「预训练 → 微调 → 强化学习」是当前大模型训练的主流范式而具体算法仍在快速演进。如果你想搭建自己的对话模型仓库的 开源 AI 技术栈 一文列出了从模型访问Ollama、HuggingFace、后端框架FastAPI、Langchain到向量检索Milvus、FAISS、PGVector的完整开源工具链可以直接对照这条训练管线落地。第二部分推理——用户提问后的完整链路训练完成后模型进入线上服务。仓库原文把「回答一个 prompt」拆成了 7 个步骤核心特征是内容审核组件贯穿输入与输出两侧完整 7 步流程Step 1用户输入完整问题用户输入完整问题例如「Explain how a classification algorithm works」解释分类算法是如何工作的。这个例子特意选了一个「问法完整、语义清晰」的问题便于模型理解意图。Step 2问题先经过内容审核组件问题首先被发送到内容审核content moderation组件。该组件确保输入问题不违反安全准则并过滤掉不当问题如违法、暴力、仇恨言论、隐私侵犯等。Step 3-4按审核结果分流如果输入通过了内容审核问题被发送到ChatGPT 模型进入正常的模型推理如果输入未通过内容审核则直接进入模板响应生成template response generation即返回一条预设的安全模板回答例如「抱歉我无法回答这个问题」不再调用模型。Step 5-6模型输出再次经过内容审核模型生成回答后输出再次被发送到内容审核组件。这一次审核确保生成的回答是安全safe、无害harmless、无偏见unbiased的——即使问题本身合规模型也可能生成越界内容所以输出侧审核不可省略。Step 7按审核结果返回用户如果模型输出通过了内容审核回答被展示给用户如果未通过则走模板响应生成向用户展示一条预设的模板回答。双向审核的工程意义从系统设计角度看这个 7 步流程最值得注意的点是审核发生在两个方向输入审核Input Moderation成本低、拦截早。把明显违规的请求挡在模型推理之前既保护用户又节省 GPU 推理算力。输出审核Output Moderation防御「越狱 / 对抗性提示」导致的模型输出失控。因为恶意输入可能伪装成合规请求只有对输出再做一次独立检查才能保证最终呈现给用户的内容安全。推理阶段的仓库佐证从「生成」到「使用」的完整 AI 应用形态仓库的 什么是 AI Agent 一文展示了这条推理链路如何被进一步封装AI Agent 是能够感知环境、自主决策并调用工具访问互联网、代码解释器、API 调用完成目标的软件程序其信息处理与决策功能正是由一个 LLM 承担。也就是说「输入审核 → 模型生成 → 输出审核」这条 ChatGPT 推理链路是所有基于 LLM 的应用包括 AI Agent、RAG 问答系统的公共底座。常见误区与面试要点「ChatGPT 是搜索引擎」是误解它的推理链路里没有检索数据库答案完全由模型按概率生成。内容审核组件负责安全但不会「查资料」。预训练模型 ≠ 对话模型仅预训练的模型只会续写不会问答——这是区分「GPT 基础模型」与「ChatGPT 对话模型」的关键分界。微调不止一步SFT 奖励模型 PPO 三者缺一不可奖励模型解决「怎么算好」PPO 解决「怎么做到好」。审核是双向的只审核输入不审核输出无法防御模型自身的失控生成只审核输出不审核输入则浪费推理算力。算法仍在演进PPO 并非唯一选择仓库的 DeepSeek 一页纸 提到的 GRPO 等新方法正在改变微调阶段的成本与效果。相关阅读ChatGPT 时间线从 1950 年代规则模型、CNN/RNN/GAN 到 2017 年 Transformer 的演进脉络理解 ChatGPT 为何「突然」出现开源 AI 技术栈构建对话类 AI 应用的完整开源工具链选型什么是 AI AgentLLM 推理链路如何被封装为可自主行动的 AgentDeepSeek 一页纸监督微调局限性与 GRPO 强化学习新路线的对比。赞分享后端文档教程【免费下载链接】system-design-101Explain complex systems using visuals and simple terms. Help you prepare for system design interviews.项目地址https://gitcode.com/GitHub_Trending/sy/system-design-101点击查看免费下载相关推荐lllyasviel/Annotators模型训练从预训练到微调的完整指南lllyasviel/Annotators模型训练从预训练到微调的完整指南 引言为什么需要专业的模型训练指南 在计算机视觉和深度学习领域模型训练是一个复人工智能计算机视觉深度学习ERNIEKit工具链从预训练到微调的全流程开发ERNIEKit工具链从预训练到微调的全流程开发 ERNIEKit是百度基于PaddlePaddle框架开发的专业大模型训练工具链专门为ERNIE系列大模型大模型深度学习一条命令跑通CyberPII-BenchPII脱敏评估上手手册一条命令跑通CyberPII BenchPII脱敏评估上手手册 场景切入 如果你的 AI 智能体把客户邮箱、内网 IP 原样写进了给客户的渗透测试报告问题就人工智能AI Agent网络安全渗透测试工具调用AI 评测上一篇命令行AI工具LLM终极安装指南4种方法5分钟快速上手下一篇FlexGet高级技巧如何编写自定义插件扩展功能创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Claude-OSINT自动驾驶实战:一条命令跑完5阶段侦察并自动生成9页Excel交付物

Claude-OSINT自动驾驶实战:一条命令跑完5阶段侦察并自动生成9页Excel交付物

Claude-OSINT自动驾驶实战:一条命令跑完5阶段侦察并自动生成9页Excel交付物 【免费下载链接】Claude-OSINT 8 Claude skills 100 recon capabilities 80 secret-regex patterns 80 dorks 9 read-only credential validators 27 attack-path templates ~10,000…

2026/10/4 2:36:03 阅读更多 →
EMC预测试:从电流路径建模到Layout级EMI扼杀

EMC预测试:从电流路径建模到Layout级EMI扼杀

1. 为什么“预测试”不是加个探头测一测那么简单?EMC预测试这个词,现在被很多工程师挂在嘴边,但真正把它当成本职工作来做的团队,不到三成。我见过太多项目——原理图刚定稿,PCB还在画,大家就忙着讨论“等板…

2026/10/3 17:52:17 阅读更多 →
抖音视频无水印批量保存:3 步从单条到整主页的完整方案

抖音视频无水印批量保存:3 步从单条到整主页的完整方案

抖音视频无水印批量保存:3 步从单条到整主页的完整方案 【免费下载链接】douyin-downloader A practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallback supp…

2026/10/3 17:52:20 阅读更多 →

最新新闻

嵌入式多态实战:5种零开销C/C++实现方案

嵌入式多态实战:5种零开销C/C++实现方案

1. 项目概述:为什么嵌入式里谈多态,不是“炫技”而是“刚需”在嵌入式软件设计中,“多态”这个词常被初学者误读为C高级特性的花架子——毕竟我们写的代码要跑在几十KB RAM、主频几十MHz的MCU上,哪有闲心搞虚函数表、RTTI这些“重…

2026/10/4 10:21:05 阅读更多 →
Vibe Coding麦克风阵列:为Mac mini M4打造的微秒级感知硬件

Vibe Coding麦克风阵列:为Mac mini M4打造的微秒级感知硬件

1. 项目概述:这不是一块普通麦克风,而是一套为Vibe Coding量身定制的感知层硬件Mac mini M4发布后,很多人盯着它的AI加速能力、能效比和静音散热设计,但真正让我坐不住的,是它背后正在悄然成型的新一代人机交互范式——…

2026/10/4 10:21:05 阅读更多 →
docker-selenium 4.48.0 发布解析:Firefox 134.0.2 + GeckoDriver 0.37.1 镜像标签生成全流程

docker-selenium 4.48.0 发布解析:Firefox 134.0.2 + GeckoDriver 0.37.1 镜像标签生成全流程

测试后端云原生容器编排可观测性 【免费下载链接】docker-selenium Provides a simple way to run Selenium Grid with Chrome, Firefox, and Edge using Container Platform, making it easier to perform browser automation at scale 项目地址: https://gitcode.…

2026/10/4 10:21:05 阅读更多 →
EMC近场探头选型与使用方法深度解析

EMC近场探头选型与使用方法深度解析

1. 为什么EMC近场探头不能“随便买一个就用”?——从三类探头实测数据看诊断失效的根源EMC近场探头不是万用表,更不是示波器探头那种“插上就能读数”的通用工具。它本质上是一套高度定制化的电磁场传感器系统,其物理结构、材料介电特性、阻抗…

2026/10/4 10:21:05 阅读更多 →
LabVIEW中TDMS数据落盘实战:从基础写入到工程优化

LabVIEW中TDMS数据落盘实战:从基础写入到工程优化

说起LabVIEW里的数据落盘,我的第一反应就是TDMS。接触LabVIEW的前几年,我也试过用文本文件、Excel表格直接存测试数据,结果在长时间采集项目里被折磨得够呛:文件越来越大、写入越来越慢、半路断电丢数据,最痛苦的是采集…

2026/10/4 10:21:05 阅读更多 →
场景化AI Agent落地实战:从RAG知识库到私有化部署的工程指南

场景化AI Agent落地实战:从RAG知识库到私有化部署的工程指南

1. 场景化AI Agent到底在解决什么问题1.1 从"通用聊天"到"业务智能体"的认知转变过去两年,大模型最普遍的用法就是打开一个对话框,输入问题,得到一段回答。这种模式在写文案、查资料、做翻译时确实好用,但一旦…

2026/10/4 10:20:04 阅读更多 →

日新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 1:00:58 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 10:36:31 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 9:43:54 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/3 9:42:36 阅读更多 →