LLM Internals 交叉熵损失函数详解:GPT 训练背后的核心数学,为什么取负对数?
【免费下载链接】llm-internalsLearn LLM internals step by step - from tokenization to attention to inference optimization.项目地址https://gitcode.com/gh_mirrors/ll/llm-internals点击查看免费下载交叉熵损失函数Cross-Entropy Loss是训练 GPT、BERT 等大语言模型时最常用的损失函数。LLM Internals 是一个从分词到注意力再到推理优化逐步拆解大模型原理的开源项目本文带你用通俗的方式看懂它的核心数学为什么取负对数语言模型是怎么靠它学会说话的一、先搞清楚交叉熵损失函数到底在解决什么问题训练模型时模型会先猜一个概率分布。比如看到一句话今天天气真____模型可能输出候选词模型预测概率真实答案好0.7✅ 是它棒0.2否差0.1否我们需要一个分数来衡量这个猜测离真实答案有多远——交叉熵损失函数就是干这个的。损失越小说明模型猜得越准训练的目标就是不断把这个损失往下降。交叉熵损失公式逐符号拆解对于单样本、单类别的情况公式可以简化为损失 -log(模型给正确答案分配的概率)只有正确答案参与计算所以正确答案概率 0.9 → 损失 -log(0.9) ≈0.105很小模型答得好正确答案概率 0.1 → 损失 -log(0.1) 2.303很大模型答得很差二、为什么取负对数这是全文最关键的 3 个问题1️⃣ 为什么直接1 减概率不行如果用1 - p衡量错误程度模型从瞎蒙p 0.01进步到还行p 0.5损失降了很多但从 0.9 到 0.99 只降了 0.09——后期怎么努力都感觉不到进步梯度也趋于消失训练就慢下来了。2️⃣ 为什么对数能放大错误对数函数的特性恰好相反p 越接近 0-log(p) 增长越猛。正确答案概率 p-log(p) 损失直觉0.990.010几乎无惩罚0.900.105轻微惩罚0.500.693明显惩罚0.102.303重罚0.014.605严厉惩罚→ 0→ ∞无限大逼着模型改正也就是说模型错得离谱时损失会爆炸式增大倒逼它优先修正最离谱的错误已经答对的样本几乎不产生干扰。这就是难例驱动的训练效果。3️⃣ 为什么前面还要加个负号log 的值域是负数log(0.5) -0.693而我们习惯损失是越大越坏。加上负号后损失恒为正或为 0模型答对概率 1 → 损失 0完美状态一句话总结取负对数 放大严重错误 惩罚恒为正 概率 1 时损失为 0三者兼得。三、多类别怎么算分类与语言模型的统一视角当有多个类别或词表有上万个词时完整公式是损失 -Σ (真实分布 t_i × log(预测分布 p_i))分类任务中真实分布是 one-hot正确类为 1其余为 0求和后其他项全为 0就退化回了第二节的单样本公式。语言模型GPT 这类正是这么用的把整个词表当作类别真实分布永远是下一个真实 token 概率为 1于是损失就是损失 -log(模型给真正下一个词分配的概率)训练 GPT 的本质在万亿条文本上反复执行预测下一个词 → 用交叉熵衡量错得多狠 → 反向传播调整参数。模型 perplexity困惑度等于平均损失的指数越低说明它读懂的语言越多。四、训练怎么落地梯度为什么简单得优雅交叉熵损失与 Softmax 输出组合时梯度有极简形式梯度 预测概率 - 真实分布不需要复杂的链式法则推导模型把 0.7 的概率分给了错误词梯度就告诉它往回收 0.7。这也是 LLM Internals 中反向传播数学一节README.md讲的内容——反向传播提供引擎交叉熵提供方向盘。在 assets/banner.png 对应的架构图中可以看到位置输入 embedding → 多层注意力与前馈网络 →Linear 层输出 logits → Softmax 转成概率 → 与真实 token 计算交叉熵这就是训练信号产生的完整链路。五、延伸LLM Internals 中如何继续学习项目 README.md 的Math Behind Cross-Entropy Loss章节覆盖了完整的进阶路径交叉熵的定义与信息论背景二分类交叉熵 vs 多分类交叉熵逐步数值算例语言模型中的交叉熵与梯度推导配套章节还能形成闭环反向传播数学README.md注意力中的 Softmax 与缩放README.mdTransformer 架构全景README.md克隆仓库开始学习git clone https://gitcode.com/gh_mirrors/ll/llm-internals项目基于 LICENSEApache License 2.0开源可自由学习。六、快速总结 问题答案交叉熵损失衡量什么预测概率分布与真实分布的差距为什么取 log放大严重错误防止后期进步梯度消失为什么加负号保证损失为正答对p1时损失为 0GPT 训练如何用它预测下一个 token 的概率损失 -log(该 token 概率)梯度形式预测概率 − 真实分布简单高效理解交叉熵损失函数就理解了 GPT 训练 90% 的损失侧数学——剩下的 10%在 LLM Internals 里继续拆。赞分享【免费下载链接】llm-internalsLearn LLM internals step by step - from tokenization to attention to inference optimization.项目地址https://gitcode.com/gh_mirrors/ll/llm-internals点击查看免费下载相关推荐U-Net损失函数详解为什么选择二元交叉熵U Net损失函数详解为什么选择二元交叉熵 在图像分割领域U Net凭借其独特的编码器 解码器架构和跳跃连接机制成为了医学影像分析、生物细胞分割等任务的标示例工程深度学习计算机视觉人工智能D2L.ai损失函数大全交叉熵、Focal Loss与对比损失D2L.ai损失函数大全交叉熵、Focal Loss与对比损失 深度学习中的损失函数是模型训练的核心它衡量了模型预测与实际标签之间的差异。在D2L.ai这个文档教程人工智能深度学习NLP计算机视觉强化学习BigInt与数据转换掌握Swift大整数的序列化、字符串互转及NSData操作终极指南BigInt与数据转换掌握Swift大整数的序列化、字符串互转及NSData操作终极指南 在Swift开发中处理超大整数时BigInt库提供了完整的任意精度创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

调试工具实战指南:从断点策略到内存分析的高效排查技巧

调试工具实战指南:从断点策略到内存分析的高效排查技巧

1. 调试工具不是救命稻草,而是日常工具箱很多人对调试工具有个误解,觉得那是代码写崩了、实在找不到问题的时候才翻出来的“急救包”。我刚开始写代码那几年也是这个心态,能靠print解决的事情绝不打开调试器,觉得打断点、单步跟踪…

2026/10/11 11:30:06 阅读更多 →
Atomic Chat 本地AI绘图指南:stable-diffusion.cpp离线图像生成快速入门

Atomic Chat 本地AI绘图指南:stable-diffusion.cpp离线图像生成快速入门

【免费下载链接】Atomic-Chat Local AI app and inference engine for agents. Run open-weight LLMs locally — private, 100% offline on your computer. Join our Discord: https://discord.com/invite/8wGSsvmg4V 项目地址: https://gitcode.com/gh_mirrors/at…

2026/10/11 11:30:06 阅读更多 →
62个实操Lab与265+道测验题怎么用:ai-infra-engineer-learning评估与考核体系深度解读

62个实操Lab与265+道测验题怎么用:ai-infra-engineer-learning评估与考核体系深度解读

【免费下载链接】ai-infra-engineer-learning AI Infrastructure Engineer Learning Track - Production ML infrastructure curriculum (2-4 years experience) 项目地址: https://gitcode.com/gh_mirrors/ai/ai-infra-engineer-learning 点击查看 免费下载 面向 …

2026/10/11 11:30:06 阅读更多 →

最新新闻

线程概念和控制

线程概念和控制

线程概念 线程是程序里的一个执行路线。 一切进程至少都有一个执行线程 线程在进程内部执行,本质是在进程地址空间内运行分页式存储管理 虚拟地址和页表的由来 西靠一下,如果在没有虚拟内存和分页机制的情况下,每一个用户程序在物理内存上对应…

2026/10/11 17:44:29 阅读更多 →
随机森林时间序列预测实战:特征工程、多步策略与避坑指南

随机森林时间序列预测实战:特征工程、多步策略与避坑指南

简介:一套基于Python实现随机森林(RF)时间序列预测的完整工程包,面向需要完成课程设计、期末大作业或毕业设计的计算机、电子信息、数学等专业学生,也适合刚接触机器学习预测的新手快速上手。压缩包内共3个文件&#x…

2026/10/11 17:44:29 阅读更多 →
EP_机械双臂ROS2交互协议

EP_机械双臂ROS2交互协议

EP:Engineering and Projects 双臂轮式机器人(单臂 7 关节 夹爪)ROS2 Topic 交互协议硬件构成: 移动底盘(轮式)【本次只做状态反馈,不展开底盘控制话题】左机械臂:7 个转动关节 夹…

2026/10/11 17:44:28 阅读更多 →
人脸检测数据集从零搭建:WIDER FACE大目标子集8188张VOC转YOLO全流程

人脸检测数据集从零搭建:WIDER FACE大目标子集8188张VOC转YOLO全流程

简介:从WIDER Face中筛选出的B子集大目标人脸检测数据集,包含8188张jpg图片及对应标注,仅face一个类别,总标注框14649个。所有目标的像素面积均大于3500,专门面向近距离、大脸检测场景,可显著减少远距离小目…

2026/10/11 17:44:28 阅读更多 →
CoT还是ToT怎么选?Agentic Design Patterns推理技术(Reasoning Techniques)终极对比

CoT还是ToT怎么选?Agentic Design Patterns推理技术(Reasoning Techniques)终极对比

文档教程AI Agent人工智能 【免费下载链接】Agentic-Design-Patterns Agentic Design Patterns 项目地址: https://gitcode.com/gh_mirrors/agen/Agentic-Design-Patterns 点击查看 免费下载 Agentic Design Patterns 项目第 17 章聚焦 AI 智能体的推理技术&#x…

2026/10/11 17:44:28 阅读更多 →
手写文字去除:OCR前图像预处理的可控方案

手写文字去除:OCR前图像预处理的可控方案

简介:本资源提供手写文字智能擦除的工业级Python实现方案,面向图像处理开发者、AI算法工程师及教育信息化从业者,解决试卷、表单等场景中手写内容与印刷体混杂导致的OCR识别干扰问题。资源包共36个文件,含22个核心Python脚本&…

2026/10/11 17:43:28 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →