猜出下一个字,AI 就学会了“说话”?——给高中生的大语言模型原理科普
# 猜出下一个字AI 就学会了“说话”——给高中生的大语言模型原理科普 吴国锋 7/21你有没有和 ChatGPT 聊过天你问它“今天天气真好适合……”它马上接“出去走走”甚至还会给你安排一场野餐攻略。这个过程中AI 其实一直在做一件事**猜下一个字该是什么**。它是怎么猜的为什么能猜得这么像模像样这篇文章就用高中生能看懂的方式把支撑大语言模型的那些核心思想拆开给你看。---## 1. 大语言模型本质上就是一个“下一个字预测器” “它是通过模拟人类表达的过程来拟合人类智能。” “说到底就是计算下一个字的概率来决定下一个字应该说什么。”当我们给模型一段上文比如“昨天我去了动物园看到了长颈”模型会计算所有可能的下一个字“鹿”“颈”“腿”……分别有多大概率出现然后选概率最高的那个输出。接着把新得到的句子当作输入再猜下一个字一个字一个字地“自回归”生成整段话。用数学语言说**大语言模型就是一个函数**输入是已有文本序列输出是“下一个字”在所有候选字上的概率分布。---## 2. 这个概率函数长什么样万能近似定理来了 “那这个概率是怎么计算的呢高中生都知道函数 $y f(x)$。” “只不过这个函数到底是什么公式没有人知道。没人知道那我们是怎么做出 AI 来计算这个概率的呢”没错如果非要写出一个能精确计算“在任意上文之后下一个字是什么”的表达式可能根本写不出来——它太复杂了。但数学上有一条神奇的定理帮了大忙**万能近似定理Universal Approximation Theorem**。**万能近似定理说只要给我足够多的简单函数把它们按一定方式组合起来就能以任意精度模拟任何复杂函数。**打个比方你不会用一笔画出蒙娜丽莎但你可以用成千上万块拼图拼出她。每一个拼图片都是一个“简单函数”整体拼出来就是那个复杂的概率函数。 “这个定理对 AI 有什么用呢 简单说就是我们可以通过很多个简单函数的组合来模拟计算下一个字符出现的概率的函数。”那么用什么结构来组合这些简单函数呢答案是——**神经网络**。---## 3. 神经网络用无数个“神经元”拼出概率函数 “神经网络可以认为是一个函数输入是用户提问输出是回答的下一个字的概率然后选择概率最大的那个字返回给用户。”神经网络是由一层层“神经元”连接而成的网。一个神经元就是一个简单函数$$\text{output} \sigma(w \cdot x b)$$这里- $x$ 是输入信号一个数字或一组数字组成的向量- $w$ 是权重weight决定这个输入有多重要- $b$ 是偏置bias相当于调节灵敏度- $\sigma$ 是激活函数比如 Sigmoid、ReLU 等它负责引入“非线性”让组合后的网络能表达复杂的弯曲曲面而不仅仅是直线平面。没有它无数层叠起来也还是个线性函数就没法逼近任意函数了。当一个神经元不够用我们就把很多神经元排成一层再把很多层叠起来——这就是“深层神经网络”。每一层拿上一层的输出作为自己的输入层层加工最后给出我们想要的结果。 “神经网络是有很多个简单函数组合起来的网络。每个简单函数都是网络中的一个点…… 理论上我们把无数个这样的简单函数组合起来就能模拟最终的概率函数。”但在实际计算机里一次计算“无数个”简单函数会吃不消。于是工程师们把它们分成一层一层**每一层只计算有限个神经元通过很多层的堆叠来逼近那个复杂的概率函数**。这就是深度学习里的“深”字的由来。---## 4. Transformer当下大语言模型的“骨架”单靠普通的全连接神经网络处理句子还远远不够。因为自然语言里字与字之间的长距离依赖比如“我买的那个放在书架顶上的盒子它里面装的是……”后面的“它”指的就是“盒子”很难捕捉。2017 年一种叫 **Transformer** 的结构横空出世彻底解决了这个问题今天所有主流大语言模型GPT 系列、Claude、文心一言等都基于它。### 4.1 核心武器自注意力机制Transformer 里最重要的部分叫 **自注意力Self-Attention**。它的思路很直觉**让每个字都去看看整句话里其他所有字自己决定该重点关注谁。**比如在“长颈鹿的脖子很长”中当模型处理“脖子”时它会自己学会多注意前面的“长颈鹿”而少注意语气词“的”。自注意力的核心公式$$\text{Attention}(Q, K, V) \text{softmax}\!\left(\frac{QK^T}{\sqrt{d_k}}\right) V$$来解释一下- 把你想要“查询”的字通过矩阵变换得到 **QQuery**。- 所有可能被注意的字分别变换成 **KKey** 和 **VValue**。- $QK^T$ 计算出“查询”与各个“键”的匹配度分数。- 除以 $\sqrt{d_k}$ 防止分数过大让训练更稳定。- 通过 **softmax** 把分数变成概率所有值加起来等于1这就是注意力权重。- 最后用这个权重对 **VValue** 做加权求和。这样一个字的输出里就融合了整句话中其他字的信息且重要字的影响被放大。**多头注意力Multi‑Head Attention** 就是同时做很多组这样的计算每一组可以学到不同的关注模式比如一组关注语法一组关注指代一组关注情感。### 4.2 Transformer 块像多层漏斗一样加工信息一个 Transformer 层不只是自注意力它还包括“前馈网络”简单的全连接层和残差连接、归一化等。大致流程是输入 → 多头自注意力 → 残差连接 层归一化 → 前馈网络 → 残差连接 层归一化 → 输出给下一层现在的 GPT 类模型只用了 Transformer 的“解码器”部分并且用了掩码让模型在计算注意力时只能看到当前位置之前的上文不能偷看后面的字这样才符合“猜下一个字”的任务。### 4.3 最后一步把加工过的信息变成“下个字的概率”经过很多层 Transformer 模块的深度加工模型得到了对每个位置的深层理解。最后用一个线性层加上 Softmax把最后一层的输出向量映射到一个巨大的概率表上——这个表里每个条目对应词表中的一个字或子词。$$P(\text{next\_token} \mid \text{context}) \text{softmax}(W \cdot h_{\text{last}} b)$$其中 $h_{\text{last}}$ 是最后一个 Transformer 层输出的向量$W$ 和 $b$ 是学到的参数。这样就得到了“下一个字”的概率分布。---## 5. 整个生成过程的流程图下面用一张简化的流程图把从你输入一句话到模型吐出一个新字的全过程串起来mermaidgraph TDA[用户输入: 今天天气真] -- B[分词嵌入 Embeddingbr把每个字变成向量]B -- C[位置编码 Positional Encodingbr加上位置信息]C -- D[多层 Transformer 解码器块br每块包含]D -- D1[掩码多头自注意力br只看上文融合上下文]D1 -- D2[残差连接 层归一化]D2 -- D3[前馈神经网络 FFN]D3 -- D4[残差连接 层归一化]D4 -- DD -- E[最后一层输出向量]E -- F[线性层 Softmaxbr得到所有候选字的概率]F -- G[选概率最高的字比如好]G -- H[输出好br并将其附加到已有文本后]H --|循环| Amermaid解释模型把“今天天气真”变成向量经过加了位置信息的嵌入层再穿过很多个一样的 Transformer 块每个块里先做带掩码的自注意力只依据前文来理解当前字再通过前馈网络做非线性变换最后把得到的语义表示映射成概率选出“好”。然后将“好”字拼回原文拿“今天天气真好”作为新的输入继续生成下一个字直到输出结束符。6. 训练怎么知道这些简单函数里的 ww 和 bb 该取多少既然神经网络的本质是 yσ(wxb)yσ(wxb) 的组合那上亿个权重 ww 和偏置 bb 该怎么定这就要靠“训练”了。简单说就是把全网上的海量文本投喂给模型让它不断地猜下一个字。猜错了就通过反向传播算法沿着函数链求偏导数一点点调整 ww 和 bb让下次猜同一个上下文时正确率更高。重复千亿次模型就慢慢学会了人类组织文字的规律——世界知识、语法、逻辑、甚至某种程度的推理其实都是在这个过程中以“预测下一个字”的形式被内化到参数里的。7. 回到开头一切缘于万能近似定理“说到底就是计算下一个字的概率来决定下一个字应该说什么。”这个想法看似简单但把它实现出来需要一条清晰的逻辑链没有人能写出精确的“概率函数”公式但根据万能近似定理任何函数都能被大量简单函数的组合近似我们用神经网络来充当这些“简单函数的组合”一层层堆叠用 Transformer 结构让每个字都能动态关注到上文里最重要的信息最后通过海量文本训练自动找到所有神经元里最佳的 ww 和 bb。于是那个看起来无所不知、能和你谈天说地的大语言模型本质上还是一个乖乖计算“下一个字概率”的数学函数——只不过这个函数被千亿个 yσ(wxb)yσ(wxb) 硬生生拼了出来。

相关新闻

AI辅助4K视频制作全流程:从Higgsfield提示词到侏罗纪主题成品

AI辅助4K视频制作全流程:从Higgsfield提示词到侏罗纪主题成品

在数字内容创作领域,4K分辨率视频已经成为主流标准,而AI技术的融入正以前所未有的方式降低高质量视频制作的门槛。Higgsfield Seedance2.0作为一款结合AI生成能力的视频制作工具,特别适合想要创作如“穿越侏罗纪”这类高视觉冲击力主题的创作…

2026/9/23 13:41:16 阅读更多 →
AABB与OBB碰撞检测:从原理到ROS可视化实战

AABB与OBB碰撞检测:从原理到ROS可视化实战

1. 项目概述:碰撞检测的“火眼金睛” 在机器人、游戏开发、自动驾驶乃至工业仿真这些领域,有一个问题几乎无处不在:两个物体撞上了吗?这就是碰撞检测。它就像系统的“火眼金睛”,负责判断虚拟世界或物理世界中的物体是…

2026/9/21 12:23:45 阅读更多 →
079、Zephyr RTOS驱动开发基础:驱动数据传递

079、Zephyr RTOS驱动开发基础:驱动数据传递

Zephyr RTOS驱动开发基础:驱动数据传递 从一次诡异的GPIO中断丢失说起 去年做一款工业传感器网关,用Zephyr驱动一个外挂的ADC芯片。调试时发现一个诡异现象:GPIO中断偶尔会丢失,概率大约千分之三。用逻辑分析仪抓波形,中断引脚确实有脉冲,但CPU就是没响应。折腾了两天,…

2026/9/20 0:30:16 阅读更多 →

最新新闻

退款率怎么算:3个致命坑点与避坑指南

退款率怎么算:3个致命坑点与避坑指南

退款率怎么算:3个致命坑点与避坑指南 上周参加某大厂后端面试,二面官指着白板问:“你们系统的退款率是怎么算的?分母到底包不包含已取消的订单?”我愣了三秒,脑子里全是 COUNT(1)…

2026/9/23 15:00:27 阅读更多 →
3步搞定最新手机性价比排行算法,附完整示例

3步搞定最新手机性价比排行算法,附完整示例

3步搞定最新手机性价比排行算法,附完整示例 面试被问原理答不上来?别慌。很多开发者在简历上写了“高性能推荐系统”,结果面试官一追问底层排序逻辑,直接卡壳。今天不聊虚的,直接拆解一个真实的 最新手机性价比排行…

2026/9/23 15:00:27 阅读更多 →
徐可馨手写实现HTTP服务器3天搞定配置坑

徐可馨手写实现HTTP服务器3天搞定配置坑

徐可馨手写实现HTTP服务器3天搞定配置坑 刚接手项目时,我盯着终端里那一堆报错发呆。配置环境就卡半天,Node版本不对,依赖包冲突,端口被占用,折腾一下午啥也没跑起来。这种痛苦,转岗做后端的朋友肯定懂。与其在配置泥潭里打滚,不如换个思路:…

2026/9/23 15:00:27 阅读更多 →
Qwen3.6-Plus 百万上下文与 Agent 编程:普通人可用的软件生产力,TaoToken 统一 Key 配置实战

Qwen3.6-Plus 百万上下文与 Agent 编程:普通人可用的软件生产力,TaoToken 统一 Key 配置实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/23 15:00:27 阅读更多 →
松果体激活技术栈选型,搞定高频面试题与实战避坑

松果体激活技术栈选型,搞定高频面试题与实战避坑

松果体激活技术栈选型,搞定高频面试题与实战避坑 刚把网上抄来的代码扔进 IDE,结果报错一片,连个错因都找不到。这种“复制粘贴就能跑”的幻觉,在真实工程里早就失效了。很多转岗开发者卡在【松果体激活】这类涉及生物传感或神经接口模拟的跨领域项目…

2026/9/23 15:00:27 阅读更多 →
ESP、MSR与恢复分区:UEFI/GPT电脑启动的三大核心分区

ESP、MSR与恢复分区:UEFI/GPT电脑启动的三大核心分区

1. 这三个“看不见”的分区,才是现代电脑真正开机的钥匙你有没有试过重装系统时突然发现磁盘里多出几个100MB、500MB甚至几GB的“空白分区”,既打不开又删不掉?右键一看属性——类型是“系统”“恢复”“EFI系统分区”,名字一串乱…

2026/9/23 14:59:23 阅读更多 →

日新闻

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A…

2026/9/23 0:00:23 阅读更多 →
2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我 刚把开发环境的显示器从1080P换到2K,跑老项目直接报错,版本升级后 API…

2026/9/23 0:01:25 阅读更多 →
3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点 官方文档翻了三遍还是云里雾里?别急,美眉图在实战项目中常被用来做数据可视化,但它的原理比你想的简单。今天咱们直接上手,用一个完整的小项目把美眉图跑通,不再死磕那些冗长的理论说明。…

2026/9/23 0:01:25 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →