Token 到底是什么?
Token 到底是什么前言一、大模型的基本工作原理二、Tokenizer 的编码和解码过程1. 编码2. 解码三、Tokenizer的训练过程1. 案例-BPE算法四、Tokenizer 的使用过程1. 编码2. 解码五、Token 与字数的换算关系前言相信大家都听说过Context Window这个概念它代表了模型一次能够处理的最大信息量比如GPT-5.2的Context Window为 40 万这就代表它一次最多能够处理 40 万个Token。注意了这里说的不是 40 万个字也不是 40 万个词而是 40 万个Token。相信Token这个词大家都有听过但究竟什么是TokenToken是怎么生成的它和字或者词到底有什么关系今天我就来彻底为大家讲明白Token这个概念我们首先要从大模型的基本运行原理开始讲起。一、大模型的基本工作原理大模型本质上是一个巨大的数学函数内部全是矩阵运算它输入的是数字输出的也是数字根本就不理解人类的文字所以在人类和大模型之间必须站着一个【翻译官】这个【翻译官】的名字就叫做Tokenizer。Tokenizer一共负责 “编码” 和 “解码” 两个环节其中 “编码” 的意思就是把文字转换为数字而 “解码” 就是反过来把数字转回文字。二、Tokenizer 的编码和解码过程1. 编码编码过程文字 - 数字分两个步骤第一步切分它把用户的问题拿过来将它切成一个个最小的单位这些切出来的碎片就叫做Token。第二步映射因为模型只认数字所以Tokenizer会把每一个Token映射为一个对应的数字这个数字就叫做Token ID。Token ID与Token是一对一的关系Token是文字而Token ID是数字它们就是一个硬币的正反面所表达的内容是一样的只不过表现形式不同而已。经过这两步后我们原本的一句话就变成一串Token ID列表然后Tokenizer就会把这个列表传给模型模型在内部一通运算最后吐出来一个Token ID。这时Tokenizer再次登场它要把这个Token ID翻译回Token这次发挥作用的就是“解码”环节了。2. 解码解码过程数字 - 文字只有一步映射。注意解码环节不需要切分因为模型每次只会给出一个Token。解码阶段完成后我们就拿到了大模型输出的第一个Token。当然如果模型没有说完的话它还可以输出第二个Token、第三个Token等等…“编码”和“解码”涉及到切分和映射这几个环节切分和映射分别是如何实现的呢要搞清楚这一点我们就需要先搞清楚Tokenizer这个东西是怎么被制造出来的。三、Tokenizer的训练过程我们今天以BPE为例给大家演示一下Tokenizer的训练流程它的原理很简单大致说来就是从一堆文章里面找出哪些字经常一起使用然后把这些经常一起使用的字合起来作为一个Token。1. 案例-BPE算法首先我们要准备个文章作为训练材料然后用这个训练材料做出两个产物一个是词表另外一个是合并规则。第一步将训练材料中所有的单字拿过来放到词表里面比如“马”、“克”、“喜”、“欢”…等等它们都是Token第二步为词表里面的每一个字分配一个数字也就是Token ID有些人可能会以为Token ID和Embedding向量类似含义相近的词对应的Token ID应该也相近但其实Token ID只是个编号并没有特殊的语义只要保证Token和Token ID是一对一的关系就行。有了词表之后我们就可以把用户的问题切分为Token了。只用单字的效率太低了我们希望每一个词都是一个Token比如“马克”、“喜欢”、“人工智能” 等等让这些常见的词作为Token才是最佳方案所以呢我们最好能够把这些词也加入到词表里面。第三步让算法扫描整段训练材料统计哪些 “字” 或者是哪些 “词” 喜欢待在一起然后将其进行合并加入到词表中为其分配Token ID并将对应的公式记录在合并规则中。算法扫描后发现“智” 和 “能” 这两个字在这段话里一共出现了五次频率最高。于是算法进行了第一次合并将 “智能” 加入到词表中为其分配一个Token ID并把智 能 —— 智能这个公式记录在合并规则中。从此以后在Tokenizer的眼里“智能” 就是一个整体会处理为一个Token算法继续扫描发现“人”和“工”一共出现了三次当前频率最高。于是使用同样的流程将其合并更新词表并记录下人 工——人工的这个合并规则算法继续扫描发现当前频率最高的是 “人工” 和 “智能” 于是使用同样的流程将进行合并这样Tokenizer就认识“人工智能”这个词了。按照这个规则继续对训练材料进行处理…全部处理完后我们的Tokenizer就训练完毕了它的核心组件就是词表和合并规则。下面我们回到模型的运行流程里看看这个Tokenizer是怎么用的。四、Tokenizer 的使用过程1. 编码切分阶段将用户的问题先分成一个一个的单字再与训练好的合并规则进行比对、合并这样一句完整的用户问题就被切分为了四个Token映射阶段根据词表的映射规则把切分后所得到的Token转换为Token ID2. 解码将模型返回的TokenID与词表进行映射。五、Token 与字数的换算关系40万 Token ≠ 40万字因为Tokenizer不光是一个翻译机它还是一个压缩机。它把经常在一起出现的字合并成了一个 Token例如上面将原本9个字的 “马克喜欢人工智能吗” 合并为四个Token所以Tokenizer可以使模型的输入更少因此模型的训练和推理效率也更高。⚠️量化参考1个Token ≈ 0.75个英文单词1个Token ≈ 1.5-2个汉字40万Token ≈ 60-80万汉字 或 30万英文单词上述博客来自Token 到底是什么—— 揭秘大模型背后的“文字压缩术”

相关新闻

Qt 5.14.2离线包下载与安装:镜像站+迅雷全流程教程

Qt 5.14.2离线包下载与安装:镜像站+迅雷全流程教程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 15:18:33 阅读更多 →
Airbyte 3PL Central 连接器深度解析:从 REST API 建模到增量同步的实现细节

Airbyte 3PL Central 连接器深度解析:从 REST API 建模到增量同步的实现细节

数据工程数据集成ETL后端大数据 【免费下载链接】airbyte Open-source data movement for ELT pipelines and AI agents — from APIs, databases & files to warehouses, lakes, and AI applications. Both self-hosted and Cloud. 项目地址: https://gitcode.…

2026/9/24 15:18:33 阅读更多 →
Loop Engineering Issue Triage Skill 实战:用 AI Agent 维护可读的 Issue 队列(L1 只提不改)

Loop Engineering Issue Triage Skill 实战:用 AI Agent 维护可读的 Issue 队列(L1 只提不改)

人工智能AI AgentAgent 工作流CLI研发协作AI 技能MCP 服务 【免费下载链接】loop-engineering Practical patterns, starters & CLI tools for loop engineering with AI coding agents. Design systems that prompt and orchestrate agents (inspired by Addy Osmani and …

2026/9/24 15:18:32 阅读更多 →

最新新闻

K8s混部技术实战:从原理到落地,提升集群资源利用率

K8s混部技术实战:从原理到落地,提升集群资源利用率

干了这么多年K8s集群运维,我见过太多资源利用率表上写着CPU平均使用率不到20%的集群了。今天想认真聊聊混部技术——就是把在线业务和离线任务塞到同一批物理节点上,用资源调度优化手段把整体资源利用率拉上去的做法。这篇文章会从原理讲到实操&#xff…

2026/9/24 19:28:00 阅读更多 →
AI辅助R语言生态数据分析:从清洗到建模的实践指南

AI辅助R语言生态数据分析:从清洗到建模的实践指南

搞生态的人应该都有同感:拿到一批环境数据,第一步不是急着跑模型,而是先跟数据较劲。缺测值、离群点、单位不统一、时间序列对不齐,这些乱七八糟的问题往往占掉你一大半时间。真正到了统计分析、绘图、建模这些核心环节&#xff0…

2026/9/24 19:28:00 阅读更多 →
用Playground脚本快速搭建Hadoop三节点完全分布式集群

用Playground脚本快速搭建Hadoop三节点完全分布式集群

先把话说在前面:干大数据这行,自己手动搭过一套Hadoop集群的人,十有八九都被配置文件和进程日志折磨过。网上那些动辄几十步的教程,你照着敲到凌晨两点,最后发现是hosts没配对,真的很泄气。所以当我第一次用…

2026/9/24 19:28:00 阅读更多 →
YOLOv5+DeepSort车流量统计实战:密集车流越线计数与参数调优

YOLOv5+DeepSort车流量统计实战:密集车流越线计数与参数调优

简介:本资源是一套面向计算机视觉与智能交通方向的实战项目源码,围绕YOLOv5目标检测与DeepSort多目标跟踪算法,实现可适应密集车流场景的车流量统计功能,适合具备一定深度学习基础、希望深入掌握检测跟踪联合应用的开发者与在校学…

2026/9/24 19:28:00 阅读更多 →
耐震时程曲线优化实战:从目标反应谱到order8vd参数调优

耐震时程曲线优化实战:从目标反应谱到order8vd参数调优

简介:这是一套面向建筑工程与土木工程抗震设计场景的耐震时程曲线优化MATLAB工具包,主要帮助铁路工程领域的设计人员依据中国铁路工程抗震设计规范对地震动时程进行拟合与优化。资源包含4个MATLAB脚本(.m文件),覆盖地震…

2026/9/24 19:28:00 阅读更多 →
用Python拆解豆瓣评论区:情感分析与关键词提取实战

用Python拆解豆瓣评论区:情感分析与关键词提取实战

简介:基于Python的豆瓣电影评论情感分析与关键词提取WordCloud设计源码,面向对自然语言处理、文本挖掘或数据可视化感兴趣的Python学习者与研究者。项目覆盖评论数据预处理、情感分类模型训练、TF-IDF/TextRank关键词提取,最终生成词云图与情…

2026/9/24 19:26:59 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →