一句话怎样变成数字:Token、Tokenizer 与 BPE 入门
摘要一句话进入大模型前会先被切成Token、编号并转换为向量。本文借“去图书馆学习”的例子讲清Token、Token ID、Embedding、BPE以及编码与解码的完整过程。上一篇把Tokenizer称为“人类语言与大模型之间的桥”。这一篇打开这座桥看看一句普通的话如何变成模型可以计算的数字又如何重新变回文字。假设我们输入“小林周末去图书馆学习。”模型直接看到的是这句中文吗严格说不是。应用会先把文字交给分词器Tokenizer转换成一串Token ID模型再把编号转成向量进行计算。这里最容易混淆的是Token、Token ID和Embedding是三个相连但不同的层次。一、Token不是字也不一定是词Token常被译为“词元”是某个Tokenizer选定的文本表示单位。它可能是一个词、一个汉字、词的一部分、标点、空格与文字的组合也可能是一个或多个字节。因此Token不等于固定的“字”或“词”。同一句话交给不同Tokenizer切分结果可能完全不同。可以把它想成快递公司的装箱方案面对“图书馆”有的装成一个箱子有的拆成“图书馆”还有的按底层字节装箱。文字没变包装单位却不同。Token数量也不能按固定比例换算成汉字数。中文、英文、代码、数字、生僻字和标点的编码效率各不相同。想知道一段文字的准确Token数最可靠的方法是使用目标模型对应的Tokenizer实测。二、Token、Token ID与EmbeddingToken ID是词表中某个Token的整数编号。Token好比仓库里的一种货物Token ID就是它的货架号。编号5000并不比编号100“语义更强”换一套词表同一个编号还可能代表完全不同的内容。模型真正计算时还要用Token ID在嵌入层中查到一组数值这就是嵌入向量Embedding。它可以理解为Token在一个多维坐标系统中的表示其数值会在模型训练中不断调整。所以三者的关系是Token是文本单位Token ID是离散索引Embedding是供神经网络计算的连续数值向量。模型不会把ID的整数大小当作含义。三、文字是怎样被编码的Tokenizer不只是“一把切词的剪刀”而是一条处理流水线。一次编码通常包括接收原始文字按规则处理字符、空格和标点使用BPE、WordPiece或Unigram等方法选择Token从词表取得对应的Token ID按模型要求添加开始、结束等特殊Token把ID序列交给嵌入层和模型。为了观察真实结果我使用OpenAI开源项目tiktoken 0.11.0的o200k_base编码对“小林周末去图书馆学习。”进行测试。2026年8月12日的结果是10个Token小林周末去图书馆学习。 5820, 22594, 17442, 56534, 13817, 5803, 20121, 63667, 64550, 788这只是该编码的实测结果不能代表所有模型。换用其他Tokenizer切法和ID都可能变化。四、BPE怎样“长出”词表Tokenizer并非由人手工录入所有词语。开发者会决定训练材料、词表大小、特殊Token和算法再由程序从语料中寻找合适的表示单位。字节对编码Byte Pair EncodingBPE的核心直觉很简单如果两个较小单位经常相邻出现就把它们合成一个更大的单位。假设有一组教学语料小林去图书馆 小雨去图书馆 周末去图书馆学习 图书馆今天开放 我喜欢在图书馆看书暂时从单个汉字开始统计“图书”和“书馆”都高频出现。若第一轮先合并“图书”便得到新Token“图书”重新统计后再把“图书馆”合并为“图书馆”。新Token进入词表合并顺序也会保存供编码时使用。这不代表算法理解了“图书馆”的含义它只是发现这些单位经常一起出现。真实Tokenizer的语料和规则要复杂得多有些字节级BPE甚至从UTF-8字节开始而不是从汉字开始。BPE也不是唯一方案WordPiece、Unigram等算法采用不同的选择方法。五、解码不只是查一次表模型不会一下子吐出整段答案而是连续生成许多Token ID。Tokenizer要取得每个ID对应的文本片段或字节处理特殊Token再把它们拼接成人类可读的文字。对于字节级Tokenizer单个Token可能只是某个字符的一部分要和后续字节合并后才能正确显示。因此解码虽然不必重新寻找切分方式却也不只是“反查一次编号”。完整链路可以概括为人类文字 ↓ Tokenizer切分并映射 Token → Token ID ↓ 嵌入层查表 Embedding向量 ↓ 大模型结合上下文预测 新的Token ID不断循环 ↓ Tokenizer拼接并解码 人类可读的回答六、为什么Token像压缩又不等于ZIP把Tokenizer称作“文字压缩术”很形象常见片段可以用较少Token表示相当于把经常一起运输的物品装进标准货箱模型要处理的序列因此变短。但它不等于ZIP文件压缩。Token数量减少不代表文件字节数同比缩小更大的词表还会增加嵌入矩阵等模型参数。Tokenizer设计是在序列长度、词表大小、语言覆盖和模型效果之间寻找平衡。Token之所以和普通用户有关主要有三点上下文窗口通常按Token计量提示词、对话、工具说明和输出都会占用容量许多API按输入和输出Token计费在其他条件相近时序列越长往往需要更多计算和等待时间。对于Agent这一点更加重要。系统规则、Prompt、Skill指令、检索资料和工具结果最终都要编码成Token放入Context。Token管理会直接影响Agent能携带多少规则、读取多少材料、保留多少历史以及还能为最终回答留下多少空间。七、几个最容易产生的误解第一Token不是模型“理解出来的词义”。“图书馆”即使被合成一个Token也只能说明它在训练材料和合并规则中适合作为一个整体不代表Tokenizer知道图书馆是什么。第二Token越少不一定代表模型效果越好。如果把大量长句都收进词表序列虽然变短词表和模型参数却会迅速膨胀对新词的组合能力也可能下降。Tokenizer追求的是合理平衡而不是无限合并。第三Context Window能容纳多少内容不能只用“几本书”衡量。同样长度的中文、英文、代码或网址Token数可能相差很大系统提示和工具说明也会占据窗口。真正处理长材料时应以对应Tokenizer的统计结果为准。最后减少Token只是优化Agent的一部分。如果删掉关键规则或必要证据即使成本降低答案也可能变差。好的上下文管理不是简单地“越短越好”而是用有限空间保留最有价值的信息。核心概念速查Token特定Tokenizer采用的文本表示单位。Token IDToken在固定词表中的整数索引。Tokenizer把文本编码成Token ID并将输出ID解码成文字的组件。BPE反复合并高频相邻单位、逐步形成子词词表的方法。Embedding由Token ID查得、用于模型计算的连续数值向量。Context Window模型一次推理能够处理的上下文容量通常按Token计算。参考资料Philip GageA New Algorithm for Data Compression1994。Sennrich、Haddow、BirchNeural Machine Translation of Rare Words with Subword Units2016。Hugging FaceThe tokenization pipeline。OpenAItiktoken。OpenAIWhat are tokens and how to count them?。

相关新闻

终极指南:如何用Arnis在Minecraft中快速生成现实世界城市

终极指南:如何用Arnis在Minecraft中快速生成现实世界城市

终极指南:如何用Arnis在Minecraft中快速生成现实世界城市 【免费下载链接】arnis Generate any location from the real world in Minecraft with a high level of detail. 项目地址: https://gitcode.com/GitHub_Trending/ar/arnis 你是否曾梦想在Minecraft…

2026/8/12 22:49:16 阅读更多 →
想看瑞德克斯的安全核验是否清楚?

想看瑞德克斯的安全核验是否清楚?

如果把瑞德克斯放回谨慎型用户的判断框架里,有条理边界和资料保护会是核心观察点。这种偏强调安全的呈现,也让瑞德克斯的正面印象更扎实。这些细节拼在一起,才构成瑞德克斯比较自然、也比较稳健的整体印象。换句话说,如果把重点放…

2026/8/12 22:49:16 阅读更多 →
纯JavaScript实现三级联动组件:从数据驱动到性能优化

纯JavaScript实现三级联动组件:从数据驱动到性能优化

1. 从“选择困难”到“丝滑联动”:为什么我们需要三级联动?作为一名前端开发者,我敢说,但凡做过涉及地区、商品分类、日期时间等层级化数据选择的表单,都绕不开“联动选择”这个功能。想象一下,你正在一个电…

2026/8/12 22:49:16 阅读更多 →

最新新闻

165、飞控中的多传感器融合:粒子滤波基础

165、飞控中的多传感器融合:粒子滤波基础

飞控中的多传感器融合:粒子滤波基础 从一次炸机说起 去年夏天,我在调试一架四轴飞行器的室内定位系统。GPS信号被楼体遮挡,光流传感器在低光照下频繁丢帧,IMU的积分漂移已经让位置估计偏离了半米。我尝试用扩展卡尔曼滤波(EKF)融合这些数据,结果在无人机经过一面白墙时…

2026/8/12 23:36:54 阅读更多 →
从源码到技术书:Pi计算与可视化项目的文档化实践

从源码到技术书:Pi计算与可视化项目的文档化实践

最近在整理个人技术项目时,我决定将之前一个关于“Pi”计算与可视化的开源项目源码进行系统性的梳理和深度解析,并最终整理成了一份结构清晰、内容详实的电子书式笔记。这个过程不仅是对代码的归档,更是一次对算法原理、工程实践和教学表达的…

2026/8/12 23:36:54 阅读更多 →
164、飞控中的多传感器融合:联邦卡尔曼滤波

164、飞控中的多传感器融合:联邦卡尔曼滤波

飞控中的多传感器融合:联邦卡尔曼滤波 从一次炸机说起 去年夏天,我在调试一架四轴无人机时遇到了一个诡异的问题:GPS信号良好,IMU数据干净,磁罗盘校准通过,但飞机在悬停时每隔几分钟就会突然剧烈抖动,然后侧翻炸机。黑匣子日志显示,在抖动发生前0.5秒,姿态估计突然跳…

2026/8/12 23:36:54 阅读更多 →
esbuild插件开发实战:从原理到性能优化的完整指南

esbuild插件开发实战:从原理到性能优化的完整指南

1. 从“快”到“强”:为什么我们需要自定义 esbuild 插件 esbuild 的“快”早已名声在外,它用 Go 语言重写了前端构建的核心路径,将打包时间从分钟级压缩到秒级,这几乎是所有开发者接触它的第一印象。但当我们真正将 esbuild 引入…

2026/8/12 23:36:54 阅读更多 →
163、飞控中的随机控制:随机微分方程

163、飞控中的随机控制:随机微分方程

飞控中的随机控制:随机微分方程 从一次炸机说起 去年夏天,我在测试一款自研的四旋翼飞控。GPS信号良好,IMU校准通过,气压计读数稳定——一切看起来都很完美。飞机悬停到第三分钟,突然毫无征兆地向右翻滚,然后一头栽进草丛。 事后分析日志,发现一个诡异的现象:在炸机…

2026/8/12 23:36:54 阅读更多 →
计算机毕业设计之高校食堂餐饮管理系统

计算机毕业设计之高校食堂餐饮管理系统

当下社会,信息技术充斥社会各个领域,已融入人们生活的点滴,日常中人们管理信息、办理业务、购买商品等都可以网络线上进行,快速而又便利,特别是随着移动互联网时代的到来,更是让人们随时享受着网络给带来的…

2026/8/12 23:35:54 阅读更多 →

日新闻

Ubuntu 22.04安装与使用tree命令:高效管理Linux目录结构

Ubuntu 22.04安装与使用tree命令:高效管理Linux目录结构

1. 为什么需要一个“目录树”工具?在Linux世界里,尤其是Ubuntu这样的发行版,命令行是很多人的主战场。我们每天都要和文件、目录打交道。ls命令是查看目录内容的首选,它简洁、高效,能列出文件名、权限、大小等关键信息…

2026/8/12 9:33:34 阅读更多 →
博思AI智能体:意图识别、思考链与性能优化的工程实践

博思AI智能体:意图识别、思考链与性能优化的工程实践

在AI应用从“能用”走向“好用”的进程中,系统的响应速度、决策透明度与高并发稳定性是决定用户体验的关键。博思AI智能体近期完成了一次重要的专项优化,聚焦于意图识别、思考链展示与全链路压测三大核心领域,将系统从功能实现推向了工程卓越…

2026/8/12 9:33:34 阅读更多 →
子代理架构:AI智能体任务分解与协同执行的核心原理与实践

子代理架构:AI智能体任务分解与协同执行的核心原理与实践

1. 项目概述:为什么我们需要“子代理”?最近在折腾各种AI应用和自动化流程时,我越来越频繁地遇到一个瓶颈:单个AI智能体(Agent)的能力边界。无论是处理复杂的多步骤任务,还是需要同时调用多个专…

2026/8/12 9:33:34 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/12 1:11:09 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/12 1:11:09 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/12 1:11:08 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/11 17:09:45 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/12 1:11:10 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/11 17:09:45 阅读更多 →