分词器tokenizer
笔记12分词器 (tokenizer)作用将原始文本转化为模型理解的数字序列LLM负责“理解和生成”而tokenizer负责“把语言变成模型能理解、可复用的格式”分词器会影响模型能力token划分得太“碎片化”或太“笼统”都会影响表达效率所以分词算法不是唯一的不同的分词算法如BPE、WordPiece会出现不同的划分结果它是独立优化的模块通常先在大规模文本上训练词表vocab再固定下来供模型使用。训练分词器1 准备语料运用命名实体识别Named Entity RecognitionNER技术实现数据脱敏去除私密信息个人信息属于噪声干扰分词算法的统计效率2 预分词阶段基于空格和标点的切分、按Unicode类别划分或直接采用字节级切分直接对字符流做分词会因为跨空格或者标点合并难造成难以还原、语义混乱的token3 统计并迭代更新字词候选统计并迭代更新训练分词器与训练神经网络不通往往采用贪心合并和统计频次的方式4 最终输出产物vocab.json token与idmerges.txt记录字词合并规则或者概率模型vocab.json是最终成品清单已知的直接匹配merges.txt是生成成品的工艺流程未知的按规则拆成已知的两者配合做到零未知词(OOV)假设词表vocab.json里有这些 tokenl,o,w,e,r,er,lo,low,lower,un,believe,able现在来了一个完全没见过的词unlowerable词表里没有这个词。Vocab 查不到→ 这时你必须把它拆成词表里有的子词。可问题是该拆成什么样可以拆成[un,low,er,able]也可以拆成[un,lo,w,er,able]还可以拆成[un,l,o,w,e,r,able]好几种拆法都合法但效果不一样。到底用哪种答案就是看 merges.txt。阶段①训练分词器原始文本 → ① 预分词 → ② BPE 合并 → 得到 vocab merges阶段②使用分词器编码新文本推理/生成时新文本 → ① 预分词 → ② BPE 查询 → Token IDs↑ 这个预分词和合并在两端各出现一次训练阶段离线一次使用阶段在线每次输入海量训练语料单个用户句子做的事统计频次、迭代合并、构建词表预分词 → 查表编码有统计吗✅ 有频次统计❌ 无有迭代吗✅ 有反复合并❌ 无产出固定 vocab.json merges.txttoken ID 序列常用分词器1 字节分词器直接维护大小256的词表与UTF-8编码一致压缩率为12 字符分词器一个字母或者汉字为一个字符字符类型UTF-8 字节数Token 数压缩比ASCII英文、数字1 字节1 token1中文、日文、韩文3 字节1 token3拉丁扩展、希腊文等2 字节1 token2Emoji 4 字节1 token43 词级分词器基于空格或者中文将文本切分为词一个词对应一个ID补充正则表达式用于描述字符串长什么样子的规则语言正则来源于regular表示可由一类规则描述用于提取和判断deepseek采用设计专门的预分词阶段用于切块规则4 BPE分词器统计相邻字符对出现的频率将频繁出现的字符对合并为Token思考四种分词算法对比与 LLM 为何选 BPE机制对比BPEWordPieceUnigramSentencePiece合并/挑选准则统计相邻字符对频率用语言模型概率挑最可能的合并删词从大到小删掉让似然损失最小的子词不直接是一种算法是框架方向自底向上小→大拼自底向上自顶向下大→小删可装 BPE / Unigram评分依据纯频次概率/似然似然可配置代表性使用GPT、LLaMA、DeepSeekBERTT5、GemmaLLMamba、T5 等是否依赖空格依赖需预分词依赖不依赖不依赖原始字节流关键差异BPE每次找出现最频繁的相邻对合并纯看次数。WordPiece不是看出现最多而是看合并后整体分词似然提升最大的对。选让 scoreP(xy)/(P(x)·P(y))最大的一对合并Unigram反着来先假设一个大词表逐个删掉对总似然损失最小的子词直到词表达标。SentencePiece不是独立算法而是处理框架。默认不依赖空格——把空格当作普通字符▁处理天然适配日语等无空格语言也免去预分词步骤。为什么现在的 LLM 普遍选 BPE原因说明简单高效只有数频次一个操作训练快、实现简单、容易并行无 OOV子词拆到字符/字节级兜底任何词都能编码字节级扩展最小单元可用 UTF-8 字节 → 能编码任何语言任何字符绝对 OOV-freeGPU 生态成熟GPT 全系都用它工具链、复现资料最全压缩好常见词整词保留、生僻词拆零件压缩率高省 token一句话BPE 以够用 简单 生态成熟 天然无 OOV取胜。WordPiece/Unigram 概率建模更优雅但 LLM 追求鲁棒性与性价比实用主义压倒了理论精致。如何衡量好的分词器压缩效率 vs 语义一致性维度含义好的表现压缩率平均每个 token 承载多少信息每 token 有效信息多、token 数少语义一致性token 是否对应有意义的语言单元“不开心不要拆成不”开心割裂语义鲁棒性对新词、噪声、不同语言的容忍新词能拆、不崩、产出稳定可还原性能否从 ID 无损还原原文空格标点状态不丢失效率编码/解码速度、词表大小词表不过大、延迟可控核心 trade-off压缩率 ↔ 语义一致性压缩率和语义一致性天然冲突——很难同时要最少的 token和最合理语义。压得越狠→ 词更粗更整 → token 少但可能把不该绑的一起绑语义边界错乱拆得越细→ 语义更纯净 → 但 token 变多序列变长成本上升中文例子-整词:[不开心]→3字1token省但开心难以复用到其他场景-子词:[不,开心]→ 语义清晰且开心可复用-单字:[不,开,心]→ 最灵活但 token 最多现代取平衡的做法高频词整词收进词表保语义 省 token低频生僻内容拆成子词保证覆盖。平衡点由词表大小和训练语料分布决定。类比像造乐高——大积木整词拼得快但形状受限小积木子词灵活但拼得慢。好分词器是找到常用部分用大积木、其余用小积木的黄金配比。分词器如何影响实际 LLM 的表现分词器虽是预处理但对模型能力上限影响极大。① 上下文窗口的实际长度被压缩率决定模型窗口2048token固定 压缩率高的分词器 →2048token 能塞进更多信息 → 模型看到更多上下文 压缩率低 → 同样文本吃满窗口 → 长文容易截断丢失直接影响长文档理解、多轮对话、代码生成的好坏。② 生成成本的直接杠杆API 按 token 收费/推理按 token 计算 好的分词器 token 少 → 便宜、生成快 英文1词≈1-2token中文每字≈1-2token直接影响经济成本和速度是工程上最被重视的原因。③ 学习能力与语义token 边界 模型的注意力边界模型基于 token 学习token 之间是离散的跨 token 组合主要靠注意力语义一致的 token→ 更容易学到词的用法/语法/搭配 → 生成更流畅准确语义割裂的 token→ 关联被切断模式更难学生成质量下降好的切分[在新,的,世界,里]→ 模型抓住在...里的句式 坏的切分[在,新,的,世,界,里]→ 每字孤立句式规律难学④ 特殊 token 的设计影响指令遵循BOS/EOS、PAD、角色分隔符等设计直接影响对话模板、指令跟随能力。⑤ 数字与代码切片方式决定推理薄弱点数字20242025拆成[2024,2025]→ 模型可能看出是相邻年份 拆成[20,24,20,25]→ 算术和数字关系更难学知名现象LLM 在大数运算、拼写、中英文混排上出问题根因往往是分词器把内容切碎了。★ 三个终极小结为什么选 BPE简单高效 生态成熟 字节级无 OOV实用主义胜出。好的分词器 在压缩率和语义一致性间找平衡通常用高频整词 低频子词兼顾。对 LLM 的影响决定窗口能装多少信息、生成成本、模型能否学到语义规律进而影响长文能力、质量、成本甚至数字和代码推理。参考链接分词器 ↩︎课程介绍与分词器cs336第一节 ↩︎

相关新闻

dm9安装初体验

dm9安装初体验

闲言碎语不多讲,单表达梦9安装 [rootlocalhost dmdba]# mount -r /home/dmdba/dm9_20260509_x86_kylin10_sp1_64.iso /mnt [rootlocalhost dmdba]# su - dmdba 上一次登录: 三 8月 19 20:20:02 CST 2026 pts/0 上 [dmdbalocalhost ~]$ cd /mnt [dmdbaloc…

2026/8/21 7:00:37 阅读更多 →
多智能体强化学习中的灾难性遗忘问题与PRIME解决方案

多智能体强化学习中的灾难性遗忘问题与PRIME解决方案

1. 项目背景:当无人机集群遇上应急通信,一个被忽视的“脑损伤”问题想象一下这样的场景:一场突如其来的自然灾害,地面通信基础设施完全瘫痪。几架无人机迅速升空,它们需要自主协作,在空中构建一个临时的通信…

2026/8/21 7:00:37 阅读更多 →
从Arduino到HT66F002:低成本MCU开发实战与方案选型指南

从Arduino到HT66F002:低成本MCU开发实战与方案选型指南

在实际嵌入式开发中,Arduino以其易用性和丰富的生态成为许多创客和初学者的首选。然而,当项目进入小批量生产或对成本极其敏感时,Arduino开发板的价格和资源冗余就成了问题。这时,寻找一款功能足够、价格低廉且易于开发的MCU作为替…

2026/8/21 7:00:37 阅读更多 →

最新新闻

华为MetaERP OE_ORDER_LINES_ALL.LINE_TYPE_ID 【创建场景汇总】核心定义:创建 = INSERT OE_ORDER_LINES_ALL 时赋值 LINE_TYPE

华为MetaERP OE_ORDER_LINES_ALL.LINE_TYPE_ID 【创建场景汇总】核心定义:创建 = INSERT OE_ORDER_LINES_ALL 时赋值 LINE_TYPE

OE_ORDER_LINES_ALL.LINE_TYPE_ID 【创建场景汇总】核心定义:创建 INSERT OE_ORDER_LINES_ALL 时赋值 LINE_TYPE_ID 区别于 UPDATE(修改已有行的 LINE_TYPE_ID)。 所有场景底层最终都会调用 OE_ORDER_PUB.PROCESS_ORDER 写入行数据。一、人工…

2026/8/21 8:21:13 阅读更多 →
从手写推导到AI底层原理:开发者如何通过第一性原理掌握Transformer与Agent

从手写推导到AI底层原理:开发者如何通过第一性原理掌握Transformer与Agent

如果你是一名开发者,最近可能被各种AI新闻和工具刷屏,从ChatGPT到Claude,从Midjourney到Sora。但你是否也有这样的困惑:这些AI模型背后的数学原理是什么?那些复杂的算法和架构,比如Transformer、Agent&…

2026/8/21 8:21:13 阅读更多 →
本地AI图像生成项目部署指南:从环境配置到效果验证

本地AI图像生成项目部署指南:从环境配置到效果验证

这次我们来看一个名为“未来画卷贝卡兔、女版金杰猫和棕色猫”的本地AI图像生成项目。从项目标题来看,这似乎是一个针对特定风格或角色进行图像生成的工具或模型,可能涉及风格化、角色一致性生成或图像编辑。对于关注Stable Diffusion、ComfyUI工作流以及…

2026/8/21 8:21:13 阅读更多 →
冷立面技术:建筑热管理新思路,降温节能从“皮肤”开始

冷立面技术:建筑热管理新思路,降温节能从“皮肤”开始

最近几年,夏天是越来越难熬了。办公室里空调开到最低,冷风呼呼地吹,但靠近外墙和窗户的工位依然像个“小火炉”,坐久了后背发烫。这不仅仅是体感不适的问题,更直接影响了工作效率和设备寿命。我们总在讨论如何让空调更…

2026/8/21 8:21:13 阅读更多 →
PyTorch深度学习实战:从nn.Module到优化器的完整训练流程构建

PyTorch深度学习实战:从nn.Module到优化器的完整训练流程构建

在实际深度学习项目中,我们很少会直接使用原始的 torch.Tensor 和手动计算梯度来构建整个网络。随着模型复杂度的提升,代码的组织、复用、调试和训练流程的管理会迅速变得混乱。PyTorch 之所以强大,不仅在于其动态图的灵活性,更…

2026/8/21 8:21:13 阅读更多 →
list 2

list 2

指针字节数,只看系统架构,和模板 T 无关 32 位 x86 平台:所有指针都是 4 字节 64 位 x64 平台(VS 默认现在都是 64 位):所有指针都是 8 字节继续在 类模板list_iterator完成重载1,后置 --下图用…

2026/8/21 8:20:13 阅读更多 →

日新闻

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

机场边检旅客定位系统国产化白皮书:算法、硬件、底座平台全程自主

前言随着国家数字基础设施信创替代、关键技术自主可控战略持续深化,口岸智慧安防、边检智能管控领域正全面进入国产化、自主化、安全可控升级周期。当前国内机场边检旅客识别与定位体系长期依赖国外商用视觉算法、进口成像硬件、闭源通用计算平台,存在核…

2026/8/21 0:00:42 阅读更多 →
别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱

别再把“数字孪生”当空间智能了!镜像视界揭开四维时空的真正面纱当下数字化建设浪潮中,很多项目将三维可视化、视频贴图叠加的数字孪生等同于空间智能。传统数字孪生更多停留在三维场景复刻,擅长把物理世界“画出来、展示出来”,…

2026/8/21 0:00:42 阅读更多 →
105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40°C到85°C的影像质量一致性——ISP参数温漂补偿与产线标定策略

105、车载温度范围-40C到85C的影像质量一致性——ISP参数温漂补偿与产线标定策略 去年冬天在北方某车厂做A样评审,凌晨四点的黑河试验场,零下三十三度。客户拿了一台冷启动的车,中控屏上倒车影像全是雪花噪点,暗部细节直接糊成一片。我第一反应是sensor温度没上来,暗电流…

2026/8/21 0:00:42 阅读更多 →

周新闻

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

基于阿里云与通义千问(Qwen)构建AI应用:从模型调用到生产部署的完整实践指南

如果你是一名开发者,最近可能已经感受到了AI大模型正在从“玩具”变成“生产力工具”的强烈信号。从代码补全到智能Agent,从本地部署到云端API,我们正处在一个技术栈快速重构的节点。然而,面对层出不穷的模型、框架和工具&#xf…

2026/8/21 3:21:33 阅读更多 →
工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 0:02:09 阅读更多 →
【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

2026/8/21 6:07:56 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/20 6:11:08 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/20 21:46:49 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/21 0:14:22 阅读更多 →