LLM Internals 分词入门:Tokenization 如何把文字拆成模型能懂的Token?
【免费下载链接】llm-internalsLearn LLM internals step by step - from tokenization to attention to inference optimization.项目地址https://gitcode.com/gh_mirrors/ll/llm-internals点击查看免费下载本文基于开源教程项目llm-internals讲解 Tokenization分词这个项目带你一步步学习大语言模型LLM的内部原理——从分词、注意力机制到推理优化帮新手看懂模型是如何把人类文字拆成它能理解的 Token 的。Tokenization 是什么LLM 理解文字的第一步 大语言模型并不认识文字它的输入和输出只能是数字。而 Tokenization分词就是站在文字与数字之间的那座桥它要解决的问题把任意一段文本切分成模型词表Vocabulary里认识的小片段切分单位不是词Token 可以是一个完整的单词如tokenization、词的一部分如tokenization、一个汉字、一个数字甚至一个空格为什么必须切词表大小有限通常几万到十几万个不可能收录所有词汇尤其还有新词、错别字和外语一句话理解Tokenization 决定了模型看到你的文字时它到底读到了什么。分词的三步流程从文本到模型输入任何 Tokenizer分词器都遵循类似的处理管线大致分三步第一步文本规范化Normalization先把文本清洗成标准形态统一大小写处理方式、规范化 Unicode 特殊字符、处理异常空格等。这一步保证同一含义的文字进入模型时形态一致减少词表压力。第二步按词表切分 TokenTokenize核心环节。分词器根据词表把文本拆成若干 Token——这一步具体怎么拆由分词算法决定下一节详解 BPE。第三步Token 映射为 ID 并向量化每个 Token 在词表中都有唯一的整数 ID。切分完成后一串文本就变成了一串数字例如hello world→hello、world→9503、1418这些 ID 随后经过 Transformer 内部的Input Embedding层变成向量可参考上方横幅图中Input Embedding的位置并叠加位置编码正式进入模型。BPE 算法图解现代 LLM 最常用的分词方法 大多数现代 LLMGPT、Llama 等家族都使用BPEByte Pair Encoding字节对编码作为分词算法这也是 llm-internals 项目专门展开讲解的一课。BPE 的核心思路很简单从最小单位出发先把语料拆成单个字节/字符统计并合并找出语料中出现频率最高的相邻组合把它合并成一个新 Token反复迭代循环执行第 2 步直到词表达到目标规模举个例子训练语料中lo和w经常挨在一起就合并出lowlow和er又经常连用就合并出lower……高频词逐渐保持完整低频词则被拆得更碎。为什么 BPE 如此受欢迎✅高频词保留完整常见词一个 Token 搞定序列更短、推理更快✅永不生词任何新词、错别字、外语都能退回字节层拆解模型不会遇到词表外的内容OOV✅成本可控词表大小可精确控制想跟着数值例子一步步走一遍 BPE可以查看项目中的这一节Byte Pair Encoding in LLMs。Tokenization 如何影响你的实际使用 分词不只是幕后技术它直接影响你使用 LLM 的三件事影响点说明计费成本LLM 按 Token 数量计费。同样的内容中文通常比英文消耗更多 Token成本随之更高上下文长度模型的记忆上限上下文窗口按 Token 计分词越省同样窗口能装下的信息越多生成质量Token 切分方式会影响模型对词义的理解粒度切得合理模型才读得顺 实用建议撰写 Prompt 时避免无意义的重复内容不仅更省钱也能为上下文留出更多空间。如何系统学习 LLM 分词与内部原理 分词只是入门第一步。llm-internals 项目提供了一条完整的 LLM 内部原理学习路线全部学习资料的索引用于 README.md分词篇Tokenization 视频与概念、BPE 字节对编码注意力机制篇Q/K/V 数学推导、√dₖ 缩放、因果掩码Causal Masking训练篇反向传播数学、交叉熵损失Cross-Entropy Loss架构篇Transformer 架构逐层解读、FFN 前馈网络、RMSNorm推理优化篇KV Cache、Paged Attention、Flash Attention、投机解码Speculative Decoding、连续批处理、MoE 专家混合本地获取项目资料用于离线学习git clone https://gitcode.com/gh_mirrors/ll/llm-internals项目基于 Apache License 2.0 开源许可证全文见 LICENSE。总结Tokenization分词是 LLM 理解文字的第一步把任意文本拆成词表内的 Token再映射为数字 IDBPE通过反复合并最高频相邻组合的策略兼顾了高频词完整性与生词处理能力成为现代 LLM 的主流分词算法分词结果直接关系API 计费、上下文长度与生成质量是每个 LLM 用户都该建立的概念借助 llm-internals 项目你可以沿分词 → 注意力 → 训练 → 推理优化的路线系统吃透 LLM 内部原理赞分享【免费下载链接】llm-internalsLearn LLM internals step by step - from tokenization to attention to inference optimization.项目地址https://gitcode.com/gh_mirrors/ll/llm-internals点击查看免费下载相关推荐Tokenization 与数据形状全解析train-llm-from-scratch 如何把文本变成可训练张量Tokenization 与数据形状全解析train llm from scratch 如何把文本变成可训练张量 本篇技术指南以仓库文档 docs/found人工智能大模型深度学习预训练微调强化学习Qwen 分词器完全指南BPE 字节级 Tokenization、特殊 Token 与词表扩展实战Qwen 分词器完全指南BPE 字节级 Tokenization、特殊 Token 与词表扩展实战 导读 本文以 Qwen 仓库中的 tokenizatio人工智能大模型微调LoRA模型量化本地部署模型推理服务LLM 中的 Token 是如何计算的一文读懂 Tokenizer 原理与 Token 用量估算LLM 中的 Token 是如何计算的一文读懂 Tokenizer 原理与 Token 用量估算 导读 Token 是大型语言模型LLM处理文本的基本单文档教程技术博客大模型人工智能创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

SpringBoot个人博客系统:Thymeleaf+MyBatis-Plus毕设实战指南

SpringBoot个人博客系统:Thymeleaf+MyBatis-Plus毕设实战指南

简介:这是一套基于SpringBoot 2.x、Thymeleaf与MyBatis-Plus开发的完整个人博客系统,专为Java初学者与毕业设计学生打造,覆盖MVC分层架构、Markdown文档编辑、博客目录自动生成等核心功能,可作为Web全栈开发入门与课程设计的高质量…

2026/10/11 12:41:32 阅读更多 →
性能测试中的唯一标识:从压测事故到JMeter实战方案

性能测试中的唯一标识:从压测事故到JMeter实战方案

1. 从一次压测事故说起:唯一标识为什么是个大问题先讲个我亲身经历的现场。去年做某个核心交易链路的压力测试,并发量刚压到 500 线程,后端就开始报"主键冲突"。开发第一反应是数据库问题,盯着慢查询日志看了半天也没头…

2026/10/11 12:41:32 阅读更多 →
Cheat Engine 6.8.1 源码编译与核心模块拆解实战

Cheat Engine 6.8.1 源码编译与核心模块拆解实战

简介:这份资源是Cheat Engine 6.8.1完整源码包,面向游戏逆向、内存调试与安全分析方向的学习者和开发者,帮助其从源码层面理解动态内存扫描、读写与指针追踪的实现机制。压缩包共1523个文件,约8.45MB,以426个pas与181个…

2026/10/11 12:41:32 阅读更多 →

最新新闻

Java 实现超大附件上传:分片、断点续传与合并校验实战

Java 实现超大附件上传:分片、断点续传与合并校验实战

很多做文件上传功能的同学,第一次接到“超大附件”需求时都以为只是加个参数、调大内存就能搞定。结果一跑真实文件,几百 MB 可能还能撑住,到了几个 GB 甚至十几个 GB,要么请求超时,要么服务端内存直接打满&#xff0c…

2026/10/11 13:35:01 阅读更多 →
私有化交付自动化巡检引擎:编写覆盖 50 项软硬件指标的零依赖前置验收脚本

私有化交付自动化巡检引擎:编写覆盖 50 项软硬件指标的零依赖前置验收脚本

在私有化项目交付的“翻车排行榜”上,排在第一名的永远不是“业务系统有 Bug”,而是“客户提供的底层服务器环境存在极其隐蔽的致命硬伤”:实施工程师辛辛苦苦在客户内网机房忙活了整整一天,终于把全部容器和微服务拉齐&#xff0…

2026/10/11 13:35:01 阅读更多 →
微服务核心降级矩阵实战:当上游依赖与第三方支付瘫痪时如何保住核心交易

微服务核心降级矩阵实战:当上游依赖与第三方支付瘫痪时如何保住核心交易

在大促高并发或突发网络割接等极端场景下,分布式微服务系统最危险的状态不是“所有机器全死”,而是“某一个非核心的下游依赖半死不活”:比如商品详情页调用的“个性化推荐服务”突然发生 GC 停顿,响应耗时从 10ms 拉长到 3 秒&am…

2026/10/11 13:35:01 阅读更多 →
红外电力设备目标检测数据集实战:从VOC转YOLO到切图推理全流程

红外电力设备目标检测数据集实战:从VOC转YOLO到切图推理全流程

简介:这份红外电力设备目标检测数据集面向电力AI检测、智能电网运维及计算机视觉方向的研究者与开发者,提供可直接用于YOLO系列模型训练的真实热成像标注数据。资源包共2000个文件,以1474个txt标注文件、524张jpg热成像图片为主,另…

2026/10/11 13:35:01 阅读更多 →
Java超大文件分片上传实战:解决OOM与连接超时

Java超大文件分片上传实战:解决OOM与连接超时

在 Java 后端开发里,“JAVA http 请求”本身不算难事,难点是当请求体变成几个 GB 的超大附件时,问题会全部冒出来。我之前负责一个数据文件交换平台,用户经常上传 3GB、6GB 的现场采集包,最初同事按普通 Multipart 方式…

2026/10/11 13:35:01 阅读更多 →
SS728M05身份证验证终端Windows接口包对接指南:从DLL调用到稳定部署

SS728M05身份证验证终端Windows接口包对接指南:从DLL调用到稳定部署

简介:面向Windows平台的神思SS728M05身份证验证SDK开发包,专供需要集成二代身份证读取、解码与真伪校验的开发者使用。接口封装了神思硬件设备的底层通信协议,适用于银行开户、网络实名认证、酒店登记等实名制场景,开发者无需深入…

2026/10/11 13:34:01 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →