大模型Token学习指南
做过大模型后端开发的人几乎都踩过Token的坑估算1000字的文档刚好塞进32K上下文结果调用直接被截断按通用公式算好的API成本月底账单直接超了50%同一段代码在Qwen里Token数明明够用换到LLaMA里直接触发长度超限。本质上很多开发者对Token的认知还停留在“1个汉字约等于2个Token”的粗略估算阶段完全没意识到不同模型的分词器差异才是Token相关问题的核心根源。今天我们就从最基础的换算规则讲起一步步拆解到跨模型精准计数的工程实现彻底把Token这件事搞透。1. 入门 — Token的基础换算逻辑大模型并不直接 读文字它处理的基本单位是Token词元。Token是分词器Tokenizer对文本拆分后的最小语义单元它既不是单个汉字也不是单个英文单词。输入文本我爱自然语言处理 ↓ 分词器切分 Token 序列[我, 爱, 自然, 语言, 处理] 关键认知Token 不是字也不是词而是介于两者之间的 子词Subword 单位。行业通用的经验换算规律适合日常快速预估场景老一代英文优化分词器代表模型GPT-3.5/4 早期版本cl100k_base中文场景1 个汉字约等于 1.5~2 个 Token1 个 Token 约对应 0.5~0.7 个汉字1000 个汉字大约消耗 1500~2000 个 Token。英文场景1 个英文单词约等于 1.2~1.3 个 Token1 个 Token 约对应 0.75~0.85 个英文单词1000 个英文单词大约消耗 1200~1300 个 Token。新一代多语言优化分词器代表模型GPT-4o、Qwen、DeepSeek中文场景1 个汉字约等于 0.6~1 个 Token1 个 Token 约对应 1~1.7 个汉字1000 个汉字大约消耗 600~1000 个 Token。英文场景1 个英文单词约等于 0.7~1 个 Token1 个 Token 约对应 1~1.4 个英文单词1000 个英文单词大约消耗 700~1000 个 Token。特殊字符标点、数字、换行符常常单独占用 1 个 Token中文标点也常单独占 1 个 Token英文空格通常与后一个词合并代码、专业术语、生僻字、emoji 的 Token 消耗通常高于普通文本但整体压缩率通常略好于老一代英文优化分词器。注意上面所有的换算比例都只是快速估算用的经验值绝对不能直接用于生产环境的成本核算和上下文边界判断。2. 进阶 — 不同模型的分词器差异才是Token数不同的核心原因为什么同一段1000字的中文文本在GPT-4里要1800个Token在Qwen3里只要1000个Token根本原因是不同大模型的自研分词器底层拆分规则完全不一样。目前主流的分词算法主要分三类不同算法的Token拆分逻辑天差地别① BPEByte Pair Encoding字节对编码代表模型GPT 系列、LLaMA 系列、Claude核心思想从最基础的字节开始反复合并出现频率最高的相邻字节对直到词表达到目标大小。初始h e l l o h e l l o ↓ ll 出现2次合并 h e ll o h e ll o ↓ he 出现2次合并 he ll o he ll o ↓ hell 出现2次合并 hello hello特点词表通常 50K 左右GPT-3 为 50257对中文不友好因为中文字符多每个字可能占多个字节导致中文 token 膨胀未登录词会被拆成字节级保证任何文本都能编码② WordPiece代表模型BERT、Claude早期版本核心思想与 BPE 类似但合并依据不是 频率最高而是 能最大化语言模型似然的对。判断是否合并 un likely 合并前 P(un) × P(likely) 合并后 P(unlikely) 如果合并后似然提升更大 → 合并特点用##前缀标记子词如un##likely词表通常 30K 左右对中文同样按字或子词切分③ Unigram / SentencePiece代表模型T5、ALBERT、部分多语言模型核心思想先构建一个大词表然后反复移除 对语言模型损失影响最小 的词直到词表达标。特点概率化分词同一文本可能有多种切法直接基于 Unicode 字符不依赖预分词多语言场景表现好④ 中文专属字级分词代表模型部分中文大模型如早期的 ERNIE核心思想直接以单个汉字为基本单位。特点1 个汉字 1 个 token换算最简单但词表利用率低序列更长举个实际例子文本13 个字大语言模型的分词器很重要模型分词器类型大致 Token 数可能的切分GPT-4 (cl100k_base)BPE10-13大语言模型的分词器很重要LLaMA-2BPE (SentencePiece)13-18每个字可能独立成 tokenClaudeBPE10-14类似 GPTQwen通义千问BPE8-12中文词表优化常见词合并更多DeepSeekBPE8-12中文优化差异来源词表大小不同GPT-3 是 50KLLaMA 是 32KQwen 是 151K—— 词表越大中文常见词越可能被合并成 1 个 token训练语料不同中文语料占比高的模型中文词合并更充分分词算法细节不同即使都是 BPE合并顺序、终止条件也不同3. 如何准确计算不同模型的 Token 数任何 1 token X 个字 的换算公式都是近似值。要精确统计必须用对应模型官方提供的专属分词器来统计绝对不能跨模型混用。方法一使用官方 Tokenizer 库OpenAI 模型GPT-3.5/4、o1官方提供tiktoken库是目前最成熟的分词统计工具支持所有GPT-3.5/4/4o模型。示例import tiktoken # 选择对应模型的编码 enc tiktoken.encoding_for_model(gpt-4) # 或手动指定enc tiktoken.get_encoding(cl100k_base) text 大语言模型的分词器很重要 tokens enc.encode(text) print(fToken 数: {len(tokens)}) print(fToken 列表: {tokens}) print(f解码回看: {[enc.decode([t]) for t in tokens]})常见编码对照表编码名称适用模型cl100k_baseGPT-4、GPT-3.5-turbo、text-embedding-ada-002o200k_baseGPT-4o、o1 系列p50k_basetext-davinci-003、davincir50k_base早期 GPT-3 模型LLaMA / HuggingFace 模型from transformers import AutoTokenizer # LLaMA-2 tokenizer AutoTokenizer.from_pretrained(meta-llama/Llama-2-7b-hf) # Qwen tokenizer AutoTokenizer.from_pretrained(Qwen/Qwen2-7B) # DeepSeek tokenizer AutoTokenizer.from_pretrained(deepseek-ai/deepseek-llm-7b-base) text 大语言模型的分词器很重要 tokens tokenizer.encode(text) print(fToken 数: {len(tokens)})Anthropic Claudefrom anthropic import Anthropic client Anthropic() text 大语言模型的分词器很重要 token_count client.count_tokens(text) print(fToken 数: {token_count})方法二在线工具工具支持模型地址OpenAI TokenizerGPT 系列platform.openai.com/tokenizerHuggingFace Tokenizer各类开源模型huggingface.co/spaces各模型官方文档对应模型查看 API 文档中的 token 计数接口方法三API 返回值大多数模型 API 的返回结果中会直接包含 token 使用量{ usage: { prompt_tokens: 256, completion_tokens: 128, total_tokens: 384 } } # 这是最准确的数字因为它就是模型实际处理时的计数。跨模型 Token 估算速查表不要求精确模型系列中文经验值字 /token英文经验值词 /tokenGPT-4 / GPT-3.50.6-0.8 字 /token0.75 词 /tokenLLaMA 系列0.5-0.7 字 /token0.7 词 /tokenQwen / DeepSeek0.8-1.2 字 /token0.8 词 /tokenClaude0.6-0.8 字 /token0.75 词 /token中文优化的模型Qwen、DeepSeek、GLM 等通常中文 token 效率更高因为词表中中文词占比更大。4. 总结与最佳实践核心要点Token 是子词单位不是字也不是词1 token 对应多少字没有固定答案中文比英文更耗 Token通常 1 个中文字 ≈ 1-1.5 个 token不同模型分词器差异巨大同一段文本 token 数可能差 2 倍中文优化模型Qwen、DeepSeek、GLM 等中文 token 效率更高

相关新闻

个人微信API二次开发:收到微信图片后怎么保存和识别?

个人微信API二次开发:收到微信图片后怎么保存和识别?

做微信客服或者客户管理系统时,图片也是一种很常见的消息。 客户可能发送商品截图、付款凭证、故障截图,也可能直接发一张产品照片。如果系统只保存文字消息,这些图片信息就很容易遗漏。 先确认回调里有哪些数据 收到图片消息后&#xff0…

2026/10/11 5:26:42 阅读更多 →
企业级大数据可视化平台架构设计与性能优化实践

企业级大数据可视化平台架构设计与性能优化实践

1. 从一张“慢得想砸电脑”的大屏说起先讲个我亲身踩过的例子。某个客户找到我们,说他们内部的经营分析大屏打开一次要等三十秒,图表转圈转到一半直接白屏,领导在旁边等着看数据,气氛要多尴尬有多尴尬。当时我接手之后第一件事不是…

2026/10/11 5:25:42 阅读更多 →
给Claude装上外挂记忆:claude-mem跨会话上下文管理实战

给Claude装上外挂记忆:claude-mem跨会话上下文管理实战

用Claude的时候,最烦人的不是它回答错,而是它“记性差”。你上午跟它敲定的术语约定,下午新开一个对话它就忘得干干净净。我一度以为这是模型能力的上限,后来被身边一个开发者朋友点醒:与其指望AI自带长期记忆&#xf…

2026/10/11 5:25:42 阅读更多 →

最新新闻

基于YOLO的焊缝缺陷检测毕设方案:数据集、训练与推理全流程拆解

基于YOLO的焊缝缺陷检测毕设方案:数据集、训练与推理全流程拆解

简介:这份资源面向深度学习与计算机视觉方向的毕业设计、课程设计及期末大作业需求者,聚焦工业焊缝缺陷的自动识别与定位问题。方案以YOLO算法为核心,将目标检测转化为回归任务,实现对裂纹、气孔、未熔合、未焊透等缺陷的快速预测…

2026/10/11 7:02:35 阅读更多 →
C#部署YOLOv8-OBB:旋转框解析与OpenVINO推理实战

C#部署YOLOv8-OBB:旋转框解析与OpenVINO推理实战

简介:这份C#源码工程基于Intel OpenVINO工具包实现Yolov8-OBB旋转目标检测,面向需要在文档识别、条码扫描或交通标志检测中定位倾斜目标的开发者,解决普通矩形边界框难以表达旋转物体方向的问题。整个压缩包共337个文件,大小约307…

2026/10/11 7:02:35 阅读更多 →
AnyPS5 技术拆解:输入设备泛化与协议桥接实战

AnyPS5 技术拆解:输入设备泛化与协议桥接实战

1. 从“AnyPS5”这个名字说起:它到底想解决什么问题第一次看到“AnyPS5”这个标题,我脑子里冒出来的第一个念头是:这大概率是一个围绕 PlayStation 5 生态做“泛化接入”或“跨端能力扩展”的项目。为什么这么判断?因为“Any”这个…

2026/10/11 7:02:35 阅读更多 →
DLSS5与多帧插值协同实现144Hz无闪帧生成

DLSS5与多帧插值协同实现144Hz无闪帧生成

1. 这个“6倍帧生成DLSS5”到底在解决什么真实痛点?先说结论:这不是营销噱头,而是针对《原神》这类高画质、高动态场景下,GPU瓶颈与显示器刷新率不匹配这一长期被忽视的底层矛盾,所给出的一套可落地的工程化解法。我最…

2026/10/11 7:02:35 阅读更多 →
《执行控制工程》作者手记 04|当所有条件都已成立,谁真正决定现实

《执行控制工程》作者手记 04|当所有条件都已成立,谁真正决定现实

本文是《执行控制工程》(Execution Control Engineering)的作者手记。 它不是书籍正文的摘要或重写,而是围绕本章问题、工程背景与写作之后的进一步思考。 在过去的软件工程实践中,我们已经建立了许多用于管理权力的机制。身份认证…

2026/10/11 7:02:35 阅读更多 →
GitHub 打不开怎么排查:先分清是 DNS 污染还是连接被重置,处理方式完全不同

GitHub 打不开怎么排查:先分清是 DNS 污染还是连接被重置,处理方式完全不同

本文首发于 CSDN,转载请注明出处。 先说结论:「GitHub 打不开」不是一个故障,而是至少四类完全不同的故障——DNS 解析不出地址、TCP 连接超时、连接被中间设备重置、TLS 握手被打断。四种故障的表象都是「转圈然后失败」,但报错原…

2026/10/11 7:01:35 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →