做过大模型后端开发的人几乎都踩过Token的坑估算1000字的文档刚好塞进32K上下文结果调用直接被截断按通用公式算好的API成本月底账单直接超了50%同一段代码在Qwen里Token数明明够用换到LLaMA里直接触发长度超限。本质上很多开发者对Token的认知还停留在“1个汉字约等于2个Token”的粗略估算阶段完全没意识到不同模型的分词器差异才是Token相关问题的核心根源。今天我们就从最基础的换算规则讲起一步步拆解到跨模型精准计数的工程实现彻底把Token这件事搞透。1. 入门 — Token的基础换算逻辑大模型并不直接 读文字它处理的基本单位是Token词元。Token是分词器Tokenizer对文本拆分后的最小语义单元它既不是单个汉字也不是单个英文单词。输入文本我爱自然语言处理 ↓ 分词器切分 Token 序列[我, 爱, 自然, 语言, 处理] 关键认知Token 不是字也不是词而是介于两者之间的 子词Subword 单位。行业通用的经验换算规律适合日常快速预估场景老一代英文优化分词器代表模型GPT-3.5/4 早期版本cl100k_base中文场景1 个汉字约等于 1.5~2 个 Token1 个 Token 约对应 0.5~0.7 个汉字1000 个汉字大约消耗 1500~2000 个 Token。英文场景1 个英文单词约等于 1.2~1.3 个 Token1 个 Token 约对应 0.75~0.85 个英文单词1000 个英文单词大约消耗 1200~1300 个 Token。新一代多语言优化分词器代表模型GPT-4o、Qwen、DeepSeek中文场景1 个汉字约等于 0.6~1 个 Token1 个 Token 约对应 1~1.7 个汉字1000 个汉字大约消耗 600~1000 个 Token。英文场景1 个英文单词约等于 0.7~1 个 Token1 个 Token 约对应 1~1.4 个英文单词1000 个英文单词大约消耗 700~1000 个 Token。特殊字符标点、数字、换行符常常单独占用 1 个 Token中文标点也常单独占 1 个 Token英文空格通常与后一个词合并代码、专业术语、生僻字、emoji 的 Token 消耗通常高于普通文本但整体压缩率通常略好于老一代英文优化分词器。注意上面所有的换算比例都只是快速估算用的经验值绝对不能直接用于生产环境的成本核算和上下文边界判断。2. 进阶 — 不同模型的分词器差异才是Token数不同的核心原因为什么同一段1000字的中文文本在GPT-4里要1800个Token在Qwen3里只要1000个Token根本原因是不同大模型的自研分词器底层拆分规则完全不一样。目前主流的分词算法主要分三类不同算法的Token拆分逻辑天差地别① BPEByte Pair Encoding字节对编码代表模型GPT 系列、LLaMA 系列、Claude核心思想从最基础的字节开始反复合并出现频率最高的相邻字节对直到词表达到目标大小。初始h e l l o h e l l o ↓ ll 出现2次合并 h e ll o h e ll o ↓ he 出现2次合并 he ll o he ll o ↓ hell 出现2次合并 hello hello特点词表通常 50K 左右GPT-3 为 50257对中文不友好因为中文字符多每个字可能占多个字节导致中文 token 膨胀未登录词会被拆成字节级保证任何文本都能编码② WordPiece代表模型BERT、Claude早期版本核心思想与 BPE 类似但合并依据不是 频率最高而是 能最大化语言模型似然的对。判断是否合并 un likely 合并前 P(un) × P(likely) 合并后 P(unlikely) 如果合并后似然提升更大 → 合并特点用##前缀标记子词如un##likely词表通常 30K 左右对中文同样按字或子词切分③ Unigram / SentencePiece代表模型T5、ALBERT、部分多语言模型核心思想先构建一个大词表然后反复移除 对语言模型损失影响最小 的词直到词表达标。特点概率化分词同一文本可能有多种切法直接基于 Unicode 字符不依赖预分词多语言场景表现好④ 中文专属字级分词代表模型部分中文大模型如早期的 ERNIE核心思想直接以单个汉字为基本单位。特点1 个汉字 1 个 token换算最简单但词表利用率低序列更长举个实际例子文本13 个字大语言模型的分词器很重要模型分词器类型大致 Token 数可能的切分GPT-4 (cl100k_base)BPE10-13大语言模型的分词器很重要LLaMA-2BPE (SentencePiece)13-18每个字可能独立成 tokenClaudeBPE10-14类似 GPTQwen通义千问BPE8-12中文词表优化常见词合并更多DeepSeekBPE8-12中文优化差异来源词表大小不同GPT-3 是 50KLLaMA 是 32KQwen 是 151K—— 词表越大中文常见词越可能被合并成 1 个 token训练语料不同中文语料占比高的模型中文词合并更充分分词算法细节不同即使都是 BPE合并顺序、终止条件也不同3. 如何准确计算不同模型的 Token 数任何 1 token X 个字 的换算公式都是近似值。要精确统计必须用对应模型官方提供的专属分词器来统计绝对不能跨模型混用。方法一使用官方 Tokenizer 库OpenAI 模型GPT-3.5/4、o1官方提供tiktoken库是目前最成熟的分词统计工具支持所有GPT-3.5/4/4o模型。示例import tiktoken # 选择对应模型的编码 enc tiktoken.encoding_for_model(gpt-4) # 或手动指定enc tiktoken.get_encoding(cl100k_base) text 大语言模型的分词器很重要 tokens enc.encode(text) print(fToken 数: {len(tokens)}) print(fToken 列表: {tokens}) print(f解码回看: {[enc.decode([t]) for t in tokens]})常见编码对照表编码名称适用模型cl100k_baseGPT-4、GPT-3.5-turbo、text-embedding-ada-002o200k_baseGPT-4o、o1 系列p50k_basetext-davinci-003、davincir50k_base早期 GPT-3 模型LLaMA / HuggingFace 模型from transformers import AutoTokenizer # LLaMA-2 tokenizer AutoTokenizer.from_pretrained(meta-llama/Llama-2-7b-hf) # Qwen tokenizer AutoTokenizer.from_pretrained(Qwen/Qwen2-7B) # DeepSeek tokenizer AutoTokenizer.from_pretrained(deepseek-ai/deepseek-llm-7b-base) text 大语言模型的分词器很重要 tokens tokenizer.encode(text) print(fToken 数: {len(tokens)})Anthropic Claudefrom anthropic import Anthropic client Anthropic() text 大语言模型的分词器很重要 token_count client.count_tokens(text) print(fToken 数: {token_count})方法二在线工具工具支持模型地址OpenAI TokenizerGPT 系列platform.openai.com/tokenizerHuggingFace Tokenizer各类开源模型huggingface.co/spaces各模型官方文档对应模型查看 API 文档中的 token 计数接口方法三API 返回值大多数模型 API 的返回结果中会直接包含 token 使用量{ usage: { prompt_tokens: 256, completion_tokens: 128, total_tokens: 384 } } # 这是最准确的数字因为它就是模型实际处理时的计数。跨模型 Token 估算速查表不要求精确模型系列中文经验值字 /token英文经验值词 /tokenGPT-4 / GPT-3.50.6-0.8 字 /token0.75 词 /tokenLLaMA 系列0.5-0.7 字 /token0.7 词 /tokenQwen / DeepSeek0.8-1.2 字 /token0.8 词 /tokenClaude0.6-0.8 字 /token0.75 词 /token中文优化的模型Qwen、DeepSeek、GLM 等通常中文 token 效率更高因为词表中中文词占比更大。4. 总结与最佳实践核心要点Token 是子词单位不是字也不是词1 token 对应多少字没有固定答案中文比英文更耗 Token通常 1 个中文字 ≈ 1-1.5 个 token不同模型分词器差异巨大同一段文本 token 数可能差 2 倍中文优化模型Qwen、DeepSeek、GLM 等中文 token 效率更高