最新模型中文Token拆分规则探索
对于最新模型,如Kimi K3和DeepSeek-V4,一个中文字符并不固定对应一个token。
常见字可能一个token对应一个字,生僻字、罕见词则可能被拆分成多个token。
中文文本token消耗效率,与模型是否针对中文优化高度相关。
1 Kimi K3
Kimi K3采用混合策略,常见词优先,并非简单按字切分。
1)常见词/短语
例如“中国”这样常见词,可能会被整体识别为单个token。
2)生僻字/罕见词
对于不常见的单字,如“夔”或词语,会被分解为多个token的组合。
3)整体估算
对于普通中文文本,官方给出估算是1个token约等于1.5到2个汉字。
2 DeepSeek-V4
DeepSeek-V4偏向单字切分,中文优化,其分词器明确针对中文进行了优化。
1)单字切分
明确信息指出,DS tokenizer对中文采用单字切分的策略,即每个汉字计为1个token。
2)更高效率
相比许多主要针对英文优化的模型,每个中文字符可能需要1.4-1.8个token。
DeepSeek-V4的效率更高,平均每个中文字符约消耗1.1个token。
官方API文档也指出,1个中文字符约等于0.6个token,这从侧面印证了其高效性。
3 总结
总而言之,对于最新的Kimi K3和DeepSeek-V4模型
1)没有“一字一Token”的固定规则
具体如何拆分,取决于字符的常见程度和模型的分词策略。
2)模型差异明显
Kimi K3会优先将常见词保留为整体,DeepSeek-V4则更倾向于将每个汉字作为独立单元。
3)估算仅供参考
无论是1 token ≈ 1.5-2个字还是1个汉字 ≈ 0.6个token,都只是针对一般情况的估算。
最准确的方法,还是使用官方提供的Token计算工具进行实测。
reference
---
kimi3主要概念
https://platform.kimi.com/docs/introduction
kimi模型推理价格说明
https://platform.kimi.com/docs/pricing/chat
DeepSeek Character Limits: Tokens, Context Window and Output Caps
https://deepseekai.guide/guides/deepseek-character-limits/#1-cache-the-static-prefix
LLM Tokenizer Efficiency Comparison, May 2026
https://presenc.ai/research/llm-tokenizer-efficiency-comparison-2026
DeepSeek-V4 混合语言 Prompt 工程:token 会计与截断策略的隐藏成本
https://deepseek.csdn.net/6a1799d8662f9a54cb77b63a.html
deepseek-tokenizer 0.3.0
更多推荐
所有评论(0)