分词器把连续文本切成模型能处理的 token 序列。它决定了模型如何“看待”语言,直接影响效率、多语言能力与代码处理能力。小小的分词器,其实深刻影响模型表现。
分词器是一个被严重低估的组件。它像是模型的“眼睛”,决定了世界被切成什么样子的碎片喂给它。同样的现实,经过不同的切分方式,会塑造出完全不同的理解方式。 Representation matters,从最底层就是。
## 核心要点
![图片[1]-分词器(Tokenizer):模型如何切分语言-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-3-9-6791115249_0bedfc6acf_b.jpg)
图片来源:Openverse / NYC Media Lab(https://www.flickr.com/photos/67540051@N03/6791115249)
1. BPE 是最主流的分词算法:频率驱动地合并常见字符对。
2. 中文分词常出现一个字一个 token 的低效情况。
3. 分词器没见过的词会被拆成碎片,影响理解。
4. 代码处理要求分词器理解缩进与符号结构。
![图片[2]-分词器(Tokenizer):模型如何切分语言-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-18-6-54250083560_7ca93997f9_b.jpg)
图片来源:Openverse / 紅色死神(https://www.flickr.com/photos/8873441@N06/54250083560)
## 写在最后
以上是关于「分词器(Tokenizer)」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END












请登录后查看评论内容