分词器(Tokenizer):模型如何切分语言

分词器把连续文本切成模型能处理的 token 序列。它决定了模型如何“看待”语言,直接影响效率、多语言能力与代码处理能力。小小的分词器,其实深刻影响模型表现。

分词器是一个被严重低估的组件。它像是模型的“眼睛”,决定了世界被切成什么样子的碎片喂给它。同样的现实,经过不同的切分方式,会塑造出完全不同的理解方式。 Representation matters,从最底层就是。

## 核心要点


图片[1]-分词器(Tokenizer):模型如何切分语言-子比笔记

图片来源:Openverse / NYC Media Lab(https://www.flickr.com/photos/67540051@N03/6791115249)

1. BPE 是最主流的分词算法:频率驱动地合并常见字符对。

2. 中文分词常出现一个字一个 token 的低效情况。

3. 分词器没见过的词会被拆成碎片,影响理解。

4. 代码处理要求分词器理解缩进与符号结构。

图片[2]-分词器(Tokenizer):模型如何切分语言-子比笔记

图片来源:Openverse / 紅色死神(https://www.flickr.com/photos/8873441@N06/54250083560)

## 写在最后

以上是关于「分词器(Tokenizer)」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容