大模型的多语言能力极不均衡:英语最好,中文次之,小语种常常一塌糊涂。这不只是数据问题,也关乎 tokenizer 设计与训练资源分配。
多语言问题是 AI 公平性的一个具体侧面:英语世界的人用着更聪明的 AI,小语种用户却要忍受更差的服务。技术的不平等,最终会变成机会的不平等。改变它,需要刻意而非自然的发生。
## 核心要点
![图片[1]-多语言能力:大模型不只是英语模型-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-7-13-10606587153_231241c2b1_b.jpg)
图片来源:Openverse / Bob Mical(https://www.flickr.com/photos/51764681@N02/10606587153)
1. 训练数据中英语占比过高是根本原因。
2. 中文 tokenizer 效率低,同样内容消耗更多 token。
3. 多语言预训练与对齐能显著改善小语种表现。
4. 语言不平等会带来 AI 服务的全球不平等。
![图片[2]-多语言能力:大模型不只是英语模型-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-6-10-2691185990_e2387a0e7b_b.jpg)
图片来源:Openverse / LucasRichter(https://www.flickr.com/photos/71154423@N00/2691185990)
## 写在最后
以上是关于「多语言能力」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END













请登录后查看评论内容