Token:大模型的“最小阅读单位”

Token 是大模型处理文本的最小单位,可能是一个字、一个词或一个词根。中文一句话通常被切成多个 token,英文一个单词可能是 1-3 个 token。模型按 token 计费、按 token 计数上下文。

理解 token 对控制成本至关重要。写提示词时去掉冗余的客套话、合并重复请求,能显著降低 API 费用。对于长文档处理,先压缩摘要再发给模型,是常见的省钱技巧。

## 核心要点


图片[1]-Token:大模型的“最小阅读单位”-子比笔记

图片来源:Openverse / Rain Rabbit(https://www.flickr.com/photos/37996583811@N01/8895960092)

1. “我爱人工智能”可能被切成“我/爱/人工/智能”四个 token。

2. API 计费按输入+输出的 token 总量计算,是成本控制的抓手。

3. 不同模型的分词器不同,同一句话的 token 数可能不同。

4. 估算经验:中文 1 字 ≈ 1-2 token,英文 1 单词 ≈ 1.3 token。

图片[2]-Token:大模型的“最小阅读单位”-子比笔记

图片来源:Openverse / Electrolux Design Lab(https://www.flickr.com/photos/41362523@N02/3811899536)

## 写在最后

以上是关于「Token」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞7 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容