中文分词:比英文难十倍的第一步

英文单词间有空格天然分隔,中文则连成一片,必须先切词。“乒乓球拍卖完了”可以切出完全不同的意思。中文分词是中文 NLP 的第一道门槛,也是绕不开的基础。

中文分词的困难源于一个根本事实:汉语书写时不标词界,意义本身要靠上下文恢复。这让中文处理天然更依赖“理解”而非“切分”。语言塑造思维方式,在算法层面也能看到痕迹。

## 核心要点


图片[1]-中文分词:比英文难十倍的第一步-子比笔记

图片来源:Openverse / playful.geometer(https://www.flickr.com/photos/24888685@N08/6879658508)

1. 歧义切分、新词识别、专有名词是三大难点。

2. 统计模型(HMM、CRF)曾统治这个领域。

3. BERT 等预训练模型把分词做到了接近天花板。

4. 现代大模型用子词切词,某种程度上绕过了传统分词问题。

图片[2]-中文分词:比英文难十倍的第一步-子比笔记

图片来源:Openverse / brewbooks(https://www.flickr.com/photos/93452909@N00/2352002987)

## 写在最后

以上是关于「中文分词」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容