K 均值聚类:数据自己分小组

K 均值把数据分成 K 个簇:先随机放 K 个中心点,每个数据归入最近的中心,然后中心移到本簇数据的平均位置,反复迭代直到稳定。它是聚类算法中最常用的一种。

K 均值的迭代过程有种朴素的秩序感:先归类,再调整,再归类,直到各方满意。这其实是很多组织迭代的缩影——先有个粗框架,在实践中不断校准,最终收敛到一个稳定结构。

## 核心要点


图片[1]-K 均值聚类:数据自己分小组-子比笔记

图片来源:Openverse / Ryan Somma(https://www.flickr.com/photos/14405058@N08/2480411053)

1. K 均值必须预先指定簇数 K,这需要业务先验或多次尝试。

2. 它对球形簇效果好,对形状不规则的数据表现较差。

3. 初始中心点的选择会影响最终结果,K-means++ 改进了这一点。

4. 客户分群、图像压缩、异常检测都是它的经典应用。

图片[2]-K 均值聚类:数据自己分小组-子比笔记

图片来源:Openverse / Chase Alias(https://www.flickr.com/photos/54184177@N03/6149064854)

## 写在最后

以上是关于「K 均值聚类」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞10 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容