特征缩放:别让量纲毁了模型

特征缩放把不同量纲的特征拉到同一尺度:收入几十万、年龄几十岁,不做处理模型会被大数值特征主导。它是数据预处理的标准动作,直接影响很多模型的效果。

特征缩放的背后是公平原则:如果一种声音因为嗓门大就被模型当作最重要,那这个模型的判断必然失真。把所有人请到同一个尺度上对话,才能听到真正有价值的信号。

## 核心要点


图片[1]-特征缩放:别让量纲毁了模型-子比笔记

图片来源:Openverse / Unknown(https://www.rawpixel.com/image/5926824/photo-image-background-public-domain-pink)

1. 标准化(均值0方差1)和归一化(缩到0-1)是两种常见做法。

2. 基于距离的算法(KNN、SVM、K 均值)对量纲极其敏感。

3. 树模型对特征缩放不敏感,可以不做。

4. 缩放参数必须从训练集算,不能被测试集污染。

图片[2]-特征缩放:别让量纲毁了模型-子比笔记

图片来源:Openverse / jurvetson(https://www.flickr.com/photos/44124348109@N01/49296120841)

## 写在最后

以上是关于「特征缩放」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞12 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容