Batch Normalization 对每个小批量的数据做归一化,有效缓解了内部协变量偏移问题,让训练更快、更稳定,允许使用更大的学习率。它曾把 CNN 的训练效率提升了一个档次。
BN 的灵感来自一个观察:输入分布漂移会让训练困难。解决方法很直接——每层都把输入拉回标准分布。这种“及时校准”的思想,在任何需要长期稳定运行的系统中都值得借鉴。
## 核心要点
![图片[1]-Batch Normalization:深度学习训练的里程碑-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-10-11-6359325515_4dd7720c16_b.jpg)
图片来源:Openverse / Bob Bekian(https://www.flickr.com/photos/53771684@N04/6359325515)
1. BN 依赖批量统计,小批量时效果不稳定。
2. 它在卷积网络中效果显著,是 ResNet 成功的功臣之一。
3. 推理时使用训练期累积的统计量,行为与训练不同。
4. 序列模型更倾向用 Layer Norm 而非 BN。
![图片[2]-Batch Normalization:深度学习训练的里程碑-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-19-14-16324937697_6619876903_b.jpg)
图片来源:Openverse / tedxdcu(https://www.flickr.com/photos/128824368@N06/16324937697)
## 写在最后
以上是关于「Batch Normalization」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END














请登录后查看评论内容