层归一化对每一层的激活值做标准化,防止数值在深层传递中爆炸或消失。它配合残差连接,让深层 Transformer 能够稳定训练。
层归一化的作用可以类比为社会治理中的“调控”:任由各种信号自由放大,系统迟早崩溃;适时地把偏离的值拉回合理区间,系统才能长期稳定运行。深奥的算法,常常对应朴素的道理。
## 核心要点
![图片[1]-层归一化:稳定训练的幕后功臣-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-20-5-23931679274_f849069d04_b.jpg)
图片来源:Openverse / World Economic Forum(https://www.flickr.com/photos/15237218@N00/23931679274)
1. Layer Norm 沿特征维度归一化,适合序列模型。
2. RMS Norm 是简化版,计算更快,被多数新模型采用。
3. Pre-Norm(先归一化后计算)在深层模型中更稳定。
4. 归一化层的位置选择影响训练稳定性,是架构设计的细节。
![图片[2]-层归一化:稳定训练的幕后功臣-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-2-5-12107349526_a739187b4e_b.jpg)
图片来源:Openverse / marco_ask(https://www.flickr.com/photos/81277273@N00/12107349526)
## 写在最后
以上是关于「层归一化」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END














请登录后查看评论内容