学习率决定模型每次参数更新的步长。太大会在最优解附近来回震荡甚至发散,太小则训练极慢、可能卡在局部最优。几乎所有的训练失败,最先要怀疑的就是学习率。
学习率是“欲速则不达”的算法版本。急于求成(大学习率)反而会错过最优解;过于保守(小学习率)又可能耗尽耐心与预算。找到适合自己的节奏,是训练模型也是做事的通用智慧。
## 核心要点
![图片[1]-学习率:训练过程中最关键的超参数-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-9-3-40541158751_71069cb6b1_b.jpg)
图片来源:Openverse / National Institutes of Health (NIH)(https://www.flickr.com/photos/132318516@N08/40541158751)
1. 学习率与 Batch Size 存在耦合关系,需要配合调整。
2. Warmup(先小后大)+ 余弦衰减是当前主流的学习率策略。
3. Adam 等自适应优化器对学习率初始设定的容忍度更高。
4. 观察损失曲线是判断学习率是否合理的直接手段。
![图片[2]-学习率:训练过程中最关键的超参数-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-16-8-15204156909_41106382af_b.jpg)
图片来源:Openverse / qubodup(https://www.flickr.com/photos/21051491@N02/15204156909)
## 写在最后
以上是关于「学习率」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END















请登录后查看评论内容