学习率:训练过程中最关键的超参数

学习率决定模型每次参数更新的步长。太大会在最优解附近来回震荡甚至发散,太小则训练极慢、可能卡在局部最优。几乎所有的训练失败,最先要怀疑的就是学习率。

学习率是“欲速则不达”的算法版本。急于求成(大学习率)反而会错过最优解;过于保守(小学习率)又可能耗尽耐心与预算。找到适合自己的节奏,是训练模型也是做事的通用智慧。

## 核心要点


图片[1]-学习率:训练过程中最关键的超参数-子比笔记

图片来源:Openverse / National Institutes of Health (NIH)(https://www.flickr.com/photos/132318516@N08/40541158751)

1. 学习率与 Batch Size 存在耦合关系,需要配合调整。

2. Warmup(先小后大)+ 余弦衰减是当前主流的学习率策略。

3. Adam 等自适应优化器对学习率初始设定的容忍度更高。

4. 观察损失曲线是判断学习率是否合理的直接手段。

图片[2]-学习率:训练过程中最关键的超参数-子比笔记

图片来源:Openverse / qubodup(https://www.flickr.com/photos/21051491@N02/15204156909)

## 写在最后

以上是关于「学习率」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容