优化器决定了如何根据梯度更新参数。SGD 是最基础的,Adam 引入了动量(累积历史方向)与自适应学习率(每个参数有自己的步长),成为深度学习时代使用最广泛的优化器。
优化器的演进史是一部“让算法更体贴人”的历史:从需要小心翼翼调参的 SGD,到开箱即用的 Adam,工程师把越来越多的经验固化进了工具。技术成熟的标志,就是让复杂变得平凡。
## 核心要点
![图片[1]-优化器:Adam 为什么成为主流-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-11-2-7880912598_389d98a505_b.jpg)
图片来源:Openverse / cesarharada.com(https://www.flickr.com/photos/27703797@N06/7880912598)
1. Adam 几乎是“默认能用”的优化器,特别适合快速实验。
2. SGD 配合精细调参在图像任务上常常略优于 Adam。
3. AdamW 修正了权重衰减的实现,是大模型训练的标配。
4. 没有万能优化器,根据任务特点选择才是专业做法。
![图片[2]-优化器:Adam 为什么成为主流-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-2-7-9172328634_e36783f3d5_b.jpg)
图片来源:Openverse / Thomás(https://www.flickr.com/photos/21862121@N04/9172328634)
## 写在最后
以上是关于「优化器」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END















请登录后查看评论内容