策略梯度不估计每个动作的价值,而是直接优化“在什么状态下该采取什么动作”的策略本身。它比基于价值的方法更适合连续动作空间,是机器人控制的常用方案。
策略梯度与基于价值的方法像两种处世哲学:一种不断评估每个选择的得失再行动,一种直接打磨行动本身。没有绝对的对错,只有与场景的匹配——控制领域的连续性需求,让策略方法成为了更自然的选择。
## 核心要点
![图片[1]-策略梯度:强化学习的另一条路-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-15-1-4459639283_0d8daea5f1_b.jpg)
图片来源:Openverse / Trey Ratcliff(https://www.flickr.com/photos/95572727@N00/4459639283)
1. 策略梯度直接对策略参数求导,数学上优雅简洁。
2. 它天然支持连续动作,比如机械臂的关节角度。
3. REINFORCE 是最基础的版本,方差大需用基线改进。
4. PPO 是当前最流行的策略梯度变体,训练稳定。
![图片[2]-策略梯度:强化学习的另一条路-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-12-12-6882421495_d8672b12a3_b.jpg)
图片来源:Openverse / wstryder(https://www.flickr.com/photos/36514345@N00/6882421495)
## 写在最后
以上是关于「策略梯度」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END














请登录后查看评论内容