策略梯度:强化学习的另一条路

策略梯度不估计每个动作的价值,而是直接优化“在什么状态下该采取什么动作”的策略本身。它比基于价值的方法更适合连续动作空间,是机器人控制的常用方案。

策略梯度与基于价值的方法像两种处世哲学:一种不断评估每个选择的得失再行动,一种直接打磨行动本身。没有绝对的对错,只有与场景的匹配——控制领域的连续性需求,让策略方法成为了更自然的选择。

## 核心要点


图片[1]-策略梯度:强化学习的另一条路-子比笔记

图片来源:Openverse / Trey Ratcliff(https://www.flickr.com/photos/95572727@N00/4459639283)

1. 策略梯度直接对策略参数求导,数学上优雅简洁。

2. 它天然支持连续动作,比如机械臂的关节角度。

3. REINFORCE 是最基础的版本,方差大需用基线改进。

4. PPO 是当前最流行的策略梯度变体,训练稳定。

图片[2]-策略梯度:强化学习的另一条路-子比笔记

图片来源:Openverse / wstryder(https://www.flickr.com/photos/36514345@N00/6882421495)

## 写在最后

以上是关于「策略梯度」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞7 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容