Actor-Critic:演员与评论家的双人舞

Actor-Critic 同时维护两个网络:Actor 负责决策“做什么”,Critic 负责评价“做得好不好”。两者相互配合,既解决了策略梯度方差大的问题,又保持了策略方法的灵活性。

Actor-Critic 是一个非常人性的设计:行动者负责做,评价者负责反馈,双方共同进步。这不就是健康的师徒关系、甚至良好的亲密关系的模式吗?好的系统设计,往往与好的人际关系有相同的结构。

## 核心要点


图片[1]-Actor-Critic:演员与评论家的双人舞-子比笔记

图片来源:Openverse / yumikrum(https://www.flickr.com/photos/94725359@N06/26907754647)

1. Critic 提供基线,大幅降低策略梯度的方差。

2. A2C、A3C、SAC 都是 Actor-Critic 家族成员。

3. 它是当前主流强化学习算法的通用框架。

4. Actor-Critic 的思想也被借鉴到大模型的 RLHF 中。

图片[2]-Actor-Critic:演员与评论家的双人舞-子比笔记

图片来源:Openverse / Brokentaco(https://www.flickr.com/photos/92024986@N00/4537273641)

## 写在最后

以上是关于「Actor-Critic」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。

© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    请登录后查看评论内容