Actor-Critic 同时维护两个网络:Actor 负责决策“做什么”,Critic 负责评价“做得好不好”。两者相互配合,既解决了策略梯度方差大的问题,又保持了策略方法的灵活性。
Actor-Critic 是一个非常人性的设计:行动者负责做,评价者负责反馈,双方共同进步。这不就是健康的师徒关系、甚至良好的亲密关系的模式吗?好的系统设计,往往与好的人际关系有相同的结构。
## 核心要点
![图片[1]-Actor-Critic:演员与评论家的双人舞-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-20-0-26907754647_dfe8ee7069_b-991x800.jpg)
图片来源:Openverse / yumikrum(https://www.flickr.com/photos/94725359@N06/26907754647)
1. Critic 提供基线,大幅降低策略梯度的方差。
2. A2C、A3C、SAC 都是 Actor-Critic 家族成员。
3. 它是当前主流强化学习算法的通用框架。
4. Actor-Critic 的思想也被借鉴到大模型的 RLHF 中。
![图片[2]-Actor-Critic:演员与评论家的双人舞-子比笔记](https://zibi.1ddc.com/wp-content/uploads/2026/09/ai-pool-15-13-4537273641_3f4717d6aa_b.jpg)
图片来源:Openverse / Brokentaco(https://www.flickr.com/photos/92024986@N00/4537273641)
## 写在最后
以上是关于「Actor-Critic」的科普介绍。人工智能正在快速发展,相关概念和方法也在不断演进。希望本文能帮你建立对这一主题的基本认识。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END













请登录后查看评论内容