强化学习共4篇
DQN:AI 玩游戏的起点-子比笔记

DQN:AI 玩游戏的起点

DQN 把深度卷积网络与 Q 学习结合,让 AI 直接从像素学会玩雅达利游戏,多个游戏达到人类水平。它是深度强化学习走向实用的标志性工作。 DQN 的故事最激励人心的地方在于:AI 没有人教它规则,...
admin的头像-子比笔记admin9小时前
0328
策略梯度:强化学习的另一条路-子比笔记

策略梯度:强化学习的另一条路

策略梯度不估计每个动作的价值,而是直接优化“在什么状态下该采取什么动作”的策略本身。它比基于价值的方法更适合连续动作空间,是机器人控制的常用方案。 策略梯度与基于价值的方法像两种处...
admin的头像-子比笔记admin9小时前
0207
Actor-Critic:演员与评论家的双人舞-子比笔记

Actor-Critic:演员与评论家的双人舞

Actor-Critic 同时维护两个网络:Actor 负责决策“做什么”,Critic 负责评价“做得好不好”。两者相互配合,既解决了策略梯度方差大的问题,又保持了策略方法的灵活性。 Actor-Critic 是一个非...
admin的头像-子比笔记admin9小时前
03413
强化学习:在试错中成长的 AI-子比笔记

强化学习:在试错中成长的 AI

强化学习让智能体在环境中不断行动、获得奖励或惩罚,从而学会达成目标的最优策略。它最像人类的学习方式——小孩学走路,摔了知道疼,走稳了有掌声。 强化学习最激动人心的案例是 AlphaGo:它...
admin的头像-子比笔记admin9小时前
0245