Skip to content
所有標籤

#actor-critic

1 篇文章

Berkeley CS285 L5–10:Policy Gradient、Actor-Critic、DQN 與 SAC

L5–10 用 policy-based 與 value-based 兩條路建立深度 RL 核心;HW2 可用 CPU,HW3 的 Atari 與 HalfCheetah 則約需數小時 GPU。