Skip to content
所有標籤

#reinforce

1 篇文章

策略梯度及其變體:REINFORCE 與 PPO

第 21 章從 log-derivative trick 推出 REINFORCE,再用 reward-to-go、baseline 與 PPO clipping 控制 policy-gradient 的高變異與更新幅度。