ai deep-dive Stanford CS229 導讀 2026年8月22日 策略梯度及其變體:REINFORCE 與 PPO 第 21 章從 log-derivative trick 推出 REINFORCE,再用 reward-to-go、baseline 與 PPO clipping 控制 policy-gradient 的高變異與更新幅度。 #cs229#policy-gradient#reinforce#ppo#reinforcement-learning