ai deep-dive Stanford CS224N 導讀 2026年8月22日 CS224N 第 12 講:Decoding、DeepSeek-R1 與推理訓練 第 12 講先證明輸出策略不是小細節:greedy、beam 與 sampling 會產生不同文字;再由 R1-Zero/R1 走進 PPO、GRPO、DAPO,最後追問長推理何時真的有用。 #cs224n#reasoning#deepseek-r1#reinforcement-learning#stanford