Skip to content
所有標籤

#deepseek-r1

1 篇文章

CS224N 第 12 講:Decoding、DeepSeek-R1 與推理訓練

第 12 講先證明輸出策略不是小細節:greedy、beam 與 sampling 會產生不同文字;再由 R1-Zero/R1 走進 PPO、GRPO、DAPO,最後追問長推理何時真的有用。