Skip to content
所有標籤

#ppo

2 篇文章

LLM 推理:思維鏈與長推理 RLVR

第 18 章把 LLM 推理拆成兩個槓桿:推論時用思維鏈增加計算,訓練時用可驗證獎勵與 policy gradient 學出長推理行為。

策略梯度及其變體:REINFORCE 與 PPO

第 21 章從 log-derivative trick 推出 REINFORCE,再用 reward-to-go、baseline 與 PPO clipping 控制 policy-gradient 的高變異與更新幅度。