LLM 推理:思維鏈與長推理 RLVR
第 18 章把 LLM 推理拆成兩個槓桿:推論時用思維鏈增加計算,訓練時用可驗證獎勵與 policy gradient 學出長推理行為。
第 18 章把 LLM 推理拆成兩個槓桿:推論時用思維鏈增加計算,訓練時用可驗證獎勵與 policy gradient 學出長推理行為。
第 21 章從 log-derivative trick 推出 REINFORCE,再用 reward-to-go、baseline 與 PPO clipping 控制 policy-gradient 的高變異與更新幅度。