Skip to content

CS336 Lecture 16:RLVR 用可驗證獎勵擴大推理,但 GRPO 不是免費的 PPO

2026年8月22日 1 分鐘
TL;DR 第十六講從 PPO 走到 GRPO 與 RLVR:數學、程式碼和環境結果提供可規模化 reward,避開一般偏好模型的部分 overoptimization;但 group-normalized advantage 會引入難度與長度偏差,rollout infrastructure 也成為主要成本。
目錄
  1. PPO 在語言模型裡有很多活動零件
  2. GRPO 拿 group statistics 取代 value model
  3. Verifier 改善 reward,沒有消除 reward hacking
  4. DeepSeek-R1 展示 cold start、RL 與 distillation
  5. Curriculum 與 test-time compute 是同一條軸
  6. Agentic RL 把 verifier 擴到環境
  7. 一份可靠的 RLVR 實驗
  8. 材料完整度
  9. 參考資料

🌏 English version

本篇對應 CS336 Spring 2026 Lecture 16: Reinforcement Learning from Verifiable Rewards,2026 年 5 月 20 日由 Tatsunori Hashimoto 主講。主要來源是官方 lecture_16.pdf

Lecture 15 的 RLHF 依賴人類或模型偏好,reward proxy 容易被持續最佳化到失真。RLVR 把範圍縮到有可靠 verifier 的任務:答案可由數學規則、unit tests、compiler 或環境結果判斷。Reward 較難被風格取巧,也能大量自動產生。

PPO 在語言模型裡有很多活動零件

PPO 從 current policy 取樣 trajectories,以 reward 與 value model 算 advantages,再用 clipped objective 更新。語言模型實務還會加入 per-token KL penalty,限制新 policy 離 reference 太遠;最後 token 收 task reward,前面 tokens 透過 advantage 接收 credit。

Rollout、reward/value inference、generalized advantage estimation、minibatch inner loops 與多個 checkpoints 讓實作複雜。On-policy 又要求不斷用最新 policy 生成,無法像 SFT 一樣重複使用固定資料集。

GRPO 拿 group statistics 取代 value model

Group Relative Policy Optimization 對同一 prompt 取樣一組 responses,以 group 內 rewards 的平均與標準差正規化每個 sample,直接當 advantage。它移除 value function,保留 PPO-like ratio、clipping 與 KL,程式與記憶體都簡化。

但 group mean 可以當 baseline,除以 sample standard deviation 則會改變 weighting,未必維持 unbiased gradient。全組都答對或答錯時 variance 很小;不同難度問題的 scale 也被重新加權。Per-token 或 per-sequence normalization 還可能偏好特定 response length。GRPO 是一組實務取捨,不是數學上完全等價、只是更便宜的 PPO。

Verifier 改善 reward,沒有消除 reward hacking

Exact answer、tests 或 executable environment 比偏好模型清楚,但 verifier 仍可能不完整。答案格式 parser 可被鑽漏洞,unit tests 可能漏掉 edge cases,agent 也可能讀取不該看的檔案。Format reward 甚至可能讓模型學會表面 <think> 標記,而不是更好的推理。

因此 verifier contract 要包含 sandbox、hidden tests、timeout、資源限制、禁止資訊路徑與人工 audit。Reward 應分開記 correctness、format、cost 與 safety,不要先加總後失去診斷。

DeepSeek-R1 展示 cold start、RL 與 distillation

R1-Zero 從 base model 直接用 accuracy 與 format rewards 做 reasoning RL。完整 R1 先用少量高品質 chain-of-thought 做 SFT cold start,再做 RLVR,後面加入一般 SFT/RLHF。Distillation 則讓 R1 產生 traces,訓練較小 Qwen-family models。

這個 pipeline 說明「能力來自 RL」不能只看最後一步。Base model、prompt distribution、cold-start data、verifier、sampling budget 與後續 distillation 共同決定結果。公開 follow-up 也指出某些看似湧現的格式與長度現象和 objective bias 有關。

Curriculum 與 test-time compute 是同一條軸

Kimi 類做法依成功率調整取樣,少抽已解決題,多抽仍有學習訊號的題目;也用 curriculum 從容易到困難。若只抽最難題,全組 reward 可能都是零,沒有 relative signal。

訓練後,reasoning model 還能用更長 chain of thought、更多 samples 或 search 增加 test-time compute。評估必須同時報 accuracy、generated tokens、samples 與 wall-clock,否則把更多推論預算誤認成裸模型提升。

Agentic RL 把 verifier 擴到環境

Coding agent 可用 repository tests、browser/GUI agent 可用最終 environment state。Qwen 類 agent pipeline 還會先做 repository-level mid-training、專門 SFT 與 environment construction,再進 RL。環境建置、工具 schema 與 trajectory logging 都是訓練系統的一部分。

RLVR 的瓶頸因而從 annotation 轉向 rollout throughput。Training engine 與 serving engine 往返、長短不一 trajectories、stale policy、environment reset 與 failure recovery 都會吃掉 GPU utilization。

一份可靠的 RLVR 實驗

固定 base checkpoint、prompt set、verifier version、group size、sampling temperature 與 token budget。分開畫 train reward、held-out verifier score、response length、entropy、KL 與 pass@k。人工抽查 reward 極高與突然變長的 trajectories,並以不同 hidden tests 驗證沒有 overfit verifier。

第十六講的核心不是「RL 終於解決推理」。把 reward 限縮到可檢查領域後,RL 才有較乾淨的規模化路徑;演算法偏差與系統成本仍然存在。

材料完整度

本講有 Spring 2026 當期 schedule 與完整官方 PDF。本文依其 PPO、GRPO、R1/Kimi/Qwen 案例、test-time scaling 與 agentic RL 整理。

參考資料