Skip to content

CS336 Lecture 15:SFT 教模型模仿,RLHF 才開始直接最佳化偏好

2026年8月22日 1 分鐘
TL;DR 第十五講把 post-training 拆成 imitation 與 optimization:SFT 從 instruction-response data 抽出預訓練已有能力,RLHF 用 pairwise feedback 跨過人類示範與偏好之間的落差;PPO 與 DPO 都逃不掉資料偏差、reward overoptimization 和 mode collapse。
目錄
  1. SFT data 同時教內容與風格
  2. Mid-training 把 instruction-like data 放回預訓練階段
  3. 為什麼模仿之後還要 preference optimization
  4. PPO 路線:先學 reward,再更新 policy
  5. DPO 把偏好直接寫成分類 loss
  6. Reward overoptimization 與 mode collapse
  7. 一條可稽核的 post-training pipeline
  8. 材料完整度
  9. 參考資料

🌏 English version

本篇對應 CS336 Spring 2026 Lecture 15: Mid/post-training (SFT/RLHF),2026 年 5 月 18 日由 Tatsunori Hashimoto 主講。主要來源是官方 lecture_15.pdf

Pretraining 產生會續寫文字的 base model;instruction following 需要更直接的控制。第十五講以兩階段整理主流做法:supervised fine-tuning(SFT)模仿示範,RLHF 依偏好直接最佳化輸出。

SFT data 同時教內容與風格

FLAN 類資料把既有 NLP tasks 轉成 instructions。從 Alpaca、OpenAssistant 到後來的 tool-use/code datasets,responses 逐漸變長、更像對話,也加入 references、reasoning traces 與 tool calls。

這些變化不只增加能力。Response length、bullet points、語氣、拒答格式與引用習慣都會被模型模仿,偏好 judge 又常偏愛較長答案,形成 style feedback loop。SFT dataset 因此要分開標 task correctness、style 與 safety,不要只看 win rate。

課堂提出一個重要限制:SFT 最擅長把 pretraining 已有的能力抽出來,不一定適合灌入模型原本完全不知道的 tail facts。少量 fine-tuning 可能讓模型學會自信地模仿答案格式,卻沒有足夠參數更新可靠保存知識。需要新知時,pretraining/mid-training、retrieval 或工具常比幾筆 QA 更合理。

Mid-training 把 instruction-like data 放回預訓練階段

Instruction tuning 不一定只能在最後用小 learning rate 做。Mid-training 或 two-phase training 會在 pretraining 後段調整 data mixture,加入長 context、領域資料、instruction-like documents,再進正式 post-training。

這讓模型以 next-token objective 吸收大量新分布,同時保留較完整的 training dynamics。它和 SFT 的界線不是絕對名稱,而是資料格式、token budget、objective 與訓練階段的組合。

為什麼模仿之後還要 preference optimization

人類能示範的答案未必等於看到多個候選時真正偏好的答案,這是 generation–verification gap。Preference data 通常給 prompt、chosen response 與 rejected response,來源可包括專業 annotators、crowd workers、AI feedback 或 self-training。

Annotator demographic、薪酬、guideline、領域專業與平台流程都會改變 label。Pairwise feedback 也容易混入 length、style 與政治文化偏好。資料不是一個抽象 reward source,而是一群具體判斷者在具體規則下的產物。

PPO 路線:先學 reward,再更新 policy

傳統 RLHF 先用 pairs 訓練 reward model,再從 policy 取樣 responses,以 PPO 增加 reward,同時用 KL penalty 限制模型不要離 reference policy 太遠。Value model 與 advantage reduction 用來降低 policy-gradient variance,clipping 則限制單次更新幅度。

它的優點是 on-policy:模型能探索目前 policy 真正會產生的輸出。代價是 rollout、reward/value inference 與多模型狀態讓系統昂貴且不穩。

DPO 把偏好直接寫成分類 loss

DPO 從帶 KL regularization 的最佳 policy 形式推導,直接比較 chosen/rejected 在 policy 相對 reference 下的 log-probability。它不需要顯式 reward model,也不需 on-policy rollout,工程上接近一個 supervised pairwise objective。

簡單不代表無條件更好。DPO 只能從固定資料分布學習,無法自動取得 policy 更新後的新失敗;temperature、reference model、pair quality 與資料難度仍會大幅影響結果。PPO 與 DPO 的比較高度依 experiment setup,不能把單一 leaderboard 結果寫成永久勝負。

Reward overoptimization 與 mode collapse

持續最佳化 proxy reward,模型會找到 reward model 的漏洞;reward 上升而真實 human preference 下降。Policy 也可能降低 entropy,產出變得同質、過長或充滿固定格式,失去 base model 原有的校準與多樣性。

安全 SFT 或 RLHF 也可能造成 over-refusal。評估必須同時追 helpfulness、harmlessness、factuality、diversity、calibration 與 capability retention,並在不同 optimizer checkpoints 觀察,不只拿最後一點。

一條可稽核的 post-training pipeline

固定並版本化 SFT prompts/responses、preference pairs、annotator guideline、reward/judge 與 reference model。SFT 後先做 capability/style/safety slices;preference optimization 再畫 reward 與外部 eval 隨 steps 的曲線,保留 early stop。對高風險領域用專家與真實 task outcome,不讓單一 LLM judge 成為唯一裁判。

第十五講的核心分界是:SFT 在模仿資料分布,RLHF 在對一個偏好 proxy 做最佳化。兩者的上限都先由資料與評測決定。

材料完整度

本講有 Spring 2026 當期 schedule 與完整官方 PDF。本文涵蓋當期投影片的 SFT data、mid-training、preference data、PPO、DPO 與失敗模式。

參考資料