Skip to content

Berkeley CS285 L11–18:從變分推論、LLM RL 到 Offline RL

2026年8月22日 1 分鐘
TL;DR L11–18 把 control as inference、LLM RL、model-based RL 與 offline RL 接成一條主線,並用 HW4、HW5 呈現兩種高運算成本實作。
目錄
  1. L11–14:把控制看成推論
  2. L15–16:有 dynamics model 能做什麼
  3. L17–18:只有固定資料時
  4. 自學縮減版
  5. 參考資料

🌏 English version

官方課表的 L11–18 依序涵蓋 Variational Inference、VI in RL、Control as Inference、LLM RL、兩講 Model-Based RL 與兩講 Offline RL。看似四個題目,其實都在問:資料、模型與最佳化目標不完整時,agent 能依靠什麼訊號學習?

L11–14:把控制看成推論

L11–13 先建立 latent-variable 與 variational inference,再把「最優」寫成機率事件。這個觀點把 reward、trajectory distribution 與 entropy 放進同一套語言。Section 6 補推導,Section 7 將 IRL 與 LLM RL 並讀。

L14 的 LLM RL 不是獨立插曲,而是把 policy gradient 用在 token policy 與可驗證 reward。HW4 實作 REINFORCE 與 GRPO,比較 format-copy 與較難的數學任務。它不是一般筆電作業;H100 與必要 runs 的依據見作業成本表

L15–16:有 dynamics model 能做什麼

Model-Based RL 先學或使用 dynamics,再規劃 action 或改善 policy。優勢是資料可重用,風險是 model error 會沿 rollout 累積。Section 8 的實用讀法是畫出三條迴路:收資料、學模型、用模型規劃/訓練;每條箭頭標出可能的 distribution shift。

L17–18:只有固定資料時

Offline RL 不能再向環境收集資料,核心困難是 out-of-distribution action 的 value 可能被高估。Section 9 對應這個問題。HW5 在 OGBench 任務上實作 SAC+BC、IQL 與 FQL;長時間 run 與調參成本見作業成本表

自學縮減版

先讀完投影片與 sections,再分兩階段做:HW4 先完成 format-copy 的最小 run;HW5 先選一個 task、一個 seed、一個 baseline,驗證資料載入與 evaluation。只有在曲線與 checkpoint 都正常後才擴大。自學目標是理解失敗機制,不是複製修課學生獲得的 Modal 額度。

當期課程資產的限制與歷史影片使用方式,統一見系列總覽的存取邊界

參考資料