Skip to content
所有標籤

#cs285

6 篇文章

Berkeley CS285 L19–25:探索、RL 理論、多任務學習與開放問題

最後七講從 exploration 與理論界線,經兩講期中複習,走到 advanced exploration、multi-task RL 與仍未解決的研究問題。

Berkeley CS285 作業與期末專案:CPU、GPU、H100 成本分界

五份作業從 CPU 友善的 imitation learning 走到 H100 LLM RL 與六小時 offline RL runs;自學者應按成本分三階段,而非整套照搬。

Berkeley CS285 L1–4:模仿學習、分布偏移與 RL 基礎

前四講從 behavioral cloning 走到 MDP;HW1 再用 MSE policy、DAgger 與 flow matching,讓分布偏移從概念變成可觀察的失敗。

Berkeley CS285 L11–18:從變分推論、LLM RL 到 Offline RL

L11–18 把 control as inference、LLM RL、model-based RL 與 offline RL 接成一條主線,並用 HW4、HW5 呈現兩種高運算成本實作。

Berkeley CS285 L5–10:Policy Gradient、Actor-Critic、DQN 與 SAC

L5–10 用 policy-based 與 value-based 兩條路建立深度 RL 核心;HW2 可用 CPU,HW3 的 Atari 與 HalfCheetah 則約需數小時 GPU。

Berkeley CS285 Spring 2026 導讀:25 講、5 份作業與自學邊界

Spring 2026 CS185/285 公開 25 講投影片、9 組討論課資料、5 份作業與 starter code;當期錄影在 bCourses,HW4 預設 H100,不能把它包裝成零成本公開課。