Skip to content
所有標籤

#imitation-learning

1 篇文章

Berkeley CS285 L1–4:模仿學習、分布偏移與 RL 基礎

前四講從 behavioral cloning 走到 MDP;HW1 再用 MSE policy、DAgger 與 flow matching,讓分布偏移從概念變成可觀察的失敗。