本文依據 CS224R Spring 2026 版。 這是 Stanford CS224R 導讀系列第 20 篇,接續 L16 Sim-to-Real 機器人學習,對應 2026 年 5 月 27 日(第 9 週週三)的第 17 講「RL for Robots: RL for VLAs」。投影片封面標題是「RL for Robot Foundation Models」。
用到的官方材料:
- 當期投影片 17_cs224r_rl_vlas_2026.pdf(34 頁)
- 課表這一講沒有列指定閱讀,下面提到的論文都是投影片上引用的
存取等級是 A3:投影片匿名可下載,2026 錄影只放在 Canvas 上。
這一講沒有配套影片。 它是 2026 年新增的講次,Spring 2025 封存頁和 2025 播放清單都沒有對應的一講。本文只能依投影片寫,投影片上的圖和影片說明不了的地方,不替它補。
投影片第 4 頁也先打了預防針:這是一個開放、活躍的研究問題,這講涵蓋的是近期的幾個主題,加上講者對這個領域的看法。讀的時候請把它當成一張研究地圖,不是定論。
場景:從模擬搬到真機,換成從預訓練模型出發
第 3 頁把這講和上一講接起來:
- 上一講:能不能在模擬的機器人上做 RL,再把行為搬到真實世界?
- 這一講:怎麼在真實的機器人上,對預訓練好的基礎模型做 RL?
VLA 長什麼樣
第 5–6 頁描述最常見的機器人基礎模型,也就是 vision-language-action(VLA)模型:
- 從預訓練的視覺語言模型(VLM)出發;另一種設計是從生成式影片模型出發
- 訓練資料常混合三種:機器人示範(模仿學習)、VLM 任務(問答、描述、偵測)、人類影片(動作預測)
- 常會接一個以擴散為基礎的 action expert:
- 用擴散或 flow matching 預測連續動作
- attend 到 LLM backbone 的所有 activation
- 設計成不必對整個 backbone 做多次前向
- 梯度通常不回傳到 backbone
flow matching 在 HW1 已經實作過,想補直覺可以讀 MIT 6.S184 的 flow matching 與擴散導讀。
問題在哪:卡在 80%
第 7 頁:只用模仿學習訓練的 VLA,表現常停在 80% 左右,圖是 π0.5 在沒看過的房間裡的表現。
- 這和 LLM 在 SFT 之後再做 RL 會變強的情況類似(見 L9 RLHF 與偏好最佳化)
- 機器人要自主工作,常需要 99% 以上的可靠度
- 所以這是 RL 微調的自然用途,預訓練好的 VLA 可以當 RL 的有效初始化
投影片也註明:DAgger 也有幫助,常和 RL 一起用。
為什麼 VLA 難用 RL 訓
第 8 頁列了兩大原因:
1. VLA 很大,每次梯度更新都貴
- 常想在雲端訓練,roll-out 則在機器人旁的本機跑
- 每個實驗的迭代時間變長
- 大量調超參數既貴又費時
2. VLA 是用模仿學習預訓練的
- 沒有預訓練好的價值函數或 critic
- 常用擴散或 flow matching 訓練,RL 演算法很難直接套上去
- 常用 action chunking,這在 RL 裡也不是常見選擇
Online 還是 iterated offline
第 9 頁比較兩種迴圈:
| Online RL(例如 SAC) | (Iterated)offline RL | |
|---|---|---|
| 一輪收多少資料 | 1 個 timestep | 1k 個 episode |
| 一輪做多少梯度步 | 1 步 | 10k 步 |
| 有 bug 或超參數設錯時 | 要重跑實驗、重收資料 | 在既有資料上重跑訓練 |
投影片的結論是:offline 對大模型簡單得多。學習率、epoch 數、gradient clipping 這些常出錯的地方,offline 只要重訓就好。offline RL 的基礎見 L7 Offline RL。
怎麼做:如果你在評估要不要替自家機器人或 agent 模型做 RL 微調,先估一件事:每次重收一輪資料要花多少時間和人力。這個數字越大,越該先走 iterated offline 的路。
工具一:直接用 PPO 行不行
第 11 頁的回答是「可以,但是……」。兩個例子:
- 用 RL 微調 OpenVLA:Li et al. SimpleVLA-RL(2025)
- 用 RL 微調 π0.5:Chen et al. πRL(2026)
但投影片點出兩個限制:
- 需要大量的 online policy roll-out,很多論文甚至不報告用了多少樣本
- 結果只限於在模擬器裡訓練
工具二:iterated offline RL,能不能只用監督學習
第 12 頁提出 key theme #1:能不能設計一個以監督學習為基礎的方法?如果可以,它可能比較容易擴展到大模型和大資料。
分兩步:
- 學價值函數:可以用 Monte Carlo 擬合 V
- 用價值函數得到更好的 policy:監督 policy 去做 V 認為比較好的動作
投影片用 Physical Intelligence 的 π*0.6(2025)說明:
- 價值函數(第 13 頁):在大規模示範資料上擬合一個多任務、語言條件的 V。用預訓練 VLM,條件是當下影像、語言指令和 episode metadata,預測還要多久完成(time to go)
- Policy(第 14 頁):advantage-conditioned 監督學習
- 用預測的價值估計 advantage A(s, a)
- 把 advantage 二值化,告訴 policy 這個動作好不好
- 以二值化的 advantage 為條件,用監督學習微調 policy
- 完整演算法(第 15 頁):收一大批 roll-out 和人為介入 → 更新價值函數預測 time-to-go → 用 advantage-conditioned 監督學習更新 VLA,然後重複
第 16 頁的結果標題是:RL 後訓練比 IL 後訓練的吞吐量高 2 倍。第 17 頁的影片是和人合作做拿鐵,以及連續運作 13 小時穩定做拿鐵。
為什麼二值化 advantage 就能改進 policy
這段是我的補充,投影片上沒有寫。訓練時 policy 同時看到「好」和「壞」兩種標記的動作,學會兩種條件下各自的動作分佈;推論時固定給「好」的條件,就只從好動作的分佈裡抽。這樣整個流程只剩監督學習,不需要 policy gradient,也就避開了第 8 頁說的「擴散或 flow matching 很難套 RL」。這個想法和 L7 講過的 advantage-weighted 類方法相近,都是用 advantage 去篩選或加權監督訊號。
這是最好的配方嗎
第 18 頁講者自己提了三點保留:
- 即使在大規模設定下,TD 更新應該也能勝過 Monte Carlo 價值學習
- 也應該能受益於更強的 policy improvement 方法
- Online RL 應該更有資料效率,因為它能更快找到失敗模式、排除新策略,達到更高表現,代價是基礎設施更複雜
工具三:online RL,先降維
第 20 頁提出 key theme #2:不端到端微調 VLA,改成用 VLA 的表示另外學一個 Gaussian policy。兩個版本:
- 版本 A:把 VLA 擴散過程的雜訊當成動作空間,訓練 RL policy 去控制雜訊(Wagenmaker et al. DSRL, 2025)
- 版本 B:壓縮 VLA 的視覺表示,在這個表示上做 RL(Xu et al. RLT, 2026)
投影片加註:RL 之後,可以把 policy 產生的資料蒸餾回 VLA。
DSRL:訓練一個會挑雜訊的 policy
第 21–23 頁展開版本 A,出自 Steering Your Diffusion Policy with Latent Space Reinforcement Learning(Wagenmaker, Nakamoto, Zhang et al., CoRL 2025)。直覺是:不同的雜訊向量會被去雜訊成不同的動作,那就訓練一個 policy 輸出「會變成好動作」的雜訊。
取樣:
- 抽 w_t ∼ π_steer(· | s_t; θ)
- 去雜訊得到一段動作 a_{t:t+h} = π_VLA(s_t, w_t)
- 在環境執行 a_{t:t+h},觀察 s_{t+h}
訓練:
- 收 roll-out (s_1, w_1, r_1, …, s_T) 放進 buffer
- 從 buffer 抽 minibatch
- 用 SAC 更新 Q_ϕ(s_t, w_t) 和 π_steer(w_t | s_t; θ)
第 23 頁的數字:訓練資料是 65 個 online episode、大約 10k 步,大約比 PPO 有效率 O(100 倍)。
注意這裡 Q 的輸入是雜訊 w,不是實際動作 a。VLA 被當成環境的一部分凍結起來,SAC 只需要處理一個低維的 Gaussian policy,第 8 頁說的「擴散模型難套 RL」和「模型太大」兩個問題一起繞過了。SAC 的細節見 L5 Off-Policy Actor-Critic。
工具四:online RL,學一個修改動作的小 policy
第 25 頁提出 key theme #3:學一個小的 Gaussian policy 去修改(擴散)VLA 的動作。兩個版本:
- 版本 A:actor-critic 演算法,再蒸餾回 VLA(Xiao et al. Probe-Learn-Distill, 2025)
- 版本 B:actor-critic 演算法,測試時加上 best-of-N 取樣(Dong et al. EXPO-FT, 2026)
EXPO:edit policy 加上取樣
第 26–30 頁用 EXPO: Stable Reinforcement Learning with Expressive Policies(Dong, Li, Sadigh, Finn, ICLR 2026) 展開。基本做法:
- 最佳化一個較小的 Gaussian edit policy,讓 Q 值最大(像一般 RL)
- 基礎 policy 用模仿學習,在所有成功的資料上訓練
投影片提醒,只這樣做可能不穩定:edit policy 天生會落後 Q 函數,也可能崩潰。
穩定化的做法是即時用取樣去最大化最新的 Q 函數(第 27 頁):
- 從 π_base 抽多個 a
- 從 π_edit(ã | s, a) 抽多個 ã
- 在 {a_1, …, a_n, ã_1, …, ã_n} 裡挑 Q 最高的
好處是減少和 Q 函數之間的落差,也不怕 edit policy 崩潰。講者問:這也許可以看成一種 test-time scaling?
第 28 頁有一個標了「!!」的重點:擬合 Q 時,Bellman backup 裡的 a′ 要怎麼挑?答案是用這個 on-the-fly policy,也就是上面那套「抽樣再挑最高 Q」的程序。
第 30 頁的消融:
- 拿掉 edit policy:價值最大化明顯受阻
- Bellman backup 不用 on-the-fly policy:在某些環境表現很差
第 29 頁是真機結果,出自 EXPO-FT(Dong, Hung, Gao, Sadigh, Finn, 2026, Sample-Efficient RL Fine-Tuning for VLAs):
- 比 SFT 和 DAgger 可靠度更高
- 訓練資料平均 19 分鐘的經驗,大約 11k 步
- 比 DSRL 和 HIL-SERL 學得更有效率、更有效
怎麼做:如果你只能拿到一個凍結的 VLA(或任何凍結的生成式 policy),這一講給了兩個不必動它權重的切入點:控制它的輸入雜訊,或在它的輸出上加一個小修正器。先挑你手上最容易暴露的那個介面開始。
連回來:總結與展望
第 32 頁的總結:
- 挑戰:VLA 很大,梯度更新貴;VLA 是用模仿學習預訓練的
- 三個主題:
- #1:為了可擴展性,設計以監督學習為基礎的方法(offline RL)
- #2:用 VLA 的表示另外學一個 Gaussian policy(online RL)
- #3:學一個小的 Gaussian policy 去修改(擴散)VLA 的動作(online RL)
第 33 頁是講者的展望,分兩面:
- 令人興奮的進展:有證據顯示 RL 能大幅提升最先進 VLA 的表現和速度,也有證據顯示能達到真實部署需要的表現
- 還沒有令人滿意的解法:online RL 應該比 offline 更有效率、更有效;需要 residual policy 或退到潛在空間做 RL,比起直接對 VLA 權重做 RL,感覺不夠令人滿意
這個結尾也回應了 L15 階層式 RL 與模仿學習 第 41 頁的註記:用 RL 微調大型(階層式)機器人系統,是開放而且重要的研究方向。
下一講是最後一講,談總結、開放問題,以及怎麼做 RL 研究。見 L18 前沿與研究方法。
站內延伸閱讀:
- Berkeley CS285 的 inference 與 offline RL 導讀
- CS336 RLVR,LLM 那一側「SFT 之後再做 RL」的對照
這一篇可以確認與不能確認的
可以確認:2026 投影片的文字、演算法步驟、數字(80%、99%、2 倍、13 小時、65 episode/約 10k 步、O(100 倍)、19 分鐘/約 11k 步)與論文標註;課表的日期與「沒有指定閱讀」;2025 封存頁和播放清單都沒有對應講次。不能確認:這講的講者(投影片沒有寫名字,只說「my opinion」);各圖表的具體數值、比較基準和實驗設定;πRL、RLT、Probe-Learn-Distill、EXPO-FT 的論文全文(我沒有找到或沒有開啟它們的原始頁面,只依投影片上的標註)。
系列導覽:上一篇 L16 Sim-to-Real 機器人學習|下一篇 L18 前沿與研究方法|系列入口
參考資料
- CS224R: Deep Reinforcement Learning(Spring 2026 課程官網與課表)
- Lecture 17 投影片:RL for Robot Foundation Models(2026)
- CS224R Spring 2025 封存頁(沒有對應講次)
- Physical Intelligence 2025:π*0.6: a VLA That Learns From Experience
- Wagenmaker et al. 2025:Steering Your Diffusion Policy with Latent Space Reinforcement Learning(DSRL)
- Dong et al. 2025:EXPO: Stable Reinforcement Learning with Expressive Policies
- Li et al. 2025:SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- Luo et al. 2024:Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning(HIL-SERL)
- Physical Intelligence 2025:π0.5
Loading...