Skip to content
所有標籤

#embodied-ai

6 篇文章

CS224R L15:階層式 RL 與模仿學習

長 horizon 任務難,是因為要走過的狀態太多、犯錯和卡住的機會也多。CS224R 第 15 講的答案是拆成兩層:高層 policy 出子目標,低層 policy 以較高頻率執行。真正要做的設計決定有三個:子目標用什麼表示、兩層各自拿什麼監督、什麼時候換下一個子目標。投影片也坦白,階層和「單一 policy 加 chain of thought」誰比較好,還沒有定論。

CS224R L17:用 RL 改進機器人基礎模型(VLA)

只用模仿學習訓練的 VLA,成功率常卡在 80% 左右,要讓機器人自己上工卻常需要 99% 以上。CS224R 第 17 講把「怎麼在真機上用 RL 改進 VLA」拆成三條路:把 RL 改寫成監督學習(iterated offline RL)、在 VLA 的表示或擴散雜訊上另外學一個小 policy、學一個小 policy 去修改 VLA 的動作。投影片自己說這是還沒解決的研究問題,內容是近期主題加講者觀點。

CS224R L16:Sim-to-Real 機器人學習

模擬器便宜、快、安全,還附贈真實世界拿不到的標籤,但它永遠和真實世界有落差。CMU 的 Guanya Shi 在 CS224R 第 16 講把縮小落差的方法分成三類:domain randomization 讓一個 policy 在很多種物理參數下都能用;teacher-student 先用特權資訊訓練老師、再讓只看得到真實感測器的學生去模仿;real2sim2real 用真實資料把模擬器修得更像。進階題目是用人類動作資料定義任務,以及挑選適合 sim2real 的 RL 演算法。

CS231N 收尾:World Modeling/Robot Learning、Human-Centered AI 與期末專題

CS231N Spring 2026 的最後兩講沒有公開投影片:L17 在課表上只寫「World Modeling」與客座講者 Gordon Wetzstein,L18 只寫「Human-Centered AI」。校外讀者能看的是 2025 年的替代品:L17 當年是另一個主題 Robot Learning(Yunzhu Li,有投影片與錄影),L18 是李飛飛的錄影,沒有投影片。本文把三者分開標示年份,不把 2025 的內容寫成 2026。後半講期末專題:占 35%,分 Applications 與 Models 兩條 track,專案必須處理像素,交付物是一段提案、三次 milestone check-in、6–8 頁報告與海報。

2025 AI 頂會導讀:電腦視覺篇

2025 是 CV 雙會年——CVPR 和 ICCV 同年舉辦。CVPR 投稿 13,008 創歷史新高,Best Paper VGGT 把 3D 重建從逐步最佳化拉到 feed-forward 推論;ICCV 的 Marr Prize 頒給了用文字生成可實際拼搭積木結構的 BrickGPT。3D Gaussian Splatting 全面取代 NeRF、video generation 從研究走向產品、flow model 開始取代 diffusion——CV 領域在這一年完成了多項典範轉移。

aideep-dive

3D 生成式模型走到哪了:從 Lyra 2.0 拆解 2026 年的技術地圖

2026 年 3D 生成的核心範式是「video diffusion → feed-forward 3D 重建」,Lyra 2.0 是這條線的代表作。但 CVPR 2026 的三篇 Best Paper 暗示下一波轉向:SAM 3D 帶來 foundation model 級別的物件重建、D4RT 用統一 transformer 數秒重建動態 4D、O-Voxel 用結構化 latent 取代 Gaussian。3DGS 仍是主流但正在被表面原語挑戰,pixel-space diffusion 正在反攻 latent-space。