Skip to content
所有標籤

#multimodal-ai

2 篇文章

CS224N 第 17 講:Multimodality 的官方閱讀地圖

第 17 講由 Luke Zettlemoyer 客座談 multimodality,但官網沒有公開投影片或 agenda;官方閱讀清單可確認三條主線:視覺推理介面、early-fusion token 模型、文字自回歸加影像 diffusion。

Berkeley CS288(五):Inference-time Compute、Reasoning 與 Embodied Agents

15–18 組教材把 NLP 模型放進感知、推理、工具與環境迴圈;核心問題從下一個 token,轉成如何分配推論計算並驗證多步行動。