Berkeley CS288(五):Inference-time Compute、Reasoning 與 Embodied Agents
15–18 組教材把 NLP 模型放進感知、推理、工具與環境迴圈;核心問題從下一個 token,轉成如何分配推論計算並驗證多步行動。
15–18 組教材把 NLP 模型放進感知、推理、工具與環境迴圈;核心問題從下一個 token,轉成如何分配推論計算並驗證多步行動。
前四組教材先建立可計數、可表示、可分類的文字模型;A1 再要求從 n-gram、perceptron 做到 NBOW MLP。
CS288 用 18 組公開投影片與三份作業,從 n-gram 走到 RAG、reasoning 與 agents;錄影需 Berkeley 登入,所以這是一條教材型 A3 路線。
08–12 組教材把 base model 變成可互動系統:預訓練決定基礎能力,post-training 改變行為,generation 與 evaluation 決定輸出如何被使用與判讀。
13–14 組教材把模型接到外部知識;A3 要學生自行蒐集資料、標註 QA、建索引、做 ablation,並在 CPU 與延遲限制下交付 RAG。
05–07 組教材把固定向量的分類器推進序列狀態、encoder-decoder,再用 attention 與 Transformer 改寫資訊路徑。