所有標籤CME295 2025 版第 7 講用三塊補 LLM 的洞:RAG 補「知識停在訓練那天」,分成候選檢索與重新排序兩階段;tool calling 補「不能動手」,由後端執行模型寫出的函式呼叫;agent 用 ReAct 的觀察、規劃、行動迴圈把呼叫串起來。2026 版把這講改成 AI Agents,新增 context compaction、harness、coding agent、skills,是整個系列改最多的一講。
CME295 2026 版第 6 講(2026 年 11 月 6 日)課表列了七個主題,tool calling、MCP、retrieval 在 2025 版第 7 講已經講過;真正新增的是 context compaction、harness optimization、coding agents、skills/plugins。本篇是課前預寫版,用 Anthropic、OpenAI 的工程文章、MCP 2026-07-28 規格與 Meta-Harness 論文,先把這四個新主題講清楚。
CME295 最後一講 128 頁投影片分三段:用八張圖複習前八講、Transformer 怎麼用在影像上(ViT 與兩種 VLM 接法)、以及一次吐出多個 token 的 masked diffusion LLM,最後談研究與應用的下一步。這堂不在考試範圍;2026 版把 diffusion LLM 拉成獨立一講,第 9 講改以多模態為主。
CME295 2026 版第 8 講(11 月 20 日)把 diffusion LLM 拉成整講,課表列了 continuous、discrete、masked diffusion、訓練與推論五個子題。課前預寫版依 DDPM、D3PM、SEDD、MDLM、LLaDA 等原始論文整理:連續雜訊在文字上要付約 64 倍算力,[MASK] 吸收態勝出;訓練目標是乘上 1/t 的 masked cross-entropy;推論的速度來自每步多填幾格,但 LLaDA 主要結果其實每步只解一個 token,Fast-dLLM 靠信心門檻與近似 KV cache 才拿到最多 27.6 倍加速。
CME295 第 3 講先把 LLM 定義成 decoder-only 的下一個 token 預測器,接著用 MoE 說明大模型為什麼每個 token 只用到一部分權重,主體則是生成時能調的旋鈕:greedy、beam search、top-k、top-p、temperature、guided decoding,以及 few-shot、chain of thought、self-consistency 三種 prompting 手法。2026 版把這講併進第 2 講,prompting 那半從課表消失。
CME295 第 8 講從「人工評分又慢又貴、BLEU/ROUGE 看不懂換句話說」出發,講 LLM-as-a-Judge 的做法、位置/冗長/自我偏好三種偏誤與六條實務原則,再把 agent 的錯誤拆成工具選擇、工具執行、回答生成三段,最後用 MMLU、AIME、SWE-bench、HarmBench、τ-bench 說明 benchmark 各量什麼,以及 pass^k 和 Goodhart 定律。
CME295 第 6 講把 reasoning model 拆成三件事:先輸出推理鏈再給答案、用「答案對不對」這種可驗證獎勵跑 RL、用 GRPO 以同組答案的平均分當基準而不另訓 value model。DeepSeek-R1-Zero 只靠 RL,AIME 2024 pass@1 從 15.6% 升到 71.0%;而把 R1 的推理軌跡蒸餾給 Qwen-32B,分數還比直接對 32B 做 RL 高。
2026 版 CME295 第 5 講「LLM systems」(10 月 30 日)課表列了 7 個主題:分散式訓練、推論最佳化、KV caching、speculative decoding、高效 kernel、FlashAttention、硬體取捨。本篇在開課前,用 2025 版第 3、4 講約 70 頁投影片加原始論文,把它們串成同一本帳:H100 每搬 1 byte 大約要做 295 次運算才吃得滿算力,而逐字生成時每讀 1 byte 權重只做約 1 次,所以多數加速手法都在想辦法少搬資料。
CME295 第 4 講把 LLM 訓練拆成兩段:先用上兆個 token 做預訓練(Llama 3 用了 15 兆),再用數千到數百萬筆示範資料做 SFT,讓模型從「接話」變成「回答」。中間穿插一張省記憶體的地圖:ZeRO、FlashAttention、混合精度;最後用 LoRA 與 QLoRA 讓沒有大 GPU 的人也能微調,QLoRA 在 65B 模型上省下約 16 倍 VRAM。
SFT 只會叫模型模仿好答案,沒辦法告訴它哪種回答不行。CME295 第 5 講先教怎麼收集偏好對,再走 RLHF 兩步(約 1 萬筆人工標註訓練 reward model、約 10 萬筆用 PPO 調模型),最後用 DPO 把整套 RL 收成一條監督式 loss。2026 版把這講拆進第 3 講(訓練)與新增的第 4 講(強化學習)。
2026 版 CME295 第 4 講(10 月 16 日)把 RL 獨立成一講,課表列了數學記號、reward design、policy gradient、限制、PPO、GRPO、on-policy distillation 七項。本篇把這條數學線先推一遍:從 ∇log π 乘上一個分數出發,SFT 的分數是 1,PPO 用 value model 估,GRPO 用同組平均,on-policy distillation 用教師對每個 token 的 log 機率差。Qwen3 報告裡,從同一個起點出發,RL 花 17,920 GPU 小時做到 AIME'24 67.6,on-policy distillation 只花約 1/10(1,800 小時)就做到 74.4。
CME295 第 1 講用同一句「A cute teddy bear is reading.」串完整堂課:先切成 token,再變成向量,接著說明 RNN 為什麼記不住長句,最後用 self-attention 和 encoder-decoder 把它翻成法文。2026 版刪掉整節 NLP 任務與評估指標,把開場換成從 2017 到 agent 時代的時間軸。
CME295 第 2 講把原始 Transformer 拆開改裝:位置資訊從「加在 embedding 上」一路改到 RoPE「在 attention 裡旋轉 Q 和 K」;attention 用 sliding window 和 MQA/GQA 省成本;再把模型分成 encoder-only、encoder-decoder、decoder-only 三家,花後半堂拆解 BERT 的 MLM(15% token)與 NSP 預訓練。2026 版把這些併進「Large Language Models」一講,BERT 不再是課表項目。
CME295 是 Stanford 的兩學分課,沒有作業,成績只看期中和期末各 50%。2025 版九堂的影片、投影片和兩份考卷解答全部公開;2026 版把 agent 那一講改成 context 壓縮、harness、coding agent 和 skills,還新增 LLM 系統、強化學習、Diffusion LLM 三整講。