Skip to content

CMU 10-423 生成式 AI 導讀:系列總覽——26 講投影片與四份作業全公開,錄影鎖在 Panopto

2026年9月30日1 分鐘
TL;DRCMU 10-423/623/723 是 Matt Gormley 與 Aran Nayebi 合授的生成式 AI 課,Spring 2026 用 26 講走完文字模型、影像生成、模型調適、多模態、規模化與進階主題。投影片、HW1–HW4 的題目與起始碼、附解答的練習考卷和專案說明都公開,可評為 A3;拿不到的是 Panopto 錄影、HW0 題目檔、HW3/HW4 的 recitation 投影片、小考與 Gradescope 評分。它的作業政策也值得一看:每份作業分兩次交,第一次只准人工作答,第二次才准用 AI。

🌏 English version

版本說明:本系列依據 CMU 10-423/623/723 Generative AI 的 Spring 2026 版。這是 2025–2026 年最近一個完整學期:講次表最後一筆是 4 月 30 日的期末報告截止,頁尾寫著「Last updated April 20, 2026」;10423-f26/ 目前回 404,沒有 Fall 2026 課站。所有事實都在 2026-09-30 打開課程首頁、講次表、Coursework、Previous 頁與投影片、作業檔核對。存取等級 A3(定義見全球 AI/CS 課程地圖)。

系列位置:本篇是總覽|下一篇 L1:RNN 語言模型與 autodiff(含 HW0)

CMU 10-423 是卡內基美隆大學機器學習系的生成式 AI 課,Spring 2026 由 Aran Nayebi 與 Matt Gormley 合授。同一堂課掛三個課號:10-423、10-623、10-723,內容相同,差在要交的東西。

課程描述把範圍寫得很廣:怎麼建構生成模型與其他大型基礎模型(視覺與語言的 Transformer、diffusion model)、怎麼訓練(預訓練、微調)與高效調適(adapter、in-context learning)、怎麼擴展到大規模資料(多 GPU/分散式最佳化)、怎麼在日常使用現成模型(生成程式碼、讓生成模型參與寫程式的流程),以及會出什麼錯(bias、hallucination、adversarial attack、data contamination)與怎麼處理。

這篇回答三件事:這門課教什麼、校外讀者拿得到哪些東西、該怎麼自學。各講細節留給後面的篇章。

這門課的硬事實

項目Spring 2026
授課Aran Nayebi、Matt Gormley
時間週一、三、五 14:00–15:20(DH 2210);週一、三上課,週五偶爾有 recitation
先修10301、10315、10601、10701、10715、11485、11685、11785 擇一
教科書沒有,readings 都是免費的線上論文與書章
作業語言Python
往年課站Fall 2025、Spring 2025、Fall 2024、Spring 2024(Previous 頁)

先修清單有兩條線:機器學習導論(10-301/315/601/701/715)或深度學習導論(11-485/685/785)。第一講投影片補了一句:深度學習和 PyTorch 都不是先修,看你修的是哪門先修課、哪個學期,可能學過也可能沒學過,兩種情況都可以。

站內對應的先修導讀有兩篇:CMU 10-301 導讀與 CMU 11-785 導讀。

三種課號差在哪

課綱寫得很直接:三個課號內容完全相同,10-623 多做 HW623,10-723 再多一個 Quiz723。

課號作業小考程式測驗考試專案參與
10-42330%(5 份)10%(6 次,最低分半權重)10%(2 次)20%(1 次)25%5%
10-62330%(6 份,含 HW623)10%(同上)10%20%25%5%
10-72330%(6 份)10%(6 次,等權重)10%20%25%5%

「5 份作業」指 HW0 到 HW4。HW623 依第一講投影片的作業表,是讀一篇近期生成式 AI 論文、分析後錄成影片報告。

有兩處官方材料彼此對不上,讀的時候以首頁課綱為準:

  • 第一講投影片的「Syllabus Highlights」頁寫「40% homework」、沒有程式測驗,「Reminders」頁的 HW0 日期是 8 月 27 日發布,看起來是沿用前一學期的投影片。第二講投影片的 HW0 日期已經改成 1 月 14 日發布、1 月 26 日截止,和講次表一致。
  • Coursework 頁寫「There will be 5 quizzes」,下面卻列了 Quiz 1 到 Quiz 6,課綱也寫 6 次。

作業政策:先靠自己,再用 AI

這門課最有特色的設計是作業的兩段式繳交。課綱的理由是:這門課最重要的學習,發生在你硬啃作業難題的過程。

  • Slot A(只准人工作答):個人完成,只允許有限度的合作,不准任何形式的 AI 協助。助教批改後告訴你哪些題目錯了。Office hours 和 Piazza 只在 Slot A 期間開放。
  • Slot B(可以用 AI、可以完全合作):收到回饋後三天截止,只重新批改 Slot A 答錯的題目。
  • 分數:每題取兩次的最高分,Slot A 拿到超過一半的分數另有加分。
課綱上的完整計分公式

$$ s = 0.95 \times \sum_{q \in HW} \max(s_{A,q}, s_{B,q}) + 0.05 \times \mathbb{1}(s_A > 0.50) $$

$s_{A,q}$、$s_{B,q}$ 是第 $q$ 題在兩次繳交的分數,$s_A$ 是 Slot A 的總分。

把 AI 協助的作答當成人工作答交到 Slot A,會被認定違反學術誠信,罰則可能是整門課不及格。遲交規則也只適用 Slot B:Slot A 不收遲交,也不能用 grace day;Slot B 遲一天 75%、兩天 50%、三天 25%,全學期有 6 天 grace day。

第一講投影片花了好幾頁為這套設計辯護,包括一個很坦白的讓步:這些題目對 LLM 或 coding agent 來說確實不難,但你要在沒人解過的問題上用好 code assistant,得先看得懂大量生成的程式碼、在看似正確的程式碼裡抓 bug、說清楚問題是什麼。

對自學者的意義:沒有人幫你批改 Slot A,但你可以照同樣的順序自律。先不開 AI 寫完一輪,對照練習考卷的解答或單元測試找出錯處,再開 AI 修正。

6 個單元、26 講的地圖

講次表把 26 講分成 6 個單元,每份作業只考前面那幾講:HW1 對應 L1–L4、HW2 對應 L5–L8、HW3 對應 L9–L12、HW4 對應 L12–L14。本系列照這個節奏排,每個單元最後放一篇作業。

單元講次本系列篇章
Generative models of textL1 RNN LMs / Autodiff;L2 Transformer LMs;L3 Learning LLMs / Decoding;L4 Pre-training, fine-tuning / Modern Transformers1 RNN LM 與 autodiff、2 Transformer LM 與解碼、3 現代 Transformer、4 HW1
Generative models of imagesL5 CNNs / Encoder-only Transformers / ViT;L6 GANs / PGM;L7–L8 Diffusion models5 CNN/BERT/ViT、6 GAN、7 Diffusion、8 VI 與 VAE、9 HW2
Applying and adapting foundation modelsL9 VAEs;L10 Parameter-efficient fine tuning;L11 In-Context Learning / Prompt Engineering / Instruction Fine-tuning / RLHF10 PEFT 與 ICL、11 IFT/RLHF/DPO、12 HW3
Multimodal foundation modelsL12 DPO / Text-to-image / Latent diffusion;L13 Vision-language models;L14 Cross-Attention / DiT / Prompt-to-Prompt13 文生圖與 VLM、14 Cross-attention/DiT/Q-Former、15 HW4
Scaling UpL15 Querying Transformer / Scaling Laws;L16 Mixture of Experts;L17 Distributed training;L18 Flash Attention / Efficient decoding16 Scaling laws 與 MoE、17 分散式訓練與高效推論
Advanced TopicsL19 Long Context;L20 Reasoning Models;L21 State Space / Hybrid Models;L22 Real-world Issues;L23 Code Generation / Autonomous Agents;L24 Audio;L25 Video;L26 Interactive World Models + Science of Alignment18 長上下文與 SSM、19 推理模型、20 風險與對齊、21 程式生成與 agent、22 語音、影片與世界模型

最後一篇 23 練習考卷、HW623 與期末專案收尾。

有三講的投影片跨了兩個主題:L9 的檔名是 vae-icl、L12 是 dpo-text2img、L15 是 querying-scaling。本系列依主題拆到兩篇,所以篇章和講次不是一對一。

評量時程

日期(2026)事件
1/14HW0 發布
1/26HW0 Slot A 截止、HW1 發布
1/28Quiz 1(L1–L4)
2/9HW1 Slot A 截止、HW2 發布
2/16Quiz 2(L5–L9)
2/21HW2 Slot A 截止、HW3 發布
2/25程式測驗 HW1/HW2、Quiz 3(L9–L12)
3/12HW3 Slot A 截止、HW4 發布
3/16Quiz 4(L12–L15)
3/23HW4 Slot A 截止、HW623 與練習題發布
3/27程式測驗 HW3/HW4
3/30考試(晚上舉行)
4/3、4/13專案 proposal、midway report 截止
4/6、4/20Quiz 5(L16–L20)、Quiz 6(L21–L24);4/20 HW623 截止
4/26–4/30專案海報截止、期末發表、期末報告截止

L15 之後沒有程式作業。後半段的驗收交給 Quiz 5–6、HW623 和專案;專案三人一組,在學期最後四週做完。

存取等級:A3,但缺口要講清楚

這門課評為 A3,因為自學需要的核心材料都在:26 講的投影片(講次表連到 40 個 PDF,其中 13 份是課堂上的手寫註記版,L26 有兩份投影片)、HW1–HW4 的 zip(題目 PDF、起始碼、單元測試、LaTeX 模板)、每份作業的 Overleaf 唯讀模板、HW623 說明、附解答的練習考卷,以及專案說明。

練習考卷是 Spring 2026 版,41 頁、167 分、13 大題,從 AutoDiff/RNN-LM 一路考到 Scaling Laws,正好可以拿來對照每個單元的自我檢核。

2026-09-30 逐一測試拿不到的東西:

材料狀態影響
講課與 recitation 錄影放在 SCS Panopto,講次表標明「Andrew ID Required」,要用 Canvas 登入;直播連結放在 Piazza全系列只能依投影片撰寫
往年錄影F25、S25、F24、S24 四個往年課站也都只連到 Panopto,沒有公開影片不用舊版影片補充
HW0 PyTorch Primer 題目檔Google Drive 連結回 401只能讀公開的 HW0 recitation Colab
HW1 recitation 投影片Google Slides 公開可讀
HW1 Supplemental MaterialDrive 回 401缺
HW2 recitation 投影片Google Slides 公開可讀
HW3、HW4 recitation 投影片回 401作業篇會註明
白板筆記講次表寫有 OneNote 筆記本,但連結是空的缺
Gradescope、6 次小考、2 次程式測驗、正式考卷、Piazza修課學生限定沒有批改,只能靠練習考卷解答與單元測試自評

另外,講次表從 L9 起多數講次沒有列 readings。本系列照原樣處理,只引用投影片本身,不自己補書單。

四份作業的算力門檻

作業主題(依第一講投影片)已核對的環境說明
HW0PyTorch Primer:影像與文字分類器題目檔 401;recitation Colab 教 PyTorch、LSTM、Weights & Biases、einops
HW1Large Language Models:在 Transformer LM 加上 GQA 與 RoPE題目 PDF 截止 2/9、總分 62;附 Colab(免費 T4)與 Kaggle(每週 30 小時 T4/V100)的設定說明
HW2Image Generation:diffusion model本系列 HW2 篇另行核對
HW3Adapters for LLMs:GPT-2 + LoRA題目 PDF 截止 3/12、總分 66;附 run_in_colab.ipynb 與 wandb_api.json,handout 寫明 Colab 有免費 T4
HW4Multimodal Foundation Models:文生圖題目 PDF 截止 3/23、總分 79;附 download_data.sh 與 run_in_cloud.ipynb,handout 建議用 CMU 信箱申請 Colab Pro、優先用 A100

HW4 的 Colab Pro 建議需要 CMU 信箱,校外讀者得自己找 GPU。細節留到各作業篇。

自學路線

只想建立概念:照講次表順序讀投影片,每個單元讀完,拿練習考卷對應的大題自我檢核。不做作業也能跟上,但你會錯過這門課最重的部分。

要做作業:

  1. 先跑 HW0 recitation Colab,確認 PyTorch 和 W&B 都會用。
  2. 每個單元讀完投影片後做對應作業:HW1 → HW2 → HW3 → HW4。書面題照 Slot A 的規矩先自己寫,程式題用 zip 裡的單元測試驗證。
  3. 做完四份作業後寫練習考卷,再對解答。
  4. 後半段(L15–L26)沒有作業,可以挑一個主題照專案說明的格式做小專案。

今晚可以做的一件事:打開講次表,下載 L1 投影片,同時開 HW0 recitation Colab 跑第一個 cell。

延伸閱讀

這門課和站內幾個系列有重疊。本系列每篇都會把內容講完整,下面只是想往深處走時的去處:

參考資料