Skip to content

CMU 10-423 收尾:練習考卷、HW623 論文報告與期末專案——課程怎麼驗收,校外怎麼自我檢核

2026年9月30日1 分鐘
TL;DRCMU 10-423 除了四份作業,還用四種方式驗收:6 次課堂小考、2 次程式測驗、1 次綜合考試,以及占 25% 的三人期末專案;10-623/723 另外多一份 HW623 論文報告。校外拿得到的是附解答的練習考卷(13 大題、167 分)、HW623 題目與 33 篇論文清單、12 頁的專案 handout。本篇整理它們的結構與規則,並給出不用看解答也能自我檢核的方法。

🌏 English version

本文依據 CMU 10-423/623/723 Generative AI Spring 2026 版。 這是 CMU 10-423 導讀系列的最後一篇(第 23 篇),接續 L24–L26:語音、影片生成與互動式世界模型。前面四篇作業導讀(HW1、HW2、HW3、HW4)講的是程式作業,這一篇講作業以外的驗收方式。

用到的官方材料:課程首頁的課綱、講次表、Coursework 頁、練習考卷(41 頁)與解答(44 頁)、HW623 handout(4 頁)、專案 handout(12 頁)。這門課的存取等級是 A3(等級定義見全球 AI/CS 課程地圖)。但本篇涉及的正式考卷、小考、程式測驗題目、Gradescope 評分與 Piazza 公告全都不公開,校外只能拿到練習材料和規則。

這一篇要回答的是:一門課除了作業,還用什麼判斷你學會了?校外讀者手上只有公開材料時,又能怎麼檢查自己?

驗收方式總覽

課綱列出三種課號的配分。三者內容相同,差別只在 10-623 多做 HW623,10-723 再多一份 Quiz723:

項目10-42310-62310-723
作業30%(5 份)30%(6 份,多 HW623)30%(6 份)
課堂小考10%(6 次,最低分算半權重)10%(同左)10%(6 次,等權重)
程式測驗10%(2 次)10%10%
考試20%(1 次)20%20%
專案25%25%25%
參與5%5%5%

講次表上的時程:

日期(2026)事件
1/28Quiz 1(L1–L4)
2/16Quiz 2(L5–L9)
2/25Programming Test HW1/HW2;Quiz 3(L9–L12)
3/13專案組隊截止(下午 2 點)
3/16Quiz 4(L12–L15)
3/23HW623 發布;練習題發布
3/27Programming Test HW3/HW4
3/30考試(晚上,細節在 Piazza 公布)
4/3專案 proposal 截止
4/6Quiz 5(L16–L20)
4/13專案期中報告截止
4/20HW623 截止;Quiz 6(L21–L24)
4/26專案海報截止
4/28專案期末發表(晚上 5:30–8:30,GHC 6121 與 6115)
4/30專案期末報告截止

小考、程式測驗與考試的規則

課綱對三種測驗的描述:

  • 小考:除非另有說明都是閉書,在週一、三、五的課堂上舉行,定位是比考試「低風險」的評量。
  • 程式測驗:聚焦在作業裡練過的程式能力,閉書,必須出席。
  • 考試:閉書、綜合性,在課堂時段舉行,日期以講次表為準。

官方材料之間有兩處不一致,照實列出:

  1. Coursework 頁寫「There will be 5 quizzes」,底下卻列了 Quiz 1 到 Quiz 6;課綱與講次表都是 6 次。
  2. 課綱說第二次程式測驗考「HW4/HW5」,但這學期只有 HW1–HW4,講次表寫的是「Programing Test HW3/HW4」。本文以講次表為準。

這些題目都沒有公開。校外能對照的只有練習考卷。

練習考卷:13 大題、167 分

練習考卷標題是「Spring 2026 Practice Questions」,日期 03/30/26,考試時間寫「NA」。封面規則寫明考試時不能使用電子裝置。Coursework 頁把它放在「Midterm Exam」底下,和解答並列。

大題主題分數對應本系列
1AutoDiff / RNN-LMs11order 1
2Transformers and LLMs30order 2
3Learning neural language models / Decoding8order 2
4Pre-training, fine-tuning / Modern Transformers17order 3
5Vision Transformers14order 5
6GANs9order 6
7VAEs8order 8
8Diffusion Models8order 7
9In-context Learning8order 10
10RLHF / DPO12order 11
11Text-to-image Models and VLMs19order 13
12Prompt2Prompt19order 14
13Scaling Laws4order 16

從表上可以讀出三件事:

  • 範圍停在 Scaling Laws。考試在 3 月 30 日,正好是 L20 那天,所以 L17 以後的分散式訓練、長上下文、推理模型、agent、音訊影片都不在練習考卷裡。
  • 文字單元占最重。前四大題加起來 66 分,將近四成。
  • 多模態被考得很細。第 11、12 兩大題共 38 分,Prompt2Prompt 一個方法就占 19 分。

題型以選擇題為主,分成單選(Select one)、複選(Select all that apply)、是非題,另有不少簡答題,例如解釋某個設計的優缺點、寫出某個訓練目標兩項的直覺意義。有些題目直接連到作業,例如第 11 大題的第一小題開頭就是「In Homework 4…」。也有幾處小瑕疵:第 7.1 小題標 0 分;第 13 大題總分 4 分,但只有兩小題標了分數。

解答版多了 3 頁,照原題標出正確選項與簡答。本文不轉貼答案。

HW623:角色扮演論文報告

HW623 只有註冊 10-623/723 的學生要做。課綱說它著重在「理解、解釋、評估生成式 AI 近期文獻中的關鍵主題」。Handout 標示 3/30/26 發布、4/20/26 截止(講次表則把發布標在 3/23)。

要做什麼

讀一篇近期的生成式 AI 論文,錄一段短報告,採用 Colin Raffel 與 Alec Jacobson 的角色扮演法。從六種角色選一種:

角色任務
科學審稿人照 NeurIPS 審稿指引寫完整審查,回答 Review Form 的第 1–10 題並給總分
考古學家找出一篇深刻影響本篇的前作,以及一篇引用本篇的後續論文
學術研究者提出一個以本篇為基礎的假想後續計畫,假設它成功了,用五點結構的論文引言形式呈現
業界從業者為你選的產品或應用寫詳細描述,說服別人付錢讓你把論文方法用上去
私家偵探調查其中一位作者:在哪工作、念什麼、哪些前作引向這篇、動機是什麼
社會影響評估者找出論文怎麼自評正負面影響,補上被遺漏的正面影響與被忽略的負面影響

幾條規則:

  • 不論哪個角色,報告都要先摘要論文。
  • 可以不開鏡頭(像 Khan Academy 那樣)。
  • 要做投影片,和錄影一起交。
  • 交件後,所有人的報告影片會透過 Piazza 分享給全班。
  • AI 使用:可以用 AI 幫助理解論文,但所有繳交的材料都必須是自己做的,不得有 AI 協助。

長度的說法前後不一:第一節寫「5–10 分鐘」,錄影步驟寫「報告 7–10 分鐘,超過 11 分鐘會扣分」。錄影流程是在 Zoom 的個人會議室錄到雲端,把分享資訊貼到 Gradescope,再上傳 PDF 投影片。

論文清單

清單共 33 篇,想報清單外的論文要在 Piazza 私訊講師說明理由。依本系列的單元粗分:

單元清單上的例子
文字 LLM 與架構Mamba、The Era of 1-bit LLMs、Transformers without Normalization、Overtrained Language Models Are Harder to Fine-Tune
對齊與推理Constitutional AI、DPO、Tree of Thoughts、DeepSeekMath
圖像與影片生成DiT、ControlNet、Video Diffusion Models、HART、NeRF
多模態BLIP-2、Visual Instruction Tuning、ImageBind、RT-2
Agent 與工具ToolLLM、AutoGen、WebArena、CRITIC、Mixture-of-Agents
風險與可解釋性Progress measures for grokking、Extracting memorized pieces of (copyrighted) books

完整 33 篇請直接看 handout 第 2–3 頁。

期末專案:三人一組、要求 replication

Coursework 頁說專案在課程最後 4 週完成。專案 handout(編譯日期 2026 年 4 月 15 日)開頭給出專案的四個步驟:找一個真實資料集上的生成建模問題、用合適的指標建立 baseline、設計在受控條件下比較多種演算法的實驗、透過 milestones 回報結果。

Milestones 與配分

Milestone截止篇幅配分
組隊(3 人,Google 表單)3/13 下午 2 點—2.5%
Proposal4/32–3 頁15%
Liaison meeting 14/5–4/9——
Midway Executive Summary4/133–4 頁20%
Liaison meeting 24/21–4/26——
Final Poster4/26 上傳 PDF9 張投影片排成 3×3,加 3×1 標題列20%
Final Executive Summary4/305–6 頁,可加附錄32.5%
Code Upload與期末報告同時—10%

人數不是 3 人的組會被重新分組。Proposal 和期中報告不能有附錄;期末報告可以有,但超過 6 頁會扣分。海報發表是 9 分鐘報告加 3 分鐘問答。

評分看什麼

Handout 裡有幾條會直接影響你怎麼選題:

  • 不比 state-of-the-art:不會以最終結果和最佳成績比較來評分,選 baseline 時可以優先考慮程式速度、結構簡單、是否使用 PyTorch 等熟悉的函式庫。
  • 起點會被納入考量:從零開始寫、實驗較少的組,和從既有實作出發、程式較少但實驗較多的組,都可能拿高分;兩者都要在報告裡記錄時間花在哪。
  • Novelty 鼓勵但不強制:重新實作一個沒有公開實作的方法本身就可以是主要貢獻。
  • 必須 replicate 至少一個文獻結果:要有一張表並列原論文的數字和你的重現結果。重現不必完全一致,例如原文 92.3、你只到 91.9,這很常見。Handout 特別區分 replication(重現結果)和 reimplementation(重寫程式)。
  • 可以縮小規模:用資料子集或較小的模型都可以,只要清楚記錄決定與理由。

期中和期末報告都要寫一節「Thought-Experiment on Compute」:實際用了多少 GPU/TPU 小時、什麼型號、折合多少美元,以及如果有價值 1,000 美元的雲端 GPU 額度,你會怎麼做。期末報告還要有「Research Log」,交代走過的彎路和卡關點;handout 說這一節「可以說是最重要的部分」。

AI Assistance Policy

專案可以用 AI,但隊伍對繳交的一切負責,而且必須有實質的人類工作。期中報告、海報、期末報告都要明確寫出五件事:

  1. 專案的哪些部分用了 AI 協助
  2. 用了哪些 AI 工具
  3. 怎麼使用
  4. 哪些部分主要由人完成
  5. 怎麼檢查產出的程式、分析或文字是正確、可信的

期中報告還要說明之後打算怎麼用 AI。Handout 寫明,助教可能在 liaison meeting 和海報問答時要你用自己的話解釋程式、實驗與設計選擇;沒有揭露 AI 使用、或解釋不出核心部分,都會扣專案分數。這和作業的 Slot A/Slot B 制度是同一個精神:先證明是你自己懂,再談用 AI 提高效率。

校外讀者怎麼自我檢核

正式題目拿不到,但練習考卷、HW623 和專案 handout 足以組成一套自我檢核流程:

  1. 先寫、後對答案。印出練習考卷,不看講義寫完一個大題,再打開解答對照。這就是課程 Slot A/Slot B 的順序。
  2. 用分數找弱點。把每大題的得分率填回上面那張對照表,低於一半的大題回去重讀對應的系列文章與投影片。
  3. 簡答題要說得出「為什麼」。選擇題對了不代表懂;簡答題寫不出兩句理由的,就算沒過。
  4. L17 以後的講次自己出題。練習考卷沒涵蓋後段,可以照 Quiz 5、6 的範圍(L16–L20、L21–L24),每講挑投影片上的兩個「Question / Answer」頁當題目。
  5. 用 HW623 的角色讀一篇論文。從 33 篇清單挑一篇和你最弱單元相關的,選「考古學家」或「審稿人」角色,錄一段 10 分鐘內的報告給自己聽。
  6. 把專案縮成一個週末版。挑一個生成任務,只做兩件事:重現一個論文數字、寫一頁 Thought-Experiment on Compute。這兩件事就是 handout 最在意的部分。

怎麼做:今晚只做練習考卷的第 4 大題(17 分,Modern Transformers),限時 25 分鐘、不看講義,寫完再對解答。這題涵蓋 LoRA、RoPE、auto-encoder,剛好橫跨系列前三分之一。

這一篇可以確認與不能確認的

可以確認:課綱配分、講次表的日期、Coursework 頁的清單、練習考卷與解答的結構、HW623 與專案 handout 的內容。不能確認:正式考卷的題目與範圍(只有練習考卷,課綱只說考試是綜合性的)、小考與程式測驗的題目和形式、Quiz723 的內容、助教評分細則、Piazza 上的補充公告。上面標出的三處官方材料不一致(小考次數、第二次程式測驗範圍、HW623 報告長度),本文無法判斷哪個是最終版本。

延伸閱讀:想看其他課怎麼安排專案與考試,可以對照 CMU 11-785 導讀(同屬本課先修清單)和 Stanford CS336 導讀。

系列導覽:上一篇 L24–L26:語音、影片生成與互動式世界模型|這是最後一篇|系列總覽

參考資料