本文依據 CMU 10-423/623/723 Generative AI Spring 2026 版。 這是 CMU 10-423 導讀系列的最後一篇(第 23 篇),接續 L24–L26:語音、影片生成與互動式世界模型。前面四篇作業導讀(HW1、HW2、HW3、HW4)講的是程式作業,這一篇講作業以外的驗收方式。
用到的官方材料:課程首頁的課綱、講次表、Coursework 頁、練習考卷(41 頁)與解答(44 頁)、HW623 handout(4 頁)、專案 handout(12 頁)。這門課的存取等級是 A3(等級定義見全球 AI/CS 課程地圖)。但本篇涉及的正式考卷、小考、程式測驗題目、Gradescope 評分與 Piazza 公告全都不公開,校外只能拿到練習材料和規則。
這一篇要回答的是:一門課除了作業,還用什麼判斷你學會了?校外讀者手上只有公開材料時,又能怎麼檢查自己?
驗收方式總覽
課綱列出三種課號的配分。三者內容相同,差別只在 10-623 多做 HW623,10-723 再多一份 Quiz723:
| 項目 | 10-423 | 10-623 | 10-723 |
|---|---|---|---|
| 作業 | 30%(5 份) | 30%(6 份,多 HW623) | 30%(6 份) |
| 課堂小考 | 10%(6 次,最低分算半權重) | 10%(同左) | 10%(6 次,等權重) |
| 程式測驗 | 10%(2 次) | 10% | 10% |
| 考試 | 20%(1 次) | 20% | 20% |
| 專案 | 25% | 25% | 25% |
| 參與 | 5% | 5% | 5% |
講次表上的時程:
| 日期(2026) | 事件 |
|---|---|
| 1/28 | Quiz 1(L1–L4) |
| 2/16 | Quiz 2(L5–L9) |
| 2/25 | Programming Test HW1/HW2;Quiz 3(L9–L12) |
| 3/13 | 專案組隊截止(下午 2 點) |
| 3/16 | Quiz 4(L12–L15) |
| 3/23 | HW623 發布;練習題發布 |
| 3/27 | Programming Test HW3/HW4 |
| 3/30 | 考試(晚上,細節在 Piazza 公布) |
| 4/3 | 專案 proposal 截止 |
| 4/6 | Quiz 5(L16–L20) |
| 4/13 | 專案期中報告截止 |
| 4/20 | HW623 截止;Quiz 6(L21–L24) |
| 4/26 | 專案海報截止 |
| 4/28 | 專案期末發表(晚上 5:30–8:30,GHC 6121 與 6115) |
| 4/30 | 專案期末報告截止 |
小考、程式測驗與考試的規則
課綱對三種測驗的描述:
- 小考:除非另有說明都是閉書,在週一、三、五的課堂上舉行,定位是比考試「低風險」的評量。
- 程式測驗:聚焦在作業裡練過的程式能力,閉書,必須出席。
- 考試:閉書、綜合性,在課堂時段舉行,日期以講次表為準。
官方材料之間有兩處不一致,照實列出:
- Coursework 頁寫「There will be 5 quizzes」,底下卻列了 Quiz 1 到 Quiz 6;課綱與講次表都是 6 次。
- 課綱說第二次程式測驗考「HW4/HW5」,但這學期只有 HW1–HW4,講次表寫的是「Programing Test HW3/HW4」。本文以講次表為準。
這些題目都沒有公開。校外能對照的只有練習考卷。
練習考卷:13 大題、167 分
練習考卷標題是「Spring 2026 Practice Questions」,日期 03/30/26,考試時間寫「NA」。封面規則寫明考試時不能使用電子裝置。Coursework 頁把它放在「Midterm Exam」底下,和解答並列。
| 大題 | 主題 | 分數 | 對應本系列 |
|---|---|---|---|
| 1 | AutoDiff / RNN-LMs | 11 | order 1 |
| 2 | Transformers and LLMs | 30 | order 2 |
| 3 | Learning neural language models / Decoding | 8 | order 2 |
| 4 | Pre-training, fine-tuning / Modern Transformers | 17 | order 3 |
| 5 | Vision Transformers | 14 | order 5 |
| 6 | GANs | 9 | order 6 |
| 7 | VAEs | 8 | order 8 |
| 8 | Diffusion Models | 8 | order 7 |
| 9 | In-context Learning | 8 | order 10 |
| 10 | RLHF / DPO | 12 | order 11 |
| 11 | Text-to-image Models and VLMs | 19 | order 13 |
| 12 | Prompt2Prompt | 19 | order 14 |
| 13 | Scaling Laws | 4 | order 16 |
從表上可以讀出三件事:
- 範圍停在 Scaling Laws。考試在 3 月 30 日,正好是 L20 那天,所以 L17 以後的分散式訓練、長上下文、推理模型、agent、音訊影片都不在練習考卷裡。
- 文字單元占最重。前四大題加起來 66 分,將近四成。
- 多模態被考得很細。第 11、12 兩大題共 38 分,Prompt2Prompt 一個方法就占 19 分。
題型以選擇題為主,分成單選(Select one)、複選(Select all that apply)、是非題,另有不少簡答題,例如解釋某個設計的優缺點、寫出某個訓練目標兩項的直覺意義。有些題目直接連到作業,例如第 11 大題的第一小題開頭就是「In Homework 4…」。也有幾處小瑕疵:第 7.1 小題標 0 分;第 13 大題總分 4 分,但只有兩小題標了分數。
解答版多了 3 頁,照原題標出正確選項與簡答。本文不轉貼答案。
HW623:角色扮演論文報告
HW623 只有註冊 10-623/723 的學生要做。課綱說它著重在「理解、解釋、評估生成式 AI 近期文獻中的關鍵主題」。Handout 標示 3/30/26 發布、4/20/26 截止(講次表則把發布標在 3/23)。
要做什麼
讀一篇近期的生成式 AI 論文,錄一段短報告,採用 Colin Raffel 與 Alec Jacobson 的角色扮演法。從六種角色選一種:
| 角色 | 任務 |
|---|---|
| 科學審稿人 | 照 NeurIPS 審稿指引寫完整審查,回答 Review Form 的第 1–10 題並給總分 |
| 考古學家 | 找出一篇深刻影響本篇的前作,以及一篇引用本篇的後續論文 |
| 學術研究者 | 提出一個以本篇為基礎的假想後續計畫,假設它成功了,用五點結構的論文引言形式呈現 |
| 業界從業者 | 為你選的產品或應用寫詳細描述,說服別人付錢讓你把論文方法用上去 |
| 私家偵探 | 調查其中一位作者:在哪工作、念什麼、哪些前作引向這篇、動機是什麼 |
| 社會影響評估者 | 找出論文怎麼自評正負面影響,補上被遺漏的正面影響與被忽略的負面影響 |
幾條規則:
- 不論哪個角色,報告都要先摘要論文。
- 可以不開鏡頭(像 Khan Academy 那樣)。
- 要做投影片,和錄影一起交。
- 交件後,所有人的報告影片會透過 Piazza 分享給全班。
- AI 使用:可以用 AI 幫助理解論文,但所有繳交的材料都必須是自己做的,不得有 AI 協助。
長度的說法前後不一:第一節寫「5–10 分鐘」,錄影步驟寫「報告 7–10 分鐘,超過 11 分鐘會扣分」。錄影流程是在 Zoom 的個人會議室錄到雲端,把分享資訊貼到 Gradescope,再上傳 PDF 投影片。
論文清單
清單共 33 篇,想報清單外的論文要在 Piazza 私訊講師說明理由。依本系列的單元粗分:
完整 33 篇請直接看 handout 第 2–3 頁。
期末專案:三人一組、要求 replication
Coursework 頁說專案在課程最後 4 週完成。專案 handout(編譯日期 2026 年 4 月 15 日)開頭給出專案的四個步驟:找一個真實資料集上的生成建模問題、用合適的指標建立 baseline、設計在受控條件下比較多種演算法的實驗、透過 milestones 回報結果。
Milestones 與配分
| Milestone | 截止 | 篇幅 | 配分 |
|---|---|---|---|
| 組隊(3 人,Google 表單) | 3/13 下午 2 點 | — | 2.5% |
| Proposal | 4/3 | 2–3 頁 | 15% |
| Liaison meeting 1 | 4/5–4/9 | — | — |
| Midway Executive Summary | 4/13 | 3–4 頁 | 20% |
| Liaison meeting 2 | 4/21–4/26 | — | — |
| Final Poster | 4/26 上傳 PDF | 9 張投影片排成 3×3,加 3×1 標題列 | 20% |
| Final Executive Summary | 4/30 | 5–6 頁,可加附錄 | 32.5% |
| Code Upload | 與期末報告同時 | — | 10% |
人數不是 3 人的組會被重新分組。Proposal 和期中報告不能有附錄;期末報告可以有,但超過 6 頁會扣分。海報發表是 9 分鐘報告加 3 分鐘問答。
評分看什麼
Handout 裡有幾條會直接影響你怎麼選題:
- 不比 state-of-the-art:不會以最終結果和最佳成績比較來評分,選 baseline 時可以優先考慮程式速度、結構簡單、是否使用 PyTorch 等熟悉的函式庫。
- 起點會被納入考量:從零開始寫、實驗較少的組,和從既有實作出發、程式較少但實驗較多的組,都可能拿高分;兩者都要在報告裡記錄時間花在哪。
- Novelty 鼓勵但不強制:重新實作一個沒有公開實作的方法本身就可以是主要貢獻。
- 必須 replicate 至少一個文獻結果:要有一張表並列原論文的數字和你的重現結果。重現不必完全一致,例如原文 92.3、你只到 91.9,這很常見。Handout 特別區分 replication(重現結果)和 reimplementation(重寫程式)。
- 可以縮小規模:用資料子集或較小的模型都可以,只要清楚記錄決定與理由。
期中和期末報告都要寫一節「Thought-Experiment on Compute」:實際用了多少 GPU/TPU 小時、什麼型號、折合多少美元,以及如果有價值 1,000 美元的雲端 GPU 額度,你會怎麼做。期末報告還要有「Research Log」,交代走過的彎路和卡關點;handout 說這一節「可以說是最重要的部分」。
AI Assistance Policy
專案可以用 AI,但隊伍對繳交的一切負責,而且必須有實質的人類工作。期中報告、海報、期末報告都要明確寫出五件事:
- 專案的哪些部分用了 AI 協助
- 用了哪些 AI 工具
- 怎麼使用
- 哪些部分主要由人完成
- 怎麼檢查產出的程式、分析或文字是正確、可信的
期中報告還要說明之後打算怎麼用 AI。Handout 寫明,助教可能在 liaison meeting 和海報問答時要你用自己的話解釋程式、實驗與設計選擇;沒有揭露 AI 使用、或解釋不出核心部分,都會扣專案分數。這和作業的 Slot A/Slot B 制度是同一個精神:先證明是你自己懂,再談用 AI 提高效率。
校外讀者怎麼自我檢核
正式題目拿不到,但練習考卷、HW623 和專案 handout 足以組成一套自我檢核流程:
- 先寫、後對答案。印出練習考卷,不看講義寫完一個大題,再打開解答對照。這就是課程 Slot A/Slot B 的順序。
- 用分數找弱點。把每大題的得分率填回上面那張對照表,低於一半的大題回去重讀對應的系列文章與投影片。
- 簡答題要說得出「為什麼」。選擇題對了不代表懂;簡答題寫不出兩句理由的,就算沒過。
- L17 以後的講次自己出題。練習考卷沒涵蓋後段,可以照 Quiz 5、6 的範圍(L16–L20、L21–L24),每講挑投影片上的兩個「Question / Answer」頁當題目。
- 用 HW623 的角色讀一篇論文。從 33 篇清單挑一篇和你最弱單元相關的,選「考古學家」或「審稿人」角色,錄一段 10 分鐘內的報告給自己聽。
- 把專案縮成一個週末版。挑一個生成任務,只做兩件事:重現一個論文數字、寫一頁 Thought-Experiment on Compute。這兩件事就是 handout 最在意的部分。
怎麼做:今晚只做練習考卷的第 4 大題(17 分,Modern Transformers),限時 25 分鐘、不看講義,寫完再對解答。這題涵蓋 LoRA、RoPE、auto-encoder,剛好橫跨系列前三分之一。
這一篇可以確認與不能確認的
可以確認:課綱配分、講次表的日期、Coursework 頁的清單、練習考卷與解答的結構、HW623 與專案 handout 的內容。不能確認:正式考卷的題目與範圍(只有練習考卷,課綱只說考試是綜合性的)、小考與程式測驗的題目和形式、Quiz723 的內容、助教評分細則、Piazza 上的補充公告。上面標出的三處官方材料不一致(小考次數、第二次程式測驗範圍、HW623 報告長度),本文無法判斷哪個是最終版本。
延伸閱讀:想看其他課怎麼安排專案與考試,可以對照 CMU 11-785 導讀(同屬本課先修清單)和 Stanford CS336 導讀。
系列導覽:上一篇 L24–L26:語音、影片生成與互動式世界模型|這是最後一篇|系列總覽
參考資料
Loading...