版本說明:本系列以 CS 2881R Fall 2025 課站為準,所有事實於 2026-09-30 打開官方材料核對。存取等級 A3(以研討課標準),缺口清單見下文。
系列位置:這是入口篇|下一篇 L1:為什麼 AI 安全值得一門研究所課
CS 2881R AI Safety 是 Harvard 的研究所課,授課者是理論計算機科學家 Boaz Barak。課站對它的描述只有兩句:這是一門研究所層級的課,談人工智慧對齊與安全的挑戰,同時看技術面和社會影響。
它的 head TA Roy Rinberg 在期末回顧文的標題裡叫它「Harvard 的第一門 AI 安全課」。這門課的公開程度在研究所研討課裡少見:講課錄影、學生寫的週摘要、作業 repo、期末論文和海報都能在校外拿到。
這篇只回答三件事:去哪裡找材料、哪些東西拿得到、這個系列要怎麼讀。每一講的內容放在後面各篇。
課站在哪裡:網址沿用舊的 ML theory seminar
第一個會讓人找錯的地方是網址。課站掛在 Boaz 的 GitHub Pages 上,路徑是 boazbk.github.io/mltheoryseminar/,這是他過去開 ML 理論研討課時用的路徑。頁面底部還連著 Spring 2023 ML Theory Seminar 和 Spring 2021 的舊版。
現在打開根目錄,看到的是 Fall 2026。Fall 2025 被搬到 /fall2025/,頁面自標「Fall 2025 archive」。Fall 2026 首頁也寫明,上一屆的完整講課材料、錄影、筆記和實驗都保留在 Fall 2025 頁。
Fall 2025 的基本資料(全部來自課站):
- 時間:每週四 3:45pm–6:30pm(美東),第一講 2025-09-04,最後一講 11-20,11-27 感恩節停課
- 授課:Boaz Barak;TF 是 Roy Rinberg、Natalie Abreu、Hanlin Zhang、Sunny Qin
- 課程型態:課站的 Mini Syllabus 寫每一講除了講課,還有討論和一組學生的實驗報告;出席強制
- 生成式 AI 政策:鼓勵學生盡量使用,課站也寫因此對作業和專題的期待會比往年更有企圖心
- 錄影政策:盡可能錄影並公開,但使用教室固定攝影機,白板和討論可能收不清楚;客座講者要求不錄就不錄
為什麼以 Fall 2025 為基準
Fall 2026 的首頁課表排到 12-03,到今天(2026-09-30)只上完 9 月的 4 講,還不是完整學期。YouTube 播放清單目前 17 支影片,其中已經混入 Fall 2026 的 Lecture 1 和 Lecture 3。
Fall 2025 則是完整結束的一屆:12 講上完,期末論文在 12-03 繳交,12-10 帶著印好的海報到課堂發表(依 Rinberg 的回顧)。學生專題頁列出 19 份論文 PDF 和海報。
所以這個系列以 Fall 2025 為主線。Fall 2026 的材料只放在本篇最後一節當預覽。
存取分級:A3,但要先看缺口
本站的全球 AI/CS 課程地圖把公開程度分成 A0 課表可見、A1 課綱可見、A2 教材部分開放、A3 足以自學。CS 2881R 在本系列標 A3(以研討課標準),理由是這門課本來就不是習題課,它的學習路徑是「讀論文 → 重現 → 延伸」,而這條路徑需要的材料都在校外拿得到:
| 材料 | 狀態 |
|---|---|
| 閱讀清單 | 12 講全部公開在課站,每講標出 pre-reading |
| 講課錄影 | 播放清單 17 支;Fall 2025 有 11 講有講課影片(L8 只有 Boaz 的開場) |
| 課堂筆記 | 學生寫的 LessWrong 週摘要,收在 wikitag「CS 2881r」 |
| 學生實驗 | 多數講次附投影片、GitHub 或 LessWrong 文 |
| HW0 | 公開 GitHub repo,含評分用的 LLM-as-judge 腳本 |
| 期中 mini-project | 規格投影片與評分表,連結由 Rinberg 回顧文公開 |
| 期末專題 | 專題說明、評分表、學生論文與海報、口頭報告錄影 |
| 課程評鑑 | Harvard 官方 Q-report PDF |
缺口清單(校外讀者要自己補或接受缺席的部分):
- 沒有傳統 problem set。「作業」是論文重現與開放式研究,Rinberg 回顧裡學生的批評之一就是希望有選修的習題或動手練習。
- L5 Content Policies 沒有講課錄影。課站只列了學生實驗影片,客座講者是 OpenAI 的 Ziad Reslan。
- L8 Scheming 只有 Boaz 的開場影片。Buck Shlegeris 和 Marius Hobbhahn 的客座演講課站只附投影片。
- 投影片只有約一半講次公開。L1、L2、L4、L6 和 L8 的 Boaz 投影片放在 Harvard SharePoint;L7、L8 客座與 L10 的 Neel Nanda 投影片另有連結。L3、L5、L9、L11、L12 沒有列投影片。
- 學生週摘要不完整。wikitag 下的週摘要只涵蓋部分週次,其餘是學生實驗文。
- 多講的實驗欄寫 TBD。L6 寫「To be determined」加一段構想,L7 寫「TBD」,L9、L10、L11 寫「To be determined」,L12 的 Resources 寫「to be determined」。
- HW0 的自動評分只對修課生有效。GitHub Classroom 用課程的 OpenAI 金鑰跑評分,校外讀者要自己準備 API 金鑰跑
eval/judge.py。
如果你的目標是「做完一套有標準答案的練習」,這門課給不了。如果目標是學會怎麼讀一篇 AI 安全論文、把它的主圖重現出來、再往前推一步,這門課的公開材料足夠。
先修:CS 181 程度的 ML,加上能訓練神經網路
課站的先修寫得很具體:數學成熟度、會寫證明、機率和資訊理論,加上大學部 ML 課的程度,舉的例子是 Harvard CS 181 或 MIT 6.036。它點名你該熟悉 empirical 與 population loss、梯度下降、神經網路、線性迴歸、PCA。實作面要會寫 Python、能訓練一個基本的神經網路。
站內對應的前置:
- 本站的 Harvard CS 181 導讀 就是課站點名的那門課
- HW0 要用 LoRA 微調 1B 模型;沒碰過 LoRA,可以先看 CMU 11-868 的 PEFT/LoRA 篇
Rinberg 的回顧提到 Fall 2025 約 70 名學生,大約一半是資深大學部學生,其餘是研究生。他也認為這門課如果開成大學部課不會這麼順,因為整個結構依賴學生自己想學、而不是追分數。
利益揭露:課站原文
課站在 Mini Syllabus 裡放了一段標題全大寫的「POTENTIAL CONFLICT OF INTEREST NOTE」。原文第一句:
In addition to his position at Harvard, Boaz is also a member of the technical staff at OpenAI.
接著課站說明課程會討論多家廠商的模型,也鼓勵學生使用多家的 AI;學生若對此有疑慮,可以找 Boaz、其他教學人員或 Harvard SEAS 行政單位。最後一句是 Boaz 自己的話:課程畢業生不論在學界、非營利組織、政府,或 OpenAI 的任何競爭對手做 AI 安全,他都會視為課程的成功。
讀這個系列時可以把這段放在心上。L5 和 L9 的客座講者分別是 OpenAI 的產品政策人員和首席經濟學家,L12 兩位客座也來自 OpenAI。這些是課站上寫的講者身分,本系列會照實標出。
官方順序與本系列閱讀順序
官方課表把技術講和社會講交錯排。本系列改用學習者的順序:先看到失準、再看它怎麼被訓練出來和被攻破、再看規範怎麼寫、動手重現、再看最難偵測的風險與偵測工具,最後拉到時間軸和社會衝擊。每篇標題都保留官方講次編號。
| 本系列 order | 篇目 | 官方講次與日期 |
|---|---|---|
| 0 | 本篇 | — |
| 1 | L1 Introduction | L1,9/4 |
| 2 | HW0:重現 emergent misalignment | 開學前(截止 2025-08-04) |
| 3 | L2 Modern LLM Training | L2,9/11 |
| 4 | L3 Adversarial Robustness | L3,9/18 |
| 5 | L4 Model Specifications | L4,9/25 |
| 6 | L5 Content Policies | L5,10/2 |
| 7 | 期中 mini-project | 期中 |
| 8 | L8 Scheming & Deception | L8,10/23 |
| 9 | L10 Interpretability | L10,11/6 |
| 10 | L6 Recursive Self-Improvement | L6,10/9 |
| 11 | L7 Capabilities vs. Safety | L7,10/16 |
| 12 | L9 Economic Impacts | L9,10/30 |
| 13 | L11 Emotional Reliance | L11,11/13 |
| 14 | L12 AI 2035 | L12,11/20 |
| 15 | 期末專題與課程回顧 | 12/3 論文、12/10 海報 |
把 HW0 排在 L1 之後、L2 之前,是因為 HW0 在官方時間線上本來就早於第一講:它是選課門檻,截止日在開學前一個月。L1 課堂上的學生實驗,也是 HW0 的延伸。
Fall 2026 預覽(補充,不是主線)
以下只是新學期的樣貌,本系列主線不引用:
- 課表換了一批講題。Fall 2026 首頁列出 Cyber Capabilities、RL for Post-Training、Open-Source Models、Alignment in the Age of RSI、AI Biosecurity 等 Fall 2025 沒有的講題,12-03 那一講標的是 Ajeya Cotra。
- HW0 換題。Fall 2026 HW0 的題目是「J-space 與模型 chain of thought 的關係」,預估 4–16 小時,繳交約兩頁報告加私有 GitHub repo,截止 2026-08-05。
- 作業結構寫得更明確。首頁寫這屆要在課堂上報告實驗、寫 scribe notes、做期末專題,可能還有作業或 mini-project。
- 已上傳的影片。播放清單已有 Fall 2026 Lecture 1 和 Lecture 3。
HW0 頁自己也說,去年的講課和筆記可以參考,但領域變化快,今年內容會不同。Fall 2026 結束後,本系列再評估要不要另寫更新。
站內延伸閱讀
本系列每篇都自成一體,和站內其他課程重疊的地方只放延伸連結:
- LLM 訓練與 RLHF:Stanford CS336 導讀、Stanford CME295 導讀
- 強化學習基礎:Berkeley CS285 Spring 2026 導讀
- 可解釋性:CS224U 分析方法:probing 與 attribution
- Prompt injection 與 agent 安全實務:Agent 安全的 harness 層
- LLM-as-judge:Stanford CS329Z Week 8:模型當裁判與護欄
- Harvard 其他課:Harvard AI/ML 課程地圖
今晚可以做的一件事:打開 HW0 repo 的 README,看完「Instructions」三步,判斷你手上的 GPU 或雲端額度跑不跑得動 1B 模型的 LoRA 微調。
參考資料
- CS 2881R AI Safety, Fall 2025 課站 — 課程描述、先修、Mini Syllabus、利益揭露、12 講課表與閱讀清單
- CS 2881R Fall 2026 首頁 — 新學期課表、作業結構、上一屆材料保留說明
- CS 2881R Fall 2026 Homework Zero — 新 HW0 題目、時數、繳交要求
- CS 2881R YouTube 播放清單 — 講課錄影(2026-09-30 共 17 支)
- LessWrong wikitag:CS 2881r — 學生週摘要與實驗文
- Harvard-CS-2881/harvard-cs-2881-hw0 — Fall 2025 HW0 repo
- Student Final Projects - Fall 2025 — 19 份期末論文與海報
- 期末口頭報告錄影
- Roy Rinberg, Reflections on TA-ing Harvard's first AI safety course(LessWrong, 2026-01-15) — 學生人數、作業結構、期末日期、期中與期末文件連結
- CS2881 Mini-project 說明投影片、Mini Project Grading
- cs2881 Final Project Outline、Final Project Grading Rubric
- Harvard Q-report(課程評鑑)
- Turner et al., Model Organisms for Emergent Misalignment (arXiv 2506.11613) — HW0 依據的論文
Loading...