目錄
- 4/2 Overview(授課者)
- 4/9 JEPA 與世界模型(Hazel Nam、Lucas Maes)
- 4/16 SSM 與 Transformer 的取捨(Albert Gu)← 技術密度最高
- 4/23 Ultra-Scale:擴到上千張 GPU(Nouamane Tazi, Hugging Face)
- 4/30 預訓練的未來(Shrimai Prabhumoye, Mistral AI)
- 5/7 參數 vs 脈絡的兩種泛化(Andrew Lampinen, Anthropic)
- 5/14 協作 AI agent 推進科學(Vivek Natarajan, DeepMind)
- 5/21 從語言模型到原生多模態(Victoria Lin, Thinking Machines)
- 5/28 生產環境的推論服務(Charles Frye, Modal)← 最實用
- 參考資料
CS25: Transformers United 是 Stanford 的一門研討課,2026 年春季跑到第六季。它不教你 Transformer 怎麼運作——那是 CS224N 和 CS336 的事——它做的是每週把一個正在做這件事的人請上台,讓學生當場舉手問。這篇拆解這一季的講座各講了什麼、哪幾場值得花時間,以及議程上沒寫、但講者彼此接起來的三條主線。
這門課是什麼
課程結構刻意做得很輕:1 學分、Satisfactory/No Credit 評分,官方課程頁寫得很直白——唯一的作業是每週出席。沒有考試、沒有專案、沒有評量。
換來的是兩件事。一是議程每年可以完全重排,只有第一週的 Overview 由授課團隊自己講,其餘八週各自獨立,看單集就好,不必從頭追。二是它對外完全開放:現場旁聽、Zoom 直播、YouTube 錄影三軌並行,官方頁明說不需要報名、也不需要跟 Stanford 有任何關係。錄影約兩到三週後上同一個播放清單。
課程從 2021 年秋季開到現在,一季一個版本號,目前是第六季(各季開課學期見文末附錄)。歷屆講者包括 Geoffrey Hinton、Ashish Vaswani、Andrej Karpathy,其中 Karpathy 那場開場累積約 100 萬次觀看,是整個系列流量最高的一集。
V6 有個結構性的變化值得注意:課程從這一季起與 SYMSYS 25 合開,講師陣容加入 Symbolic Systems 學程主任 Michael C. Frank 與 Christopher Manning。這不只是行政上的掛名——開場那集討論的論文裡,有兩篇是拿真實兒童語言轉錄稿訓練小模型的 BabyLM 研究。認知科學的比重明顯往上調了。
V6 的九場排在週四下午,由 AGI House、Modal 與 MongoDB 贊助,錄影裡有贊助商的置入段落。
V6 九場,逐集拆
九場的完整逐字稿我都讀過了。
4/2 Overview(授課者)
表面是入門,實際有一半在講授課團隊自己的研究,而且題目全部圍繞「資料怎麼用比資料有多少重要」:拿個別兒童的語言轉錄稿訓練小模型,發現家庭之間的差異主要由語意多樣性與互動結構解釋,不是由詞數解釋;雙語 BabyLM 顯示加第二語言不會拖累第一語言,而且怎麼交錯都無所謂;RAG 的擴展律顯示小模型從檢索得到的好處遠大於大模型。
最後一段是把幻覺重新定義成「世界模型錯誤」——由參考世界模型、模型看得到的資訊、以及衝突解決政策三者共同決定。這個定義的用處是讓摘要任務的幻覺跟 agent 點到不存在按鈕的幻覺,終於能放在同一張表上比。
這一集最值得記的其實是收尾那句自嘲:
諷刺的是,我們前兩位講者講的都不是 transformer,而是替代架構。
4/9 JEPA 與世界模型(Hazel Nam、Lucas Maes)
兩個獨立工作。Causal-JEPA 把畫面切成物件而不是切成 patch,然後整個物件一起遮掉——因為只遮一小塊時模型用內插就能蒙混過去,學不到互動。講者用「猴子吃香蕉」解釋:真的懂機制的模型,把香蕉遮起來、只看到猴子在嚼,也該推得出香蕉變短了。
LeWorldModel 走另一條路:把 JEPA 防止表徵塌縮的六項損失壓成單一超參數,模型只有 1,600 萬參數、單張 GPU 可訓,規劃時間從四十幾秒降到一秒以內。
這場最漂亮的是驗證方式:讓畫面裡的方塊中途突然變色,再讓它中途突然瞬移,看預測誤差怎麼跳。變色幾乎沒反應,瞬移直接飆高——世界模型確實只在乎它該在乎的東西。
4/16 SSM 與 Transformer 的取捨(Albert Gu)← 技術密度最高
Mamba 作者本人,而且他一開場就把常見的討論方式否定掉:效率是假議題。他要講的不是 SSM 比較快,而是兩者的歸納偏誤根本不同。
我把 Transformer 想成資料庫,把 SSM 想成大腦。
資料庫會把每個 token 原樣寫下來,所以能精確回查;大腦把一切壓成固定大小的狀態,所以記不住精確字串。從這個比喻他推出兩件事。一是混合模型裡 SSM 層應該遠多於 attention 層——大腦是主處理器,外部資料庫只是輔助,而多個團隊獨立做出來的最佳比例確實都偏向 SSM。二是 attention 換到字元或 DNA 這種「單一 token 本身沒有語意」的資料上會大幅落後。
最有力的是 H-Net 的一組消融實驗。即使整條管線都跑在 BPE token 上——也就是資料已經被壓縮過了——把外層編碼器換成 Mamba 還是明顯優於全 Transformer。他的解讀是:壓縮不只省算力,它本身就是一種「建立抽象」的歸納偏誤。
4/23 Ultra-Scale:擴到上千張 GPU(Nouamane Tazi, Hugging Face)
起點是問題規模:一兆參數、十五兆 tokens、單步要壓在一秒內。他把五維平行化講得詳略刻意——DP 與 TP 講深,PP/CP/EP 快掃。全場反覆用的核心技巧只有一招:把 all-reduce 拆成 reduce-scatter 加 all-gather,通訊量不變、記憶體省下來,ZeRO 三級與 sequence parallelism 都靠它。TP 的判準一句話:切完之後 activation 要跟不切一樣,所以 attention 沿 head 切、不能沿 hidden dim 切。最有記憶點的是兩個警告——ZeRO-1 塞得下就不要無腦上 FSDP,因為「ZeRO-3 只是用通訊換記憶體」;MoE 的 all-to-all dispatch 有 CPU-GPU sync 的硬傷,「多數做 MoE 訓練的 lab 跑得慢,就是卡在這個硬體問題」。Q&A 裡有個安人心的答案:平行化策略只要實作正確,scaling law 曲線不變。
4/30 預訓練的未來(Shrimai Prabhumoye, Mistral AI)
整場用四個以 NVIDIA 架構命名的小孩(Pascal、Volta、Ampere、Hopper)當敘事骨架,比較三種策略疊加:兩階段課程(先多樣性、後高品質)、把推理資料前置到預訓練、以及 RLP。
RLP 是最新的一塊:讓模型在預測下一個 token 之前先自己生成一段想法,獎勵定義成「有想 vs 沒想」的對數機率差。這個獎勵不需要外部驗證器,而且可以打在文件的任何位置。她報的最強數字是 Nemotron 12B v2 用中途 checkpoint 加少量 RLP,平均勝過吃完完整預訓練的 base 模型 35%。
她也交代了反例:兩階段的順序調換(先品質後多樣性)效果更差;RLP 的 token 是隨機挑的,沒有用熵之類的技巧選。
5/7 參數 vs 脈絡的兩種泛化(Andrew Lampinen, Anthropic)
實驗設計很乾淨:同一份資料集,一種 fine-tune 進參數、一種整包塞進 context,考同樣的泛化題。差距最狠的一組在 reversal curse 資料集:fine-tune 過的模型答反向問題比亂猜還差,整包放 context 卻能答對 99%。更關鍵的是控制組——從零訓的小模型,兩萬個關係裡留 1% 反向當 holdout,模型從參數泛化出那 1% 的能力是零。所以這不是 fine-tuning 的毛病,是 next-token prediction 對關係型資料的結構性缺陷。他給三條縮小差距的路:離線把資料集放進 context、逐份生成 reasoning traces 加回訓練資料(三段論任務上甚至超過 in-context learning);線上掛 episodic memory(他自己承認用 oracle retrieval 是作弊);以及用 RL 學隱式檢索——三條裡唯一能泛化到非重疊資料集的一條。收尾接到海馬迴與新皮質的互補學習系統:皮質慢學統計結構、海馬迴快存單次經驗,replay 把兩者接起來。
5/14 協作 AI agent 推進科學(Vivek Natarajan, DeepMind)
這場實際只有一個主角:AI co-scientist——官方摘要並列的 AMIE 全場只被提了一次名字。起源故事就綁著 Stanford:2023 年他來講 Med-PaLM,散場後 Stanford 的 Gary Peltz 問「LLM 能不能生成科學假說」,才催生這個專案。架構是一個 while loop 加四個非同步函式:generate、critique、rank、evolve,底層全是 Gemini,分工靠 system prompt;ranking agent 安排假說之間的辯論賽、像西洋棋錦標賽一樣算 ELO 排序。驗證案例不是 demo 等級:Imperial College 未發表的抗藥性研究發現,被它跑兩天重新推導出來,對方 PI 以為他們偷看郵件;阿茲海默的九步機制它不只重現、還補上科學家漏掉的 bradykinin–B2R 一環——同一題丟給 Claude 和 GPT-5,只答得出第一步。限制他講得直:好假說很快就會多到「驗證才是瓶頸」,被問 peer review 制度怎麼辦時,他的原話是「老實說我沒有好答案」。順帶一提,他是 V2(2023)「Biomedical Transformers」的講者,少數兩度受邀的人。
5/21 從語言模型到原生多模態(Victoria Lin, Thinking Machines)
前半是很乾淨的架構教學,三代路線講得很清楚:Chameleon 把圖像離散化成 codebook token、全部丟進同一個自回歸目標;Transfusion 改成文字自回歸、圖像用擴散,但共用同一個 transformer;Mixture-of-Transformers 讓每個模態各有一套投影與前饋參數,attention 仍然共用。MoT 那段有個很實用的推論:可以凍住既有的文字模型,只訓新模態的參數,等於幫現成模型加裝生成能力。
真正值錢的是她講「什麼還不成立」。理解變好會帶動生成,但反過來幾乎沒有證據——把模型狂訓圖像生成,並不會讓它更會看圖。現場有人問能不能把文字渲染成圖片來統一模態,她的回答很直接:要統一,把其他東西對齊到文字,比把文字對齊到其他東西好。
5/28 生產環境的推論服務(Charles Frye, Modal)← 最實用
全季唯一完全站在部署端的一場,密度極高。他把 LLM 應用切成三類,各自的關鍵指標不同:互動式聊天看每個使用者拿到的輸出 token 速率、背景 agent 看 time-to-last-token、批次資料處理看每美元能吃掉多少 token。
他花最多力氣講尾端延遲。P50 一毫秒但 P95 拉長時,使用者感受到的是持續卡頓,而不是「只有 5% 的人倒楣」——因為你量的是單一 token 的分位數,不是單一使用者的分位數。
其他值得記的:效能優化該照順序做,先投機解碼與量化(倍數級),再讓 CPU 不擋 GPU,最後才碰 kernel(通常只剩幾個百分點);模型品質 bug 最常見的來源是 tokenizer 與 chat template,所以拜託把 token ID 也記進 log,不要只記字串。還有一句我覺得整場最好:
模型和部署最後都是暫時的,eval 是永久的。
議程上沒寫的三條主線
九場之間沒有官方的敘事線,但讀完逐字稿會看到三條。
一、tokenization 是這一季的共同敵人。 Albert Gu 說 attention 被它拿到的 token 綁死,它沒有能力改變一個 token 對它的意義,所以他推 H-Net 做端到端的分塊。六週後 Charles Frye 從完全不同的方向講到同一件事:tokenizer 與 chat template 是他看過最常見的模型品質 bug,而且他當場回頭引用了 Gu 的說法。一個從架構端、一個從部署端,指向同一個地方。
二、推理正在往預訓練搬。 RLP 那場的整個論證是「把推理當後處理會留下脆弱的地基」;Overview 那場的課程學習、Lampinen 那場的參數 vs 脈絡,是同一個問題的不同切面。這一季沒有任何一場在講怎麼把 RLHF 做得更好。
三、語言要不要當推理骨架,沒有共識。 JEPA 那組主張在潛在空間預測、繞開符號表徵;Victoria Lin 明確主張把其他模態對齊到文字。兩場中間隔六週,沒有人把它們擺在一起講——這是這門課的形式決定的,九場獨立,沒有人負責收斂。
流量:題目決定,不是集數位置
舊季的型態是開場最高、後面遞減。V6 打破了這個型態:
| 日期 | 主題 | 觀看數 |
|---|---|---|
| 5/21 | 原生多模態(Thinking Machines) | 115,000 |
| 4/9 | JEPA 與世界模型 | 99,135 |
| 4/30 | 預訓練的未來 | 14,278 |
| 4/2 | Overview(授課者) | 10,265 |
| 5/28 | 推論服務(Modal) | 6,666 |
| 4/16 | SSM 與 Transformer(Albert Gu) | 5,864 |
| 5/7 | 參數 vs 脈絡(Anthropic) | 3,763 |
| 5/14 | AI co-scientist(DeepMind) | 3,436 |
| 4/23 | Ultra-Scale(Hugging Face) | 1,898 |
(2026 年 8 月 21 日快照,會繼續成長。)
熱門題破十萬,工程題連兩千都不到。這裡有個實際的含意:流量最低的那幾集,跟品質沒有關係。 Albert Gu 那場是全季技術密度最高的一場,觀看數排倒數第四。
怎麼用這門課
如果你只有三小時:看 Albert Gu、Charles Frye、Victoria Lin 這三場(連結都在文末)。共同點是講者都在講自己蓋的東西,而且都花了時間講「什麼還不成立」。順序建議先 Gu 再 Frye——Frye 會回頭引用 Gu,接得起來。
如果你要決定看不看:先開官方課程頁的議程表,每場的摘要都是講者自己寫的,讀完九段摘要大約五分鐘,比看任何二手整理準。順帶一提,我在研究過程中就抓到一個熱門的第三方 CS25 追蹤頁把 4/30 的講者寫錯人——議程請直接看官方頁。
如果你想跟著上下一季:V7 已經排進 Stanford 的選課系統,2027 年春季週四同一時段,一樣是 Feng 與 Singh 開。到時候直接進 Zoom 或等 YouTube,不需要任何身分。
這門課不能給你什麼:沒有作業、沒有評量、沒有回饋。看完整季你會知道這批人在吵什麼,但不會多會做任何一件事。想要後者,同一批人開了 CS336:實作導向的重課,從 tokenizer 一路做到 FlashAttention 與 RLVR,官方頁面直接列了自學者要租的 GPU 時薪。CS25 和 CS336 不是進階關係,是同一個系給不同需求開的兩種東西。
附錄:各季開課學期與查證範圍
歷屆版本:V1(2021 秋)、V2(2023 冬)、V3(2023 秋)、V4(2024 春)、V5(2025 春)、V6(2026 春)。V7 已排進 2027 年春季。
- 課程結構、開課歷史、九場議程與講者:全部取自官方課程頁、歷屆存檔頁與 Stanford ExploreCourses,屬一手來源。
- 逐集內容:九場皆讀完完整逐字稿(4/23、5/7、5/14 三場於 2026-08-26 以 YouTube 自動字幕補齊;自動字幕偶有轉錄錯字,人名與技術名已按上下文還原)。
- 講者在台上自述的數字(混合層比例、RLP 的 35%、規劃時間差距)只有單一來源,我沒有回查各自的論文或技術報告。
- 觀看數是 2026 年 8 月 21 日的單次快照。
參考資料
- CS25: Transformers United V6 官方課程頁
- CS25 V5(2025 春)存檔頁
- CS25 V4(2024 春)存檔頁
- CS25 V2(2023 冬)存檔頁
- CS25 V1(2021 秋)存檔頁
- Stanford ExploreCourses:CS 25 / SYMSYS 25
- CS25 YouTube 播放清單
- V6 Overview(4/2)
- V6 JEPA 與世界模型(4/9)
- V6 SSM 與 Transformer 的取捨,Albert Gu(4/16)
- V6 Ultra-Scale,Nouamane Tazi(4/23)
- V6 預訓練的未來,Shrimai Prabhumoye(4/30)
- V6 參數 vs 脈絡的泛化,Andrew Lampinen(5/7)
- V6 協作 AI agent,Vivek Natarajan(5/14)
- V6 原生多模態,Victoria Lin(5/21)
- V6 推論服務,Charles Frye(5/28)
- V2 Introduction to Transformers, Andrej Karpathy
- Stanford CS336: Language Modeling from Scratch
Loading...