來源年份:投影片與作業依據 Spring 2026;錄影依據 Spring 2025(YouTube)。兩者可能有差異,下面逐項標出。本文是 Stanford CS231N 導讀系列的第 0 篇,也是入口。
CS231n: Deep Learning for Computer Vision 是 Stanford 的電腦視覺課。2026 年 9 月 30 日打開課程首頁,標題寫的是「Stanford - Spring 2026」,講者有五位:Fei-Fei Li、Ehsan Adeli、Justin Johnson、Zane Durante、Tiange Xiang。
首頁的課程描述把重點放在「端到端學習」:10 週內,學生要自己實作、訓練神經網路,並讀懂電腦視覺的前沿研究。課程首頁上還放了一個在瀏覽器裡即時分類 CIFAR-10 圖片的小型 CNN,旁邊寫著「By the end of the class, you will know exactly what all these numbers mean」。
這篇回答三個問題:這門課教什麼、校外讀者實際拿得到什麼、怎麼排 10 週把它讀完。
這門課的硬事實
上課時間與地點:週二、週四 12:00–1:20 PM(太平洋時間),在 NVIDIA Auditorium。週五另有 discussion section。
評分(首頁 Coursework 一節):
| 項目 | 權重 | 細項 |
|---|---|---|
| 作業 | 45% | A1 12%、A2 18%、A3 15%(作業頁) |
| 期中考 | 20% | 5 月 12 日課堂考,細節在 Ed 公告 |
| 期末專題 | 35% | Proposal 1%、三次 Milestone 各 3%、Final Report 20%、Poster 5%(專題頁) |
| 參與 | 最多 3% extra credit | 表現最好的學生拿滿 3%,其他人按比例 |
第一講投影片的評分頁把期中考標成「New」。遲交規則是整學期 4 天免費遲交日,每份作業最多用 2 天,用完之後每遲一天扣 25%;期末報告不能用遲交日。
先修(首頁 Prerequisites):
- Python 熟練,作業用 numpy
- 微積分與線性代數(舉例 MATH 19、MATH 51),要會求導、看得懂矩陣向量記號
- 基礎機率統計(舉例 CS109),要對高斯分佈、平均、標準差有直覺
作業政策:作業頁寫明「往年解答有人放在網路上,我們知道」,並要求每份作業都是自己的成果。生成式 AI 比照協作者處理,要註明用法;用它「substantially complete」作業段落就違反 Honor Code。第一講投影片說得更直接:Rule 4 是「Do not submit AI-generated responses」。
課表:18 講,三個單元
官方課表從 3 月 31 日排到 6 月 10 日,共 18 講,分成三個單元:
- Deep Learning Basics(L2–L4):影像分類與線性分類器、正則化與最佳化、神經網路與反向傳播
- Perceiving and Understanding the Visual World(L5–L11):CNN、CNN 架構、RNN、Attention 與 Transformer、偵測/分割/可視化、影片理解、大規模分散式訓練
- Generative and Interactive Visual Intelligence(L12–L18):自監督學習、兩講生成模型、3D 視覺、視覺與語言、World Modeling(客座 Gordon Wetzstein)、Human-Centered AI
單元的切法在官方材料裡並不一致。第一講投影片的概覽頁列了四塊(多一塊「Human-Centered Applications and Implications」),結尾頁又寫成 L2–4、L5–12、L13–17、L18 四段。本系列以課表為準。
Discussion section 有六次:Python/Numpy、Backprop、Final Project 說明、PyTorch、RNNs & Transformers、Midterm review。
校外讀者拿得到什麼:A3,附三個缺口
本站的全球 AI/CS 課程地圖把公開程度分成 A0 課表可見、A1 課綱可見、A2 教材部分開放、A3 足以自學。CS231N Spring 2026 評為 A3,理由如下:
| 材料 | 公開狀態(2026-09-30 查核) |
|---|---|
| 投影片 | L1(兩份)到 L16 都能從課表下載,另有 Backprop、Project、RNNs & Transformers 三份 section 投影片 |
| 作業題目頁 | A1、A2、A3 三頁都公開,各有 Colab 起始碼可下載 |
| 課程筆記 | cs231n.github.io 的長篇筆記,課表逐講連過去 |
| 專題規範 | 專題頁列出每個繳交項目的權重與日期,附歷屆報告 |
| 錄影 | Spring 2025 播放清單,Stanford Online 頻道,18 支 |
缺口有三個,每一篇都會再提一次:
- 2026 錄影只在 Canvas。首頁寫明錄影放在 Canvas 的「Panopto Course Videos」分頁,只給選課學生看;往年錄影在 YouTube,但「not reflective of this offering」。
- L17、L18 沒有 2026 投影片。課表上這兩講沒有 slides 連結,照前面的網址格式猜也是 404。
- 期中考、Ed、Gradescope 都不公開。考題、論壇討論、自動評分器與成績,校外讀者都看不到。
所以要自學,程式作業可以寫,但沒有官方自動評分可以對答案,只能靠 notebook 裡內建的檢查 cell 與數值梯度檢查。
2026 教材與 2025 錄影怎麼對照
Spring 2025 課表的 18 講標題跟 2026 幾乎一樣,唯一明顯不同的是 L17:2025 是「Robot Learning」,2026 是「World Modeling」。
實際對照時要注意幾件事:
- 錄影是 2025 年的。播放清單的影片標題寫著「Spring 2025」。本系列的內容整理以 2026 投影片為準,影片只當作聽講輔助。我沒有逐支比對影片與 2026 投影片的差異。
- L17 主題完全不同。看 2025 的 L17 影片學到的是 robot learning,不是 world modeling。本系列最後一篇會把兩者分開寫。
- 2026 投影片本身也有沿用痕跡。例如 L7 投影片封面日期印著 2025 年,第一講 part 1 的第 1 頁頁尾也寫 2025。這只代表檔案沿用,不能拿來推論改了多少。
- 作業頁彼此有小出入。作業總頁寫 A2 包含「Network Visualization」,但 A2 題目頁的五題是 BatchNorm、Dropout、CNN、PyTorch on CIFAR-10、RNN captioning,沒有 visualization。以題目頁為準。
10 週自學路線
官方學期從 3 月 31 日到 6 月 10 日,剛好 10 週。下面照官方課表的節奏排,作業日期是 2026 的官方 due date,自學時可以當作進度檢查點。
| 週 | 講次 | 作業與專題 | 本系列文章 |
|---|---|---|---|
| 1 | L1 課程導論、L2 影像分類 | 看 Python/Numpy 教學;開始 A1(4/2 發佈) | L1、L2 |
| 2 | L3 正則化與最佳化、L4 反向傳播 | 跟著 Backprop section 算一次例題;A1 Q1–Q3 | L3、L4 |
| 3 | L5 CNN、L6 訓練 CNN 與架構 | 完成 A1(官方 4/16 due);想專題題目 | A1、L5、L6 |
| 4 | L7 RNN、L8 Attention 與 Transformer | 寫專題 proposal(官方 4/23 due);開始 A2 | L7、L8 |
| 5 | L9 偵測/分割/可視化、L10 影片理解 | A2 Q1–Q3 | L9、L10 |
| 6 | L11 分散式訓練、L12 自監督學習 | 完成 A2(官方 5/8 due);官方這週之後是期中考 | A2、L11、L12 |
| 7 | L13 生成模型(一)、L14 Diffusion | 開始 A3(5/14 發佈);專題 Milestone 1 | L13、L14 |
| 8 | L15 3D 視覺、L16 視覺與語言 | A3 Q1–Q3;專題 Milestone 2 | L16、L15 |
| 9 | L17、L18(只有 2025 影片) | 完成 A3(官方 5/28 due);專題 Milestone 3 | A3 |
| 10 | — | 期末報告與 poster | 收尾與專題 |
本系列的文章順序和課表有三處不同。第一,作業篇放在它最後依賴的那一講之後。第二,L15 移到 A3 之後,讓「生成→多模態→A3」連成一串。第三,L17 和 L18 沒有 2026 投影片,併成一篇收尾。
怎麼開始:今晚先打開 A1 題目頁,下載起始碼,照頁面說明把 Colab runtime 版本改成「2025.07」,跑通 knn.ipynb 的第一個 cell。跑得起來,就接著讀 L1。
系列目錄
延伸閱讀
- Stanford CS229 導讀:線性分類、softmax 與最大概似估計的機器學習背景
- CMU 11-785 導讀、MIT 6.7960 導讀:不限於視覺的深度學習課
- Stanford CS224N 導讀、Stanford CS336 導讀:Transformer 與大規模訓練的語言模型那一側
- CS230:對抗樣本與生成模型
- Berkeley CS285 導讀:想接著看 robot learning 的讀者
系列導覽:下一篇 L1:電腦視覺從哪裡來,這門課要走到哪裡
參考資料
Loading...