Skip to content
所有標籤

#deep-learning

72 篇文章

MIT 6.7960 L03:優化總覽——SGD、Adam、學習率排程與縮放規則

從 SGD 到 Adam,用縮放規則一次搞懂深度學習優化器怎麼選、學習率怎麼調

MIT 6.7960 L04:正則化實戰——Weight Decay、Dropout、Batch Norm 與標籤平滑

正則化不只是防過擬合——Weight Decay、Dropout、BN、Label Smoothing 的機制與組合策略一次看懂

MIT 6.7960 PS1 實作走查:從 NumPy 手寫 MLP 到 PyTorch Autograd 反向傳播

手寫 NumPy MLP + 反向傳播 → PyTorch Autograd 驗證,完整複現 OCW HW1 核心考點

MIT 6.7960 L05:CNN 架構全解析——從卷積核到平移等變性的感知機制

Lec 4 核心重點:為什麼 CNN 是處理網格資料的最佳選擇——卷積、平移等變性、池化與經典架構一次掌握

MIT 6.7960 L06:現代 CNN 架構 —— ResNet、EfficientNet、ConvNeXt

ResNet 用殘差連接解決退化問題,讓網路能堆到 100+ 層;EfficientNet 複合縮放平衡深度/寬度/解析度;ConvNeXt 吸收 Transformer 設計重奪 CV 王座。

MIT 6.7960 L07:優化縮放定律 —— 譜視角、特徵學習與超參數遷移

優化不是孤立的數值問題:用譜視角看 SGD,權重更新的『量』決定特徵學習;Maximal Update Parameterization 讓學習率與初始化跨寬度遷移,critical batch size 決定算力換取收斂的邊際。

MIT 6.7960 L08:Transformer —— Token、Attention 與位置編碼,以及它和 MLP/CNN/GNN 的關係

Transformer 不是憑空冒出的架構:token 把資料切成離散單元,attention 做軟性的訊息聚合,positional code 補回順序。把它和 MLP/CNN/GNN 擺在一起看,會發現它們都是『對鄰居做加權彙整』的不同特例。

MIT 6.7960 L09:深度學習駭客指南 —— 讓網路真正聽你使喚的實作心法

訓練神經網路更像工程而非魔法:先看資料、先在小批次上過擬合證明容量夠、再用正則化把泛化補回來;學習率永遠是影響最大的那顆旋鈕。

MIT 6.7960 L10:記憶與序列建模 —— RNN、LSTM 與梯度消失/爆炸

RNN 把過去壓進一個隱狀態,但遞歸讓梯度在時間上連乘,要嘛消失要嘛爆炸;LSTM 用輸入/遺忘/輸出門把『記憶』與『更新』解耦,讓長程資訊能穩定流動。注意力後來取代它,是因為 O(1) 取用任意歷史。

MIT 6.7960 L11:表示學習(重建式)—— 自編碼器、VQ 與自監督

表示學習的目標是把原始資料壓成「好用」的向量:自編碼器用重建逼出有意義的潛空間,VQ 把連續表示離散化成碼本,自監督則用『遮住一部分再重建』來免費產生監督訊號。

MIT 6.7960 L12:表示學習(相似性式)—— 度量學習、對比學習與 InfoNCE

相似性式表示學習不重建輸入,而是直接塑造潛空間的幾何:讓同類表示靠近、異類推遠。InfoNCE 把這件事寫成『在一堆負樣本裡認出正樣本』的分類問題,而 alignment / uniformity 給了它可解釋的評價指標。

MIT 6.7960 L13:表示學習的理論視角 —— 歸納偏置、高斯過程與 NN–GP 對應

把網路變寬到極限,它的隨機初始化輸出會變成一個高斯過程(NN–GP),而訓練動態則由神經切線核(NTK)固定下來。這套理論不只能用來分析,還反過來指導我們設計『對的歸納偏置』。

MIT 6.7960 L14:生成模型基礎 —— 密度/能量模型、GAN、自回歸與擴散

生成模型本質是在學資料的分佈 p(x)。密度模型直接建模機率,能量模型用一個未歸一化勢能 + 採樣器,GAN 讓判別器逼出逼真樣本,自回歸一步步預測下一個 token,擴散則用『逐步加噪再學去噪』繞開棘手的最大似然。

MIT 6.7960 近似理論(Approximation Theory)—— 萬能近似、Barron 定理與深度為何有用

單層網路理論上能逼近任何連續函數(萬能近似),但寬度會隨維度指數爆炸;Barron 定理在特定的『Barron 函數類』下讓誤差只隨樣本數 √n 收斂、與維度脫鉤;而深度能對組合/階層函數帶來指數級的寬度節省——這正是深網比淺網強的根本原因。

MIT 6.7960 圖神經網絡(GNN, Graph Neural Networks)—— 訊息傳遞、置換等變與表達力上限

GNN 本質是「在圖上做局部訊息傳遞的 MLP」:它把 CNN 的固定網格鄰居推廣成任意拓撲的鄰居聚合。它必須滿足置換等變/等變性。理論上,一階 GNN 的表達力不超過 Weisfeiler–Lehman 圖同構測試——有些結構它永遠分不出來,這也是後來 GIN、位置編碼、子圖技巧要補的洞。

MIT 6.7960 L15:變分自編碼器(VAE)—— ELBO、再參數化技巧與潛變數表示

VAE 的核心是 ELBO + 再參數化:把 log p(x) 替成 E_q[log p(x|z)] − KL(q(z|x)‖p(z)),encoder 輸出 μ/σ 用 z = μ + σ⊙ε(ε ~ N(0,1))讓採樣可反向傳播。訓練 = 重構 + KL 兩項拉扯,由此衍生 β-VAE、posterior collapse、VQ-VAE 等修正。

MIT 6.7960 L16:條件生成模型(Conditional Generative Models)—— cGAN、cVAE 與 Classifier-Free Guidance

條件生成的關鍵是「把 y 餵進模型」:cGAN 在 G/D 拼接 y,cVAE 把 y 當額外輸入進 encoder/decoder;擴散模型時代,Classifier Guidance 用外部分類器梯度把生成推向指定類別,Classifier-Free Guidance 則同訓練 conditional + unconditional 並在推論時線性組合兩者——後者是 Stable Diffusion / Imagen 的標準武器。

MIT 6.7960 L01:課程導論 —— Deep Learning 的地圖、為什麼深,以及第一個訓練 loop

本講是 6.7960 的導論:deep learning 之所以爆發是『資料 + 算力 + 演算法』三股力量同時到位;本課從架構(CNN/GNN/Transformer)到訓練、表示、生成、遷移、規模、LLM 一路串起來;最後用一個 ~30 行的 PyTorch training loop 確認你的環境能跑。

MIT 6.7960 L17:out-of-distribution 泛化 —— 領域偏移、虛假相關、與三條實務對策

OOD 失敗不是 bug,是 i.i.d. 假設破掉:covariate shift(影像風格變了)、label shift(類別比例變了)、concept shift(同一個詞意思變了)各有對應的應對方式;最常見的原因是模型抓了『虛假相關』(用草原當牛的存在訊號),IRM 與 domain randomization 想從訓練資料結構本身把這件事修掉,test-time adaptation 在推論時即時修正。

MIT 6.7960 L18:遷移學習(Transfer Learning)—— 預訓練、特徵抽取、與微調策略

遷移學習的核心是『在大資料上學到的特徵是好的通用表示』:下游任務資料少時,把 backbone 凍住只訓練線性 head;資料夠就全模型微調;想省算力就上 LoRA / adapter。SimCLR、MAE 這類自督導預訓練讓『上游不需要標籤』,下游表現又上一層樓。

ai guide MIT 6.7960 導讀

MIT 6.7960 導讀:一門課兩個官方版本——想修完走 2024 OCW,要最新內容讀 2025 投影片

[MIT 6.7960 Deep Learning](https://deeplearning6-7960.github.io/) 有兩個公開程度截然不同的官方版本:Fall 2025 課站 21 講投影片全公開但 psets 在 Gradescope、解答與錄影鎖在 Canvas(A2);[MIT OCW 的 Fall 2024 版](https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/)連影片、五份作業題目與起始檔都開放(接近 A3)。兩版綱要重疊約六成,講師從 Isola/Bernstein 換成 Kaiming He/Omar Khattab,不能拿舊影片硬配新講義。本文給出按目的分流的兩條自學路線。

CMU 07-280 階段複習二:用 AlexNet 與 GPT-2 把模型真正組起來

第二階段不把 CNN 與 Transformer 當兩份架構圖背誦,而是透過 HW8 與 HW11 檢查表示、計算圖、訓練、遷移與生成是否真的接得起來。

CMU 11-785 Lecture 1:導論:從感知器到深度網路

Spring 2026 Lecture 1 聚焦神經元、感知器、連結主義與深度學習問題設定;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 2:神經網路作為通用近似器

Spring 2026 Lecture 2 聚焦布林電路、網路寬度與深度,以及表示能力不等於可訓練性;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 3:訓練一:學習與經驗風險最小化

Spring 2026 Lecture 3 聚焦資料分布、假設、損失、經驗風險與泛化之間的角色;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 4:訓練二:梯度下降

Spring 2026 Lecture 4 聚焦梯度、學習率、參數更新與線性神經元的訓練;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 5:訓練三:反向傳播

Spring 2026 Lecture 5 聚焦計算圖、chain rule、局部導數與梯度重用;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 6:訓練四:收斂、損失曲面與動量

Spring 2026 Lecture 6 聚焦非凸損失曲面、曲率、鞍點與 momentum 的累積方向;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 7:訓練五:SGD、batch size 與二階方法

Spring 2026 Lecture 7 聚焦full batch、mini-batch、隨機梯度與二階資訊的成本取捨;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 8:訓練六:最佳化器與正則化

Spring 2026 Lecture 8 聚焦AdaGrad、Adam、正則化、BatchNorm、Dropout 與 loss 選擇;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 9:卷積神經網路一

Spring 2026 Lecture 9 聚焦局部連接、權重共享、卷積核與特徵圖;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 10:卷積神經網路二

Spring 2026 Lecture 10 聚焦stride、padding、receptive field 與多通道卷積;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 11:卷積神經網路三

Spring 2026 Lecture 11 聚焦卷積架構堆疊、特徵階層與設計取捨;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 12:卷積神經網路四

Spring 2026 Lecture 12 聚焦CNN 訓練、架構選擇與視覺模型的整體串接;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 13:循環神經網路一

Spring 2026 Lecture 13 聚焦序列狀態、時間展開、參數共享與 recurrent computation;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 14:循環神經網路二

Spring 2026 Lecture 14 聚焦時間反向傳播、梯度穩定性與 LSTM 類 gated memory;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 15:Seq2Seq 與 CTC

Spring 2026 Lecture 15 聚焦可變長輸入輸出、對齊未知問題與 CTC 目標;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 16:CTC blank 與 beam search

Spring 2026 Lecture 16 聚焦blank、collapse 規則、前綴機率與近似解碼;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 17:語言模型與翻譯

Spring 2026 Lecture 17 聚焦自回歸機率分解、條件語言模型與翻譯解碼;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 18:Attention 與 Transformer

Spring 2026 Lecture 18 聚焦query、key、value、scaled dot-product attention 與 Transformer block;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 19:Transformer 與後續架構

Spring 2026 Lecture 19 聚焦encoder/decoder 結構、mask、residual path 與架構變體;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 20:大型語言模型

Spring 2026 Lecture 20 聚焦規模化自回歸模型、訓練階段、推論與能力邊界;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 21:表示學習與 autoencoder

Spring 2026 Lecture 21 聚焦瓶頸表示、重建目標、降維與表示品質;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 22:變分自編碼器

Spring 2026 Lecture 22 聚焦latent variable、ELBO、KL 項與 reparameterization trick;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 23:擴散模型

Spring 2026 Lecture 23 聚焦forward noising、reverse denoising、score/noise prediction 與採樣;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 24:生成對抗網路

Spring 2026 Lecture 24 聚焦generator、discriminator、minimax objective 與訓練不穩定;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 25:圖神經網路

Spring 2026 Lecture 25 聚焦message passing、aggregation、node representation 與 permutation symmetry;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 26:強化學習

Spring 2026 Lecture 26 聚焦state、action、reward、return、value 與 policy learning;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 27:Hopfield 網路

Spring 2026 Lecture 27 聚焦聯想記憶、能量函數、固定點與 pattern retrieval;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 Lecture 28:Boltzmann machine

Spring 2026 Lecture 28 聚焦能量式機率模型、隨機單元、partition function 與學習困難;本文依官方 slides 與錄影重建主線,並提供不依賴課內 grader 的小型自我檢查。

CMU 11-785 深度學習完整課程導讀:28 講能看,作業鏈卻不完整公開

CMU 11-785 Spring 2026 的 28 講內容都有官方 slides 與 YouTube,另有大量公開 bootcamp/recitation;但 HW1–4 的核心規格、starter 與評測依賴 Autolab、Piazza 和 Kaggle。

CS224N 第 1 講:NLP 的四次典範轉移

Winter 2026 第 1 講用四個時代整理 NLP:早期探索、符號系統、統計機器學習、深度與自監督學習;重點不是背年表,而是看每個時代如何重新定義語言問題。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 1:深度學習的最小骨架

2026 第 1 講從感知器、前向傳播、loss 到 gradient descent,建立後續九講共用的語言。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 2:序列模型:從 RNN 到注意力

2026 第 2 講處理文字、音訊與時間序列中「順序會改變意義」的問題,並連到 Lab 1 的音樂生成。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 3:電腦視覺:卷積如何保留空間結構

2026 第 3 講從影像張量、卷積與 pooling 走到辨識系統,替 Lab 2 的 MNIST 與臉部偵測打底。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 4:生成模型:從潛在空間到 diffusion

2026 第 4 講區分生成與判別問題,整理 VAE、GAN 與 diffusion 的學習目標,並接到 Lab 2 的 DB-VAE。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 5:強化學習:用回報取代標準答案

2026 第 5 講把 agent、environment、state、action、reward 與 policy 接成互動迴圈,理解信用分配與探索。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 6:新前沿:模型之外還要選問題

2026 第 6 講把深度學習放進新應用與真實限制,提醒讀者先定義資料、輸出、評量與失敗條件。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 7:AI 三法則:安全要落在可觀測與評估

2026 第 7 講從 Asimov 的文學法則出發,討論現代 AI 安全協定的限制,以及 trace、測試資料與持續評估。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 8:AI for Science:把領域結構放進學習流程

2026 第 8 講以科學發現循環為主線,說明 simulator、AI emulator 與實驗如何合作,而不是把科學簡化成通用預測。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lecture 9:大規模平行訓練:記憶體與通訊才是邊界

2026 第 9 講從 GPU 記憶體壓力進入 checkpointing、offloading、ZeRO、FSDP 與多種 parallelism,理解擴展不是只加卡。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lab 1:用 PyTorch 與 LSTM 生成音樂

2026 先完成 PyTorch tensor、autograd 與 module 基礎,再把 ABC 樂譜切成字元序列,訓練 LSTM 逐字生成音樂。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lab 2:從 MNIST 到 DB-VAE 臉部去偏差

2026 Part 1 用 dense network 與 CNN 辨識 MNIST;Part 2 以 DB-VAE 學習臉部 latent distribution,再調整訓練取樣。

ai guide MIT 6.S191 導讀

MIT 6.S191 Lab 3:LoRA 微調與 LLM-as-a-Judge 評估

2026 以 LFM2-1.2B 建立 chat template 與生成流程,用 LoRA 做風格調適,再透過 OpenRouter 與 Opik 組合 judge workflow。

深度學習:模組、反向傳播與向量化

第七章把神經網路拆成可組合模組,並用反向傳播與向量化說明深度模型如何有效率地訓練。

CS188 決策與機器學習:從 VPI、Naive Bayes 到 Attention

Lecture 19–25 把 rational decisions、VPI 與 ML 接起來,Project 5 再用 PyTorch 實作 regression、分類、CNN、attention 與 optional character-GPT。

CMU 10-301 HW7:從基礎神經網路走到 Deep Learning

HW7 在 HW5 的 backpropagation 地基上加入深度模型的架構與訓練問題,重點是診斷而非只把網路加深。

Stanford CS109 Lecture 22|Deep Learning:用 chain rule 推出 backpropagation

Neural network 是堆疊的 logistic units;forward pass 算機率,backpropagation 重用 output error 來計算所有 gradients。

ai guide MIT 6.S191 導讀

MIT 6.S191 導讀:九講與三個 labs 全公開,但完整跑完仍要三個外部服務

MIT 6.S191 的 2026 版已公開九講影片、投影片、三個 software labs 與解答,足以列為 A3 自學課;但官方執行路線需要 Google/Colab、Comet,以及 Lab 3 的 OpenRouter,校外讀者也拿不到 MIT 的學分、專案回饋與 API credit。

Stanford CS229 導讀:講義每年重編,公開作業停在 2020,官方自測題是 2008 年的

CS229 的自學三件套不在同一個時鐘上:講義 278 頁、2026 年 8 月才重編過;公開拿得到的作業是 2020 年夏季那批;Stanford Online 叫你入學前先做的自測題,PDF 建立於 2008 年。2026 春季錄影公開 17 支,最後三支的標題跟內容對不上。

Deep Learning 面試攻略:從 CNN 到 Transformer 的核心直覺

深度學習面試重點不是推導反向傳播,而是能不能解釋架構背後的設計直覺。高頻考點:CNN 的 locality 與 translation invariance、RNN 到 Transformer 的演進為什麼必要、self-attention 的計算邏輯與複雜度、BatchNorm vs LayerNorm 的適用場景、常見的 training tricks(learning rate schedule、gradient clipping、mixed precision)。

ai guide Stanford CS230 導讀

Introduction to Deep Learning:光靠 prompt 走不遠的那兩個時刻

CS230 第一講是課程總覽,但 Andrew Ng 花最多時間講的是三件事:為什麼 scaling 有效、什麼時候 prompt 就不夠用了、以及他認為「不要學寫程式」是史上最糟的職涯建議之一。