Skip to content
所有標籤

#pytorch

9 篇文章

MIT 6.7960 L03:優化總覽——SGD、Adam、學習率排程與縮放規則

從 SGD 到 Adam,用縮放規則一次搞懂深度學習優化器怎麼選、學習率怎麼調

MIT 6.7960 L04:正則化實戰——Weight Decay、Dropout、Batch Norm 與標籤平滑

正則化不只是防過擬合——Weight Decay、Dropout、BN、Label Smoothing 的機制與組合策略一次看懂

MIT 6.7960 PS1 實作走查:從 NumPy 手寫 MLP 到 PyTorch Autograd 反向傳播

手寫 NumPy MLP + 反向傳播 → PyTorch Autograd 驗證,完整複現 OCW HW1 核心考點

MIT 6.7960 L05:CNN 架構全解析——從卷積核到平移等變性的感知機制

Lec 4 核心重點:為什麼 CNN 是處理網格資料的最佳選擇——卷積、平移等變性、池化與經典架構一次掌握

MIT 6.7960 L06:現代 CNN 架構 —— ResNet、EfficientNet、ConvNeXt

ResNet 用殘差連接解決退化問題,讓網路能堆到 100+ 層;EfficientNet 複合縮放平衡深度/寬度/解析度;ConvNeXt 吸收 Transformer 設計重奪 CV 王座。

MIT 6.7960 L01:課程導論 —— Deep Learning 的地圖、為什麼深,以及第一個訓練 loop

本講是 6.7960 的導論:deep learning 之所以爆發是『資料 + 算力 + 演算法』三股力量同時到位;本課從架構(CNN/GNN/Transformer)到訓練、表示、生成、遷移、規模、LLM 一路串起來;最後用一個 ~30 行的 PyTorch training loop 確認你的環境能跑。

CS336 Lecture 7:從 collective operations 組出資料、張量與管線平行

第七講不從 FSDP API 開始,而是用 broadcast、all-reduce、all-gather、reduce-scatter 與 all-to-all 建立通訊語言,再親手組出 data、tensor 與 pipeline parallelism。

CS336 Lecture 2:先算 FLOPs 與記憶體,再談模型跑不跑得動

第二講把模型訓練還原成 tensor、FLOPs、bytes 與時間:用 einops 管維度,以 arithmetic intensity 和 roofline 判斷瓶頸,再用 gradient accumulation 與 activation checkpointing 交換運算和記憶體。

ai guide MIT 6.S191 導讀

MIT 6.S191 導讀:九講與三個 labs 全公開,但完整跑完仍要三個外部服務

MIT 6.S191 的 2026 版已公開九講影片、投影片、三個 software labs 與解答,足以列為 A3 自學課;但官方執行路線需要 Google/Colab、Comet,以及 Lab 3 的 OpenRouter,校外讀者也拿不到 MIT 的學分、專案回饋與 API credit。