Skip to content
所有標籤

#transformer

14 篇文章

MIT 6.7960 L08:Transformer —— Token、Attention 與位置編碼,以及它和 MLP/CNN/GNN 的關係

Transformer 不是憑空冒出的架構:token 把資料切成離散單元,attention 做軟性的訊息聚合,positional code 補回順序。把它和 MLP/CNN/GNN 擺在一起看,會發現它們都是『對鄰居做加權彙整』的不同特例。

ai guide 認識 AI 模型

認識 AI 模型:從 token 到自架,18 篇讀懂模型的通用知識

不需要變成研究員也能系統理解 AI 模型。這個系列從你看得見的東西(token、context window)開始,一路走到自架開源模型,18 篇覆蓋選模型、讀 benchmark、算成本需要的所有基礎。

ai deep-dive 認識 AI 模型

Transformer 與 Attention:模型怎麼決定該看哪些字

Transformer 的核心是 self-attention:對每個 token,模型算出它跟其他所有 token 的相關程度,然後按權重加總。這讓模型能跨越距離抓到「it 指的是 cat 不是 mat」這種關係,也是它處理長文的基礎。

ai deep-dive AI 頂會導讀

2021 AI 頂會在收什麼題目:Transformer 擴散、自監督學習與 Diffusion 的起點

2021 年是 AI 頂會的分水嶺:Transformer 從 NLP 全面入侵 CV 與時序領域,自監督學習成為各會議最熱門關鍵詞,Diffusion Model 拿下 ICLR Outstanding Paper 但還沒有人意識到它會取代 GAN——而 GNN 和 Federated Learning 正處於論文量的歷史高峰,之後開始走下坡。

CMU 07-280 Lecture 20:從 Position Encoding 推到 Causal Self-Attention

第 20 講先把單 token embedding 擴成 sequence,以 positional encoding 補順序,再推導 Q/K/V scaled dot-product attention、causal mask 與 multi-head blocks,最後接到 GPT-2。

CS124 Week 7 Transformers and Speech Processing:causal attention、生成與未錄現場課的邊界

Week 7 的可公開主線是 PA6a:實作 causal self-attention、訓練 Shakespeare 小型 Transformer、取樣並計算 perplexity;同週 speech live lecture 未錄影,只能保留為明示缺口。

ai guide Stanford CS224N 導讀

CS224N 第 6 講:把期末專案收斂成可驗證的研究問題

第 6 講先補完 Transformer encoder、decoder 與 cross-attention,再把期末專案拆成題型、評分、研究題目與資料來源;好題目必須能用一個明確 baseline 和指標驗證。

CS224N 第 5 講:從 recurrence 到 Transformer

第 5 講從 RNN 的長距離與循序瓶頸走到 self-attention,再組成 Transformer;它縮短位置間的資訊路徑並容許平行計算,但付出二次方 attention 成本與位置資訊必須另行注入的代價。

CS336 Lecture 3:Transformer 架構很多,真正穩定的預設值其實很少

第三講比較大量現代 LLM 後得到的不是一張最佳架構配方,而是一組保守共識:pre-norm、RMSNorm、無 bias、SwiGLU、RoPE,以及少數值得偏離預設的推論與穩定性設計。

大型語言模型:分詞、Transformer、MoE 與 SFT

第 17 章從 next-token loss 推到 Transformer、KV cache、MoE 與 SFT,說清楚 LLM 的訓練目標、架構與推論成本如何連在一起。

Berkeley CS288(二):Sequence Models、Seq2Seq 與 Transformer

05–07 組教材把固定向量的分類器推進序列狀態、encoder-decoder,再用 attention 與 Transformer 改寫資訊路徑。

Stanford CS224N 導讀:打開 2019 年那版課表,Transformer 還排在第 14 堂

CS224N 把 2000 年以來每一屆的課程網站都留在線上。2019 冬季那版,Transformer 是第 14 堂的客座講題;2026 冬季那版,它是第 5 堂,之後每一堂都預設你已經懂它。機器翻譯作業整個消失了,第三份作業改成自己刻一個 decoder-only Transformer,附 pytest 可以在筆電上跑。

ai deep-dive

Stanford CS25 V6:叫 Transformers United 的課,前兩場講的都不是 Transformer

CS25 是 Stanford 的 1 學分 seminar,唯一作業是出席,全程對外開放。2026 春季第六季九場講座裡,最值得看的三場是 Albert Gu 談 SSM 與 Transformer 的歸納偏誤、Charles Frye 談上千張 GPU 的推論服務、Victoria Lin 談原生多模態還沒解決什麼。

Deep Learning 面試攻略:從 CNN 到 Transformer 的核心直覺

深度學習面試重點不是推導反向傳播,而是能不能解釋架構背後的設計直覺。高頻考點:CNN 的 locality 與 translation invariance、RNN 到 Transformer 的演進為什麼必要、self-attention 的計算邏輯與複雜度、BatchNorm vs LayerNorm 的適用場景、常見的 training tricks(learning rate schedule、gradient clipping、mixed precision)。