Skip to content
所有標籤

#gpt-2

2 篇文章

CMU 07-280 Lecture 20:從 Position Encoding 推到 Causal Self-Attention

第 20 講先把單 token embedding 擴成 sequence,以 positional encoding 補順序,再推導 Q/K/V scaled dot-product attention、causal mask 與 multi-head blocks,最後接到 GPT-2。

CMU 07-280 階段複習二:用 AlexNet 與 GPT-2 把模型真正組起來

第二階段不把 CNN 與 Transformer 當兩份架構圖背誦,而是透過 HW8 與 HW11 檢查表示、計算圖、訓練、遷移與生成是否真的接得起來。