05–07 組教材的主線是資訊怎麼跨位置流動。sequence model 逐步更新狀態;seq2seq 把輸入與輸出拆成 encoder/decoder;attention 讓 decoder 直接選取來源位置;Transformer 再把 recurrent path 換成 parallel attention blocks。
三個模型要比較的是資訊路徑
RNN 的隱狀態把過去壓進固定大小的向量,長距離訊息必須走過多次更新。seq2seq 提供輸入到輸出的結構,但固定 context 仍可能成為瓶頸。attention 建立內容導向的捷徑;Transformer 則要額外處理位置、mask、normalization 與殘差。
讀公式時,先逐一標出 tensor shape,再畫 token 到 token 的依賴圖。這比背「query、key、value」三個名詞更快發現 causal mask、head reshape 與 residual connection 寫錯的位置。
A2 把架構拆成可以測試的元件
Assignment 2 要求從頭實作 BPE、RMSNorm、SiLU、SwiGLU、RoPE、scaled dot-product attention、causal multi-head attention、Transformer blocks 與 LM,再補 cross-entropy、optimizer、scheduler、gradient clipping、FLOPs 與 memory estimation。starter repository 可匿名取得。
校外讀者最值得保留的是 component tests。先用極小 tensor 驗證 shape、mask 與數值穩定,再跑 TinyStories;沒有 GPU 時縮小 layers、hidden size 與 context length,仍能驗證正確性。hidden tests 與正式 Gradescope 不公開,所以「本機 tests 通過」不能寫成「完成官方驗收」。
參考資料
Loading...