CMU 07-280 Lecture 20: From Position Encoding to Causal Self-Attention
Lecture 20 expands one-token embeddings into sequences, adds positional information, derives Q/K/V scaled dot-product attention and causal masking, and assembles multi-head blocks into a GPT-2 skeleton.