Marin 535B 怎麼訓:Scaling Ladder、MoE 專家並行、Harrier 資料與 W&B 現場
Stanford Marin 在 11×GB200 上公開訓練 535B-A23B,先用 1% 算力的 5 階 Scaling Ladder 預註冊 paloma macro-loss 2.04,再以 W&B 即時公開 847 組訓練數據;本文按訓練流程拆解其設計與監控方法。
Stanford Marin 在 11×GB200 上公開訓練 535B-A23B,先用 1% 算力的 5 階 Scaling Ladder 預註冊 paloma macro-loss 2.04,再以 W&B 即時公開 847 組訓練數據;本文按訓練流程拆解其設計與監控方法。
第四講沿著兩種稀疏化拆解現代 LLM:linear/recurrent attention 減少序列維度成本,MoE 讓每個 token 只啟用部分參數;兩者都把理論省下的 FLOPs 換成 routing、平衡與通訊問題。
第 17 章從 next-token loss 推到 Transformer、KV cache、MoE 與 SFT,說清楚 LLM 的訓練目標、架構與推論成本如何連在一起。