Skip to content
所有標籤

#stanford-cs336

1 篇文章
ai deep-dive

Marin 535B 怎麼訓:Scaling Ladder、MoE 專家並行、Harrier 資料與 W&B 現場

Stanford Marin 在 11×GB200 上公開訓練 535B-A23B,先用 1% 算力的 5 階 Scaling Ladder 預註冊 paloma macro-loss 2.04,再以 W&B 即時公開 847 組訓練數據;本文按訓練流程拆解其設計與監控方法。