Skip to content
所有標籤

#annealing

1 篇文章

YuLan-Mini:1.08T tokens 怎麼榨出 2.4B 參數的旗艦小模型

YuLan-Mini 是中國人民大學 AI Box 實驗室用 48 張 A800 訓出來的 2.4B 開源模型:只餵 1.08T tokens,MATH-500 拿 37.8、HumanEval 64.0,數學與程式能力壓過用了 7T–18T tokens 的 Qwen2/Qwen2.5 同級模型。它公開的不是口號,是每個階段的資料配比、退火前的 optimizer 狀態、連消融實驗的 W&B logs。