Skip to content
所有標籤

#chinchilla

1 篇文章
ai deep-dive 認識 AI 模型

Scaling Laws:模型要多大才夠,以及為什麼不是越大越好

Scaling laws 說 loss 跟參數量、資料量、算力之間有可預測的冪次關係。Chinchilla 論文的關鍵發現:大多數模型都太大、訓練資料太少——同樣的算力預算,訓練一個較小但吃更多資料的模型反而更強。這改變了整個產業的訓練策略。