Skip to content
所有標籤

#maximal-update-parameterization

1 篇文章

MIT 6.7960 L07:優化縮放定律 —— 譜視角、特徵學習與超參數遷移

優化不是孤立的數值問題:用譜視角看 SGD,權重更新的『量』決定特徵學習;Maximal Update Parameterization 讓學習率與初始化跨寬度遷移,critical batch size 決定算力換取收斂的邊際。