Skip to content
所有標籤

#mmlu

1 篇文章
ai deep-dive 認識 AI 模型

模型成績單怎麼看:Benchmark、Arena Elo、還有那些數字背後的陷阱

模型發布時貼的 benchmark 數字有三個常見陷阱:只秀贏的(cherry-picking)、訓練資料混入考題(contamination)、大家都考 90 分以上就沒鑑別力(saturation)。最抗操弄的訊號是 Chatbot Arena 的 Elo 排名——真人盲測投票,模型廠商無法控制題目。