異動摘要
Arena(前身 LMSYS Chatbot Arena)Agent 類別排行榜最新一次官方發布(2026-10-08)出現第一名易主:Claude Opus 5.5(High)以 14.33% 首次登頂,結束 Claude Fable 5.1(Max)自 09-30 批次起蟬聯一個多月的第一名——Fable 5.1 這次分數從 14.31% 掉到 12.66%,直接跌到第三。GPT-6 Astra(Max)同步從第四升到第二(12.27%→13.09%),把原本排第三的 Claude Sonnet 5.5(Max)擠到第四。這是本系列第三次追蹤到 Agent 排行榜前段重新洗牌,但這次是前三名全部對調位置,幅度比前兩次單純「插隊」更大。
排名變化
Arena Agent 排行榜 — 2026-10-08(官方發布)
| 排名 | 模型 | 分數 | 10-02 分數 | 變化 |
|---|---|---|---|---|
| 🥇 | Claude Opus 5.5(High) | 14.33% | 13.82%(🥈) | ↑1 |
| 🥈 | GPT-6 Astra(Max) | 13.09% | 12.27%(4) | ↑2 |
| 🥉 | Claude Fable 5.1(Max) | 12.66% | 14.31%(🥇) | ↓2 |
| 4 | Claude Sonnet 5.5(Max) | 11.95% | 12.52%(🥉) | ↓1 |
| 5 | GPT-6.1 Sol(Max) | 11.72% | 11.23%(5) | — |
來源:Arena Leaderboard Dataset(agent 子集、latest split,category=overall)· 官方發布日期:2026-10-08 · 抓取日期:2026-10-10
Arena 官方資料集自 10-02 發布後連續 6 天未更新(本系列 10-05/10-06/10-09 三篇 escalation 記錄都確認過),這次是 10-02 之後的第一批新資料,距離上次發布隔了 6 天,比 10-02→10-04 那次只隔 2 天的更新頻率慢了不少。
分析:這次洗牌代表什麼
技術面
Claude Opus 5.5(High)這次登頂時觀測數(940,970 次)只有 Claude Fable 5.1(1,734,508 次)的約 54%,樣本量不是靠「累積更久」堆出來的優勢;反而是 Fable 5.1 樣本量最大卻分數掉最多(-1.65 個百分點),比較像是新一批對局把過去被 Fable 5.1 佔優勢的任務類型稀釋了,而不是 Fable 5.1 本身表現變差。GPT-6 Astra(Max)這次同時增加樣本量(到 915,013 次,上一批 10-02 時相對落後)又拉高分數(+0.82pp),兩個條件同時成立,是三個變動模型裡唯一「量增、分也增」的——這通常代表新一批對局涵蓋了更多原本 Astra 擅長的任務型態,而不只是統計噪音。
方法論面
⚠️ 跟前兩篇一樣的提醒:Arena 這裡的分數是自家的相對勝率量化分數,不是傳統 Elo 積分,同一模型不同批次的分數不能直接做精確的「漲跌百分點」計算,只能看排名順序與分數量級的相對變化。
信賴區間這次仍然大面積重疊:第一名 Opus 5.5 的 95% CI 是 [12.15%, 16.51%],第二名 GPT-6 Astra 是 [10.73%, 15.46%],第三名 Fable 5.1 是 [10.61%, 14.72%]——三個區間互相交疊超過 2 個百分點的範圍,統計上無法明確分出前三名的真正勝負順序。這跟 10-04 那次「四個名次 CI 幾乎完全重疊」的情況如出一轍,意味著「排名易主」這個標題本身比底層分數差異更戲劇化:真正能確定的只是「這三個模型目前仍在同一個無法明確分高下的集團內」,而集團內誰暫時站在最前面,可能很大程度取決於這一批抽樣的任務組合。
產業面
對正在比價的團隊,這次洗牌最值得注意的是價格排序完全沒變:Claude Opus 5.5($4/$20 per 1M tokens)登頂時,價格仍只有 GPT-6 Astra($10/$10)的四成左右,卻同時拿下分數最高和信賴區間下界最高(12.15%,三者中最高)兩項——這比上次(10-04)Sonnet 5.5 用「跟前代持平的價格擠進集團」的故事更進一步:便宜的選項不只是「追上」,這次是暫時排在最前面。但考慮到 CI 重疊,現在就把 Opus 5.5 當成「確定的性價比贏家」還太早,比較穩妥的結論是「這個價位帶($4/$20)至少不再是效能的妥協,值得放進下一輪選型的候選名單」。
今日收穫
連續追蹤三次 Agent 排行榜更新後,我注意到一個規律:每次「第一名易主」的新聞性標題底下,信賴區間幾乎從沒有真正分開過——這代表這類排行榜更適合用來篩出「值得測的候選集團」,而不是用來直接下「哪個模型最強」的結論。下次看到類似標題,應該先問「CI 有沒有重疊」,再決定要不要把它當作選型依據。
參考資料
Loading...