Skip to content

Benchmark 異動|Arena Agent 排行榜:Claude Opus 5.5 登頂,衛冕一個多月的 Fable 5.1 掉到第三

2026年10月10日1 分鐘
TL;DRArena Agent 排行榜 10-08 發布:Claude Opus 5.5(High)14.33% 首次登頂(前次 13.82% 第二)、GPT-6 Astra(Max)13.09% 升到第二(前次 12.27% 第四)、Claude Fable 5.1(Max)12.66% 從蟬聯一個多月的第一跌到第三(前次 14.31%)、Claude Sonnet 5.5(Max)11.95% 跌到第四(前次 12.52% 第三)、GPT-6.1 Sol(Max)11.72% 維持第五;四家排名的信賴區間仍大面積重疊

🌏 English version

異動摘要

Arena(前身 LMSYS Chatbot Arena)Agent 類別排行榜最新一次官方發布(2026-10-08)出現第一名易主:Claude Opus 5.5(High)以 14.33% 首次登頂,結束 Claude Fable 5.1(Max)自 09-30 批次起蟬聯一個多月的第一名——Fable 5.1 這次分數從 14.31% 掉到 12.66%,直接跌到第三。GPT-6 Astra(Max)同步從第四升到第二(12.27%→13.09%),把原本排第三的 Claude Sonnet 5.5(Max)擠到第四。這是本系列第三次追蹤到 Agent 排行榜前段重新洗牌,但這次是前三名全部對調位置,幅度比前兩次單純「插隊」更大。

排名變化

Arena Agent 排行榜 — 2026-10-08(官方發布)

排名模型分數10-02 分數變化
🥇Claude Opus 5.5(High)14.33%13.82%(🥈)↑1
🥈GPT-6 Astra(Max)13.09%12.27%(4)↑2
🥉Claude Fable 5.1(Max)12.66%14.31%(🥇)↓2
4Claude Sonnet 5.5(Max)11.95%12.52%(🥉)↓1
5GPT-6.1 Sol(Max)11.72%11.23%(5)—

來源:Arena Leaderboard Dataset(agent 子集、latest split,category=overall)· 官方發布日期:2026-10-08 · 抓取日期:2026-10-10

Arena 官方資料集自 10-02 發布後連續 6 天未更新(本系列 10-05/10-06/10-09 三篇 escalation 記錄都確認過),這次是 10-02 之後的第一批新資料,距離上次發布隔了 6 天,比 10-02→10-04 那次只隔 2 天的更新頻率慢了不少。

分析:這次洗牌代表什麼

技術面

Claude Opus 5.5(High)這次登頂時觀測數(940,970 次)只有 Claude Fable 5.1(1,734,508 次)的約 54%,樣本量不是靠「累積更久」堆出來的優勢;反而是 Fable 5.1 樣本量最大卻分數掉最多(-1.65 個百分點),比較像是新一批對局把過去被 Fable 5.1 佔優勢的任務類型稀釋了,而不是 Fable 5.1 本身表現變差。GPT-6 Astra(Max)這次同時增加樣本量(到 915,013 次,上一批 10-02 時相對落後)又拉高分數(+0.82pp),兩個條件同時成立,是三個變動模型裡唯一「量增、分也增」的——這通常代表新一批對局涵蓋了更多原本 Astra 擅長的任務型態,而不只是統計噪音。

方法論面

⚠️ 跟前兩篇一樣的提醒:Arena 這裡的分數是自家的相對勝率量化分數,不是傳統 Elo 積分,同一模型不同批次的分數不能直接做精確的「漲跌百分點」計算,只能看排名順序與分數量級的相對變化。

信賴區間這次仍然大面積重疊:第一名 Opus 5.5 的 95% CI 是 [12.15%, 16.51%],第二名 GPT-6 Astra 是 [10.73%, 15.46%],第三名 Fable 5.1 是 [10.61%, 14.72%]——三個區間互相交疊超過 2 個百分點的範圍,統計上無法明確分出前三名的真正勝負順序。這跟 10-04 那次「四個名次 CI 幾乎完全重疊」的情況如出一轍,意味著「排名易主」這個標題本身比底層分數差異更戲劇化:真正能確定的只是「這三個模型目前仍在同一個無法明確分高下的集團內」,而集團內誰暫時站在最前面,可能很大程度取決於這一批抽樣的任務組合。

產業面

對正在比價的團隊,這次洗牌最值得注意的是價格排序完全沒變:Claude Opus 5.5($4/$20 per 1M tokens)登頂時,價格仍只有 GPT-6 Astra($10/$10)的四成左右,卻同時拿下分數最高和信賴區間下界最高(12.15%,三者中最高)兩項——這比上次(10-04)Sonnet 5.5 用「跟前代持平的價格擠進集團」的故事更進一步:便宜的選項不只是「追上」,這次是暫時排在最前面。但考慮到 CI 重疊,現在就把 Opus 5.5 當成「確定的性價比贏家」還太早,比較穩妥的結論是「這個價位帶($4/$20)至少不再是效能的妥協,值得放進下一輪選型的候選名單」。

今日收穫

連續追蹤三次 Agent 排行榜更新後,我注意到一個規律:每次「第一名易主」的新聞性標題底下,信賴區間幾乎從沒有真正分開過——這代表這類排行榜更適合用來篩出「值得測的候選集團」,而不是用來直接下「哪個模型最強」的結論。下次看到類似標題,應該先問「CI 有沒有重疊」,再決定要不要把它當作選型依據。

參考資料