今日總覽
業界設計多 Agent 系統時,常見的三個直覺是:多找幾個 Agent 一起做,結果會更好;就算做不到最好,至少能互相分工、互相制衡;辯論到最後收斂出來的共識,比單一 Agent 的答案更可信。今天三篇論文分別針對這三個直覺各給了一記現實檢查。《Multi-agent Scaling Across Disjunctive and Compensatory Tasks》用理論模型加大規模實驗證明,加 Agent 有沒有用要看任務結構——多數決在數學、選擇題這類任務上幾乎吃不到加人帶來的潛力,在需要統計平均的估算任務上,加再多人也擠不掉題目本身的系統性偏誤。《AgentWorld》用一個需要 3 到 20 個 Agent 分工協作 50 輪以上的長程基準測試發現,就算任務真的需要多 Agent 合作,目前最強的前沿模型成功率也只有 52%,而且把每個動作的因果貢獻拆解出來後,連最強模型都有近七成動作對完成任務毫無實質幫助。《Towards Mitigating Fabricated Consensus》則把焦點放在多 Agent 辯論最後一步——負責收斂共識的總結模型——顯示這一步在意見嚴重分歧時最容易把沒有共識的爭論,寫成一份讀起來很順但沒有證據支撐的假共識,而使用者其實更想看到誠實的「沒能達成共識」。三篇合起來的訊息很一致:多 Agent 不是萬靈丹,加人之前要先確認任務結構值不值得加人,加了人之後要確認協作本身有沒有效率,收斂結論的最後一步更要有機制防止被悄悄美化。
讀這篇前該知道的詞
| 詞 | 白話解釋 |
|---|---|
| Agent(智能代理) | 能自己規劃步驟、呼叫工具、跨多輪執行任務的 AI 系統,不是一問一答的聊天機器人 |
| 互斥型任務(Disjunctive Task) | 只要團隊裡「有一個人」答對就算成功的任務類型,例如數學題、選擇題;團隊表現的天花板取決於能不能把對的答案「選出來」 |
| 互補型任務(Compensatory Task) | 靠多個估計值統計平均得出結果的任務類型,例如猜一個數量級;團隊表現取決於每個人的誤差能不能互相抵消 |
| 因果協作效度(CCE) | 追蹤每個 Agent 動作是否真的對任務完成有因果貢獻,而不是單純算「任務有沒有成功」的量化指標 |
| 溯源保真度(Provenance Fidelity, PF) | 衡量一份總結裡有幾句話真的能對應回原始辯論紀錄的比例,PF 愈低代表總結裡愈多內容是編出來的 |
| 分歧報告(Divergence Report) | 當總結沒有通過溯源檢查時,系統改為明白列出「哪裡沒有共識、證據衝突在哪」的誠實報告,而不是硬湊出一個聽起來合理的結論 |
論文一|多 Agent 團隊人多真的力量大?先看任務長什麼樣
Multi-agent Scaling Across Disjunctive and Compensatory Tasks Carolina Fortuna, Blaž Bertalanič(Jožef Stefan Institute, Ljubljana) · arxiv: 2609.31563
TL;DR
測 13 個開源模型、最多 30 個 Agent 組隊,發現多數決在「互斥型」任務(數學、選擇題)上幾乎吃不到 Agent 加人帶來的潛力(pass@30 明明能到 54.4%,多數決卻幾乎停在原地),而在「互補型」任務(Fermi 估算)上,加再多 Agent 平均也擠不掉 87% 來自題目本身的系統性偏誤。
編輯判斷
| 面向 | 判斷 |
|---|---|
| Venue | arXiv preprint(未經同行審查,cs.AI 主分類、cs.MA 跨列) |
| 引用速度 | Semantic Scholar 本輪持續 429 限流,查無資料;發布於 2026-09-25,4 天,合理推測接近 0 |
| 機構 | Jožef Stefan Institute(斯洛維尼亞,盧比安納);同一組作者今年 5 月已發表過一篇多 Agent 辯論共識的相關會議論文,並非第一次做這個主題 |
| 社群反應 | 未見於 HuggingFace Daily Papers;論文摘要明確標示程式碼目前為「Open code placeholder」,尚未公開;未見 Papers with Code 收錄 |
| 可信度 | 通過 — 13 個開源模型(3B–20B)、團隊人數 1–30、5 個互斥型 benchmark + 1 個互補型 benchmark,合計約 6.8×10⁷ 次生成 |
| 證據成熟度 | 較完整 — 理論預測與觀測數據吻合到 650 組設定平均誤差僅 0.48 個百分點(Pearson r=0.999);互補型任務的誤差分解模型平均誤差僅 0.6%(r=0.997) |
| 可復現性 | 未提供 — 論文摘要明確寫「Open code placeholder」,程式碼尚未公開,目前無法獨立重跑 |
| 為什麼選這篇 | 直接 — 直接回答「要不要幫這個任務多加幾個 Agent」這個多 Agent 架構設計最基本的問題 |
| 方向新意 | 實質增量 — 首次把 Steiner 群體任務分類法系統性套進 LLM 多 Agent 場景,並提出可驗證的理論預測模型 |
| 今日重要性 | 高 — 直接挑戰「多加 Agent 一定更好」這個常見的架構設計預設 |
| 實務連結 | 明確 — 給出一套能事先判斷「這個任務加 Agent 值不值得」的具體框架 |
| 編輯信心 | 高 — 理論預測與觀測數據的吻合度極高,足以支持「任務結構決定加人有沒有用」這個限縮主張 |
| 閱讀建議 | 必讀 — 任何在評估要不要把單一 Agent 改成多 Agent 架構的團隊 |
| 主要限制 | 只測 3B–20B 的開源模型,未涵蓋 GPT / Claude / Gemini 這類生產環境最常用的前沿封閉模型;程式碼尚未公開,目前無法獨立驗證 |
領域背景
LLM 多 Agent 框架(辯論、取樣加總、投票)普遍隱含一個假設:團隊人數 N 愈大,系統表現愈好。這個假設其實直接對應到認知科學裡兩個互相矛盾的經典觀察——Galton 的「群眾智慧」(估計數字時群體中位數比個人準)與 Ringelmann 效應(團隊人數愈大,個人產出反而愈少)。Steiner 在 1972 年的群體任務分類理論指出,兩者之所以矛盾,是因為任務結構不同;過去的 LLM 多 Agent 研究大多沒有明確用這套分類法檢驗過自己的結果。
中階導讀
- 問題:想像你要決定一個任務該不該找更多 Agent 一起做。這篇問的是:「多加 Agent」到底在哪種任務上真的有用,哪種任務上只是虛耗算力?
- 方法:研究者把任務分成兩類。「互斥型」任務只要團隊裡有一個人答對就算贏(例如數學題),用多數決把答案選出來;「互補型」任務靠統計平均多個估計值(例如猜一個數量級)。他們先推導出兩種任務類型的理論天花板,再用 13 個模型、最多 30 人的團隊實際跑分驗證理論預測準不準。
- 為什麼重要:如果多數決在互斥型任務上根本吃不到加人的紅利,那「多找幾個 Agent 投票」這個常見設計就只是在燒算力;如果互補型任務的誤差主要來自題目本身而非隨機噪音,那「多個 Agent 取平均」這個常見設計也一樣沒用。
深入要點
- 互斥型任務:pass@30(至少一個 Agent 答對的機率)在 GSM8K 上從單一 Agent 34.3% 升到 54.4%,潛力明明很大,但 Round-1 多數決從 N=2 到 N=30 只多了 0.3–1.3 個百分點,幾乎沒吃到這個潛力
- 多輪修訂雖然效果顯著(GSM8K 從 34.1% 幾乎翻倍到 61.9%),但這個增益幾乎跟團隊人數無關——1 個同伴帶來的增益(26.5 分)跟 29 個同伴幾乎一樣(26.6 分,差距僅 -0.1 分)
- 更反直覺的是,6/13 個模型在多輪修訂下,團隊人數從 5 人擴大到 30 人反而讓準確率顯著下降(最多下降 3.01 分),這是明顯的「加人反而變差」
- 互補型任務(Fermi 估算):題目本身的系統性偏誤佔了均方誤差的 87%,就算是無限大的同質團隊,平均最多也只能消掉剩下的 13%,N=30 的準確率(33.4%)只比單一 Agent(31.6%)高一點點
- 異質團隊(混用不同模型家族)在兩種任務類型上表現不同:在互斥型任務上,5 模型組合(83.2%)雖然大幅超越自己成員的平均值,卻仍輸給團隊裡最強的單一模型(86.8%);但在互補型任務上,5 個 7B–8B 模型組成的異質團隊(誤差 1.45)反而超越了自己最強的單一成員(誤差 1.80),減少了約 25.8% 的誤差
- Limitation(作者自述及編輯補充):只測開源 3B–20B 模型,未涵蓋前沿封閉模型的真實團隊表現;程式碼目前僅為 placeholder,尚未公開
Reviewer 一句話評
理論模型與大規模實驗數據吻合度極高,「任務結構決定加 Agent 有沒有用」這個結論證據紮實;但目前只驗證了開源中小模型,生產環境常用的前沿封閉模型是否遵循同一套規律、以及程式碼何時公開讓外部重跑,都還是待補的一步。
給你的 take-away
- 如果你在決定要不要把單一 Agent 改成多 Agent 投票架構:先判斷任務是「有一個人答對就算贏」還是「靠平均值抵消誤差」,前者靠多數決幾乎吃不到加人紅利,後者如果題目本身偏誤大,加人也救不回來
- 如果你已經在用多 Agent 投票或取樣:這篇的「有效團隊人數」框架可以拿來估算你目前的團隊設計實際上等效於多少個獨立 Agent,可能會發現遠比帳面人數少很多
論文二|AgentWorld:20 個 Agent 一起打怪蓋城,最強模型也只有 52% 能完成
AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs Yusen Zhang, Young Min Cho, Jin Mo Yang et al.(Columbia University + University of Pennsylvania + Seoul National University + Penn State University) · arxiv: 2609.31590
TL;DR
AgentWorld 用 100 個需要 3–20 個 Agent 分工才能完成的長程任務(50+ 輪、MMORPG 沙盒)測試四款前沿模型,最強的 Gemini 3 Flash 也只有 52% 任務成功率,而且拆解每個動作的因果貢獻後,發現連它都有近七成的動作對任務完成毫無實質幫助。
編輯判斷
| 面向 | 判斷 |
|---|---|
| Venue | arXiv preprint(未經同行審查,cs.MA) |
| 引用速度 | Semantic Scholar 查得 citationCount 0;發布 1 天,尚無引用資料 |
| 機構 | Columbia University + University of Pennsylvania + Seoul National University + Penn State University,任務標註與評測另有 OpenAgents 開源社群志工協助 |
| 社群反應 | 未見於 HuggingFace Daily Papers;GitHub 已公開完整程式碼與資料(github.com/openagents-org/agentworld,經 GitHub API 確認上線),另有專屬網站 agentworld.io |
| 可信度 | 通過 — 100 個人工標註任務 + 100 個 LLM 擴增變體,3–20 個 Agent、25–55 輪,測 4 款前沿模型,並搭配 5 組基準線(random / 單 Agent 全包 / 無溝通 / 有溝通無共享計畫 / oracle 溝通)拆解協作本身的貢獻 |
| 證據成熟度 | 較完整 — 除主結果外,另有 35 題子集的元件消融(拿掉角色資訊、縮短輪數、隨機出生點、拿掉文件)與 3-seed 重跑變異量測試 |
| 可復現性 | 完整產物 — GitHub 公開完整沙盒環境、任務定義與驗證器、評測腳本與標註平台 |
| 為什麼選這篇 | 直接 — 第一個把「真正的協作能力」跟「任務難度」「低階操作負擔」分開量測的長程多 Agent 基準 |
| 方向新意 | 實質增量 — 新環境(MMORPG 沙盒 + blackbox 互動)搭配新指標(因果協作效度 CCE),並用真人標註驗證指標本身可靠 |
| 今日重要性 | 高 — 給出一個具體、可量化的「多 Agent 協作到底有多不成熟」的天花板數字 |
| 實務連結 | 明確 — 溝通量與成功率無關、oracle 溝通後仍有 40% 殘餘失敗率等發現,可直接對照正在設計多 Agent 溝通協定的系統 |
| 編輯信心 | 高 — 基準線排除了「單純任務太難」「低階操作負擔太重」等簡單解釋,CCE 指標也經過真人驗證,足以支持「現有前沿模型協作效率很低」這個主張 |
| 閱讀建議 | 必讀 — 任何在打造需要多 Agent 分工協作系統的團隊 |
| 主要限制 | 只測 4 款前沿模型且 DeepSeek R1-70B 明顯較舊,跨模型比較的公平性打了折扣;所有模型在難度更高的擴增變體上成功率都腰斬,顯示部分數字可能還對題目措辭敏感 |
領域背景
多 Agent 協作(不同角色的 Agent 在共享環境裡朝共同目標合作)的評測長期存在三個缺口:多數基準的任務長度在 20 步以內,不足以測試持續協調;許多基準把「低階操作」(精細 3D 導航、放置方塊)跟「協作決策」混在一起,協作能力對分數的影響被稀釋;像 Project Sid 這樣的大規模模擬則專注在湧現社會行為,缺乏可量化成敗的具體任務。
中階導讀
- 問題:想像一個 10 人團隊要在遊戲世界裡合力打造一把武器——礦工挖礦、鍛造工冶煉、鐵匠打造,每個人手上的資源和技能都不一樣,誰都無法獨自完成。現有前沿模型組成的 Agent 團隊,能不能真的把這種需要分工的任務做完?
- 方法:AgentWorld 用一個開源 MMORPG 引擎打造沙盒,把低階操作(戰鬥、採集、移動)封裝成 13 個高階 API,讓分數反映的是「協作決策」而不是「操作精細度」。每輪 Agent 只能靠聊天訊息協調,完全看不到彼此的內部狀態(blackbox 設定)。研究者另外設計了因果協作效度(CCE)指標,用 LLM 逐輪往回追溯每個動作是否真的對成功有因果貢獻,而不是像過去常見做法那樣讓 LLM 主觀打「協作品質 1–5 分」。
- 為什麼重要:如果連最強的前沿模型都只有 52% 成功率,而且有近七成動作是白費力氣,代表「多 Agent 協作」目前還遠遠不是一個可以無腦疊加人數解決問題的能力,而是一個獨立、還沒被攻克的難題。
深入要點
- 主結果:Gemini 3 Flash 領先(52.0% 成功率),依序是 Claude Haiku 4.5(45.0%)、GPT-5 Mini(36.0%)、DeepSeek R1-70B(20.0%)
- CCE 揭露的浪費程度:即使是最強的 Gemini,CCE 也只有 0.320(不到三分之一的動作對成功有因果貢獻);DeepSeek 的 CCE 只有 0.125,代表近 88% 的動作是白費
- 基準線拆解:random 動作只解 5.7%、單 Agent 全包解 28.6%,證明任務確實需要多人協作;oracle 溝通(一個 Agent 看得到所有訊息)把成功率拉到 60.0%,但仍有 40% 殘餘失敗率,顯示困難不只來自溝通不足
- 溝通量不等於協作品質:GPT-5 Mini 傳最多訊息(平均 44.1 則)但排名第三;DeepSeek 傳最少(7.5 則)卻排名最後,且平均到第 5 輪才開口,錯過早期協調的關鍵窗口
- CCE 指標可靠性驗證:與人工標註的因果判斷達成 Cohen's κ=0.64(「substantial」等級),跟兩個不同 judge 模型互評的 κ=0.66 幾乎一樣;換三種不同 judge 模型重算 CCE,模型排名完全不變
- 難度更高的擴增變體上,所有模型成功率大約腰斬(Gemini 52%→24%、DeepSeek 20%→10%)⚠️(作者自測,尚待外部復現)
- Limitation(作者自述):只評測 4 款前沿模型,DeepSeek R1-70B 相對較舊,跨模型比較的代表性有限
Reviewer 一句話評
基準線設計嚴謹,能明確排除「任務太難」「操作太繁瑣」這些簡單解釋,CCE 指標也經過真人驗證,「現有前沿模型的多 Agent 協作效率很低」這個結論站得住腳;但只測了 4 款模型且擴增變體上數字大幅波動,提醒讀者不要把 52% 這個數字當成穩定不變的天花板。
給你的 take-away
- 如果你在設計需要多 Agent 分工的系統:先假設協作本身會浪費掉大半的執行動作,把預算和重試次數抓寬一點,不要只用單 Agent 基準估算成本
- 如果你在評估自家系統的多 Agent 協作品質:比起單純看任務成功率,試著採用類似 CCE 的因果貢獻拆解,才能分辨團隊是「真的在合作」還是「一個人做事,其他人在陪跑」
論文三|多 Agent 辯論收斂成結論的那一刻,才是最容易造假的地方
Towards Mitigating Fabricated Consensus: The Active Provenance Gate for Multi-Agent Debate Synthesis Jakub Masłowski, Jarosław A. Chudziak(Warsaw University of Technology) · arxiv: 2609.31422
TL;DR
多 Agent 辯論結束後負責總結的模型,在高衝突情境下,合成結論的溯源保真度只有 0.288;加一道「溯源閘門」會擋下 75% 沒有達標的總結、改成明白列出分歧的報告——而人類研究裡超過七成受試者表示,他們寧願看到「沒有共識」的老實報告,也不要一份讀起來流暢卻是編出來的假共識。
編輯判斷
| 面向 | 判斷 |
|---|---|
| Venue | 已被第 38 屆 IEEE ICTAI 2026 接受(同行審查會議) |
| 引用速度 | Semantic Scholar 本輪持續 429 限流,查無資料;發布於 2026-09-25,4 天,合理推測接近 0 |
| 機構 | Warsaw University of Technology(波蘭華沙理工大學) |
| 社群反應 | 未見於 HuggingFace Daily Papers;未見 Papers with Code 收錄;GitHub 已公開專屬程式碼倉庫並附完整重現材料包(github.com/m-Jakub/resilient-mas-framework,經 GitHub API 確認上線) |
| 可信度 | 有條件通過 — 90 次對抗性測試搭配前後對照的溯源保真度數字、validator 對稱性消融、N=33 人類盲測 A/B 研究,證據形式相稱但規模偏小 |
| 證據成熟度 | 初步 — 核心機制(溯源保真度量測、自我修復、硬性閘門)測試方式合理且通過同行審查,但僅限單一合成的危機模擬情境與 33 人便利抽樣的人類研究,尚未驗證能否類推到真實生產環境的多 Agent 辯論系統 |
| 可復現性 | 完整產物 — GitHub 公開辯論語料庫、完整 prompt 模板、驗證程式碼與人類研究問卷資料 |
| 為什麼選這篇 | 直接 — 多 Agent 辯論 / 投票是常見的「多找幾個 Agent 互相制衡」設計模式,這篇直接檢驗這個模式收斂結論那一步的可信度 |
| 方向新意 | 應用改寫 — 主動驗證閘門、自我修復這類機制本身並非全新概念,但把它精準套用在「辯論到總結」這個經常被忽略的交界點,並提出可量化的溯源保真度指標 |
| 今日重要性 | 高 — 直接挑戰「多 Agent 辯論出來的共識比單一 Agent 答案更可信」這個常見假設 |
| 實務連結 | 明確 — validator 對稱性消融的結果(同一模型當生成者又當審核者幾乎沒用)可直接對照正在設計 LLM-as-judge 或自我審核架構的系統 |
| 編輯信心 | 中 — 統計顯著的結果加上同行審查支持核心主張,但人類研究樣本小、情境單一,實際部署規模效果仍待驗證 |
| 閱讀建議 | 必讀 — 任何在用多 Agent 辯論、投票做決策聚合或決策支援系統的團隊 |
| 主要限制 | 人類研究僅 33 人且為便利抽樣的非專業操作者,測試場景限定單一虛構危機模擬;溯源檢查只對照辯論紀錄本身是否一致,不驗證是否符合外部真實世界 |
領域背景
多 Agent 辯論(Multi-Agent Debate, MAD)常被用來提升 LLM 推理的穩健性與事實性,普遍假設只要保留完整的辯論紀錄,最後的總結模型就能忠實壓縮討論內容。現有的溯源框架(如 PROV、PROV-AGENT)大多把系統紀錄當成事後診斷用的被動產物,而不是能主動介入的控制機制;自我修正類方法(self-refine、reflexion)也很少在「合成邊界」本身強制驗證。
中階導讀
- 問題:想像一個危機處理委員會由多個專家 Agent 辯論後,最後由一個負責寫報告的模型把討論結果整理成建議。如果專家們根本沒有達成共識,這個報告模型會不會為了「讀起來順」而編出一個看似合理但其實沒人真正同意的結論?
- 方法:Active Provenance Gate(APG)是插在辯論結束與正式發布之間的一道驗證關卡。它先把整場辯論的公開發言、知識圖譜證據、私下策略紀錄凍結成一個封閉的證據世界,再由一個高階審核模型逐句檢查總結裡的每一句話能不能在證據裡找到支撐(溯源保真度,PF)。PF 沒達到 0.95 的硬門檻,系統會啟動最多 3 輪的自我修復;修復後仍不過關,就不硬湊結論,改成明白列出「哪裡沒有共識、證據衝突在哪」的分歧報告。
- 為什麼重要:如果多 Agent 系統的最後一步——把辯論收斂成結論——本身就是最容易被悄悄美化的地方,那「多找幾個 Agent 辯論,答案會更可信」這個假設就需要打上問號;而且研究發現使用者其實更希望被誠實告知「沒有共識」,而不是被一份讀起來很順的假共識矇混過去。
深入要點
- 高衝突情境下,未加閘門的基準總結溯源保真度僅 0.288,低衝突情境下也只有 0.183——顯示只要辯論裡有沒解決的分歧,總結模型就傾向把它抹平成一個聽起來合理的結論
- 加上主動審核與自我修復後,終端溯源保真度回升到 0.617(高衝突)與 0.586(低衝突),但仍未達 0.95 的硬門檻,因此高衝突情境下有 75.0% 的總結被閘門擋下、改為分歧報告,低衝突情境下這個比例是 60.0%
- validator 對稱性消融:讓同一款模型同時當生成者與審核者,錯誤核准不安全妥協的比例高達 85.6%;換成更強的獨立模型當審核者後,同樣文字被判定的溯源保真度降到 0.300,正確擋下 63.3% 的不可調和輸出
- 人類 A/B 研究(N=33):66.7% 的人覺得基準版本讀起來更「流暢、圓融」,但在高衝突情境下,75.8% 的人認為 APG 版本更忠於證據;在零和僵局情境下,APG 的分歧報告信任分數(3.27 分)顯著高於基準的假共識(2.45 分,配對 t 檢定 p=0.0039)⚠️(N=33 便利抽樣,尚待更大規模與專業操作者驗證)
- 自我修復效率不錯:修復後的文字長度保留率達 97.3%,顯示系統是靠重新組織論述而非粗暴刪減來達標
- Limitation(作者自述):研究僅限合成模擬與硬編碼的衝突情境;溯源檢查是封閉世界假設,只對照辯論語料本身,不核對外部真實世界;33 人的便利抽樣樣本未區分領域專家與一般使用者;LLM 審核者本身也可能有語言偏誤與提示敏感性,存在「用 LLM 驗證 LLM」的循環風險
Reviewer 一句話評
溯源保真度的量測設計清楚,同行審查加上統計顯著的人類偏好結果,支持「主動驗證閘門能減少辯論總結的假共識」這個核心主張;但目前只在一個合成危機模擬情境、33 人便利抽樣的規模下驗證,能否類推到真實生產環境的規模與多元場景,論文自己也誠實列為待驗證的下一步。
給你的 take-away
- 如果你在設計多 Agent 辯論或投票系統的最終輸出:不要只信任辯論紀錄完整就代表總結忠實,在合成邊界加一道獨立審核(而非讓同一模型球員兼裁判),這篇的對稱性消融顯示自我審核幾乎沒用
- 如果你在做決策支援系統的介面設計:考慮把「誠實的分歧報告」設計成一個正式的輸出選項,而不是只有「成功產出建議」或「系統出錯」兩種狀態——這篇的人類研究顯示使用者在高風險情境下更信任誠實的失敗
今日收穫
之前以為多 Agent 系統的問題主要是「協作機制設計得好不好」,今天發現更根本的問題是:很多任務結構本身就決定了加 Agent 沒有用,而就算任務真的需要協作,現有前沿模型也還遠遠不會真正分工;更意外的是,多 Agent 系統最後「收斂成結論」的那一步,反而是最容易被悄悄美化、也最需要獨立把關的地方——防禦的重點不是加更多層審核,而是確保每一層審核不是自己審自己。
參考資料
- Multi-agent Scaling Across Disjunctive and Compensatory Tasks
- Multi-agent Scaling Across Disjunctive and Compensatory Tasks — alphaxiv
- AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs
- AgentWorld — alphaxiv
- AgentWorld — GitHub
- Towards Mitigating Fabricated Consensus: The Active Provenance Gate for Multi-Agent Debate Synthesis
- Active Provenance Gate — alphaxiv
- Active Provenance Gate — GitHub reproducibility bundle
- arXiv cs.MA new listings
- HuggingFace Daily Papers
Loading...