Skip to content
← Daily Digest

多 Agent 協作

Multi-Agent

多 Agent 協定、角色分工、MCP、A2A、通訊架構

論文時間軸(31 篇)

2026-05-25
SARC: 把法規義務編譯成執行時約束 必讀

與其把「請遵守法規」寫在 prompt 裡然後希望 AI 記得,SARC 把規範編譯成四個硬性卡關站嵌進代理人的執行迴圈,不依賴 AI 的「記憶力」。

arxiv: 2605.07728
2026-05-25
約束漂移:LLM 多代理系統被忽視的安全失效模式 必讀

多代理系統中的安全規範不會自動持續有效——它們會在記憶存取、任務委派、工具呼叫等七個環節中悄悄弱化,這篇命名為「約束漂移」並提出分類框架。

arxiv: 2605.10481
2026-05-25
隱形協調者讓多代理系統喪失保護性行為 略讀

用「有沒有可見的領導者」做 AI 實驗:當多代理系統的協調者是隱形的(工作代理不知道有人在指揮),整個系統的保護性行為顯著下降——對流行的 orchestrator 架構是直接的設計警示。

arxiv: 2605.13851
2026-05-26
Predictive Maps of Multi-Agent Reasoning: A Successor-Representation Spectrum for LLM Communication Topologies 略讀

借用神經科學的「後繼表示」矩陣,用三個數學量在部署前預測 multi-agent 系統選 Chain、Star、Mesh 哪種拓撲時會出現觀點漂移、假共識或不穩定三種失敗模式。

arxiv: 2605.11453
2026-05-28
AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning 必讀

讓多個 agent 同時跑同一個任務,並透過一個「共享推理筆記本」互相學習彼此的發現,比單一強 agent 更能搞定複雜長任務。

arxiv: 2605.24486
2026-06-08
Beyond tokens: a unified framework for latent communication in LLM-based multi-agent systems 略讀

Multi-agent 系統裡 agents 之間傳文字很貴又有資訊損失,這篇 survey 整理「改傳 embedding / hidden state / KV-cache」的研究現狀,提出分類框架,幫你評估這條路能否用在你的 agent 系統。

arxiv: 2606.05711
2026-06-10
Autonomous Incident Resolution at Hyperscale: An Agentic AI Architecture for Network Operations 必讀

一套分層多 Agent 系統在真實雲端環境自動偵測、診斷並修復網路故障,生產部署後達 90%+ 自主解決率,不需人工介入。

arxiv: 2606.09122
2026-06-14
Agentic Environment Engineering for Large Language Models: A Survey 必讀

把「怎麼設計 AI Agent 執行環境」系統化:8 個屬性 × 8 個應用領域分類框架,加上 symbolic vs. neural 兩種自動合成範式,是 agent environment 設計的入門地圖。

arxiv: 2606.12191
2026-06-16
Agents All the Way Down: A Methodology for Building Custom AI Agents from Substrate to Production 必讀

不想每次框架升級就重寫 agent?這篇給你從 LLM API 底層到上線維護的完整方法論:兩個前提條件(substrate + building blocks)加上三個持續實踐,比「先 pip install langchain」更底層也更持久。

arxiv: 2606.11869
2026-06-23
Beyond Global Replanning: Hierarchical Recovery for Cross-Device Agent Systems 必讀

跨多台設備的 agent 執行失敗時,別急著全部重來——先讓設備端自己試著換個方式(API → CLI → GUI),不行再往上呈報給總指揮。

arxiv: 2606.20487
2026-06-23
Hierarchical Control in Multi-Agent Games: LLM-based Planning and RL Execution 略讀

用 LLM 當多 agent 團隊的指揮官決定策略方向,再讓 RL 訓練的底層 agent 負責真正的動作執行——兩者各司其職,比純 RL 或純手工規則都更彈性。

arxiv: 2606.20014
2026-06-24
PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems 必讀

測試 1665 個工具下的長程規劃:最強 LLM 在無干擾時成功率只有 52%,一旦部分工具被封鎖更跌至 11%;這是第一個專門測「大量工具 + 工具失效」組合下 Agent 有多脆弱的 benchmark。

arxiv: 2606.22388
2026-06-24
A Technical Taxonomy of LLM Agent Communication Protocols 必讀

MCP、A2A、ACP、ANP 這些 Agent 通訊協定到底差在哪?TU Munich 分析 9 個主流開源協定,給出第一份技術分類法,讓選協定從「哪個比較紅」變成「哪個技術特性符合我的需求」。

arxiv: 2606.19135
2026-06-24
Arbor: Tree Search as a Cognition Layer for Autonomous Agents 略讀

AMD 提出 Arbor:把「樹狀搜尋」當作多 Agent 系統的共享工作記憶,讓 Orchestrator、Specialist、Critic 三類 Agent 圍繞同一棵搜尋樹協作,失敗的嘗試也被保留為後續探索的診斷訊號。

arxiv: 2606.12563
2026-06-25
Sakana Fugu Technical Report 必讀

Sakana AI 訓練了一個「學會指揮其他模型」的 0.6B 小型協調器,把 Claude/GPT 等現有 frontier 模型的能力組合出超越任何單模型的表現,在 SWE-Bench Pro 達到 73.7%(公開最強)。

arxiv: 2606.21228
2026-06-27
Composing Verifiable Conceptual Models via Building Blocks: Towards Design-Time Verification of Agentic AI Workflows 必讀

Agent workflow 設計好、上線後才發現 Agent 卡死或邏輯繞圈,這很常見——這篇提出在「設計階段」用 12 條結構規則自動驗證 workflow 設計有沒有問題,概念類似 IDE 的 type check。

arxiv: 2606.21565
2026-06-27
Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents 必讀

Agent benchmark 的「總分排行榜」換個情境就失準——這篇用 14 組大規模平行實驗證明排名不穩定,並提出以「預測有效性」(in-sample 與 out-of-sample 排名相關性)取代總分均值作為選型指標。

arxiv: 2606.19704
2026-07-01
The Shift to Agentic AI: Evidence from Codex 必讀

OpenAI 用 Codex 真實使用數據,首次大規模量化「agentic AI 如何改變工作」:2026 年上半年用戶增 5 倍、任務規模膨脹 10 倍,且最重要的是,改變已從工程師擴散到法務、研究等非技術職能

arxiv: 2606.26959
2026-07-02
DeLM: Decentralized Multi-Agent Systems with Shared Context 必讀

把 Multi-Agent 系統裡「一個主管分派所有任務」的架構,換成「所有 agent 共讀一個驗證過的進度表、自己搶任務」——SWE-bench 上省 50% 成本,還拿到更高分。

arxiv: 2606.10662
2026-07-07
UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development 略讀

讓 multi-agent 軟體開發框架學會「自我懷疑」:用 token 的信心分數決定哪個 agent 的輸出需要驗證再轉交,防止早期錯誤在 pipeline 中滾雪球。

arxiv: 2607.02186
2026-07-15
Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors 必讀

多個 AI agent 協同執行惡意任務時,「每個 agent 各自監控」的防禦策略會因為碎片化效應大打折扣;加入明確攻擊規劃者(planner agent),攻擊成功率最高提升 7 倍。

arxiv: 2607.07368
2026-07-16
PalmClaw: A Native On-Device Agent Framework for Mobile Phones 必讀

現有手機 agent 都靠「模擬點擊螢幕」操作手機,PalmClaw 改成直接呼叫裝置 API:任務成功率提升 11.5%、完成時間縮短 94.9%,而且每一步的執行邊界清楚得多。

arxiv: 2607.13027
2026-07-17
Designing Agent-Ready Websites for AI Web Agents 必讀

用四個設計維度重新打造電商網站,讓 AI 瀏覽器 agent 完成購物任務的成功率從 49% 提升到 89%。

arxiv: 2607.12056
2026-07-20
Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning 略讀

現有 RL 訓練算法(PPO / GRPO)對 agent 來說很浪費:每次都從頭跑 N 條路徑比較。BPO 只在「真正需要比較」的高熵決策點快照並分叉,用兄弟軌跡(sibling trajectory)的 return 差異計算 advantage,讓訓練更有效率。

arxiv: 2607.14171
2026-07-20
Orchestrating Power Grid Studies with Multi-Agent AI and MCP Servers 跳過

Position paper:以電網研究為案例,展示如何用 MCP(Model Context Protocol)把 LLM agents 接上專業領域仿真工具,並在嚴格需要 human-in-the-loop 的工業流程中落地 multi-agent AI。

arxiv: 2607.14158
2026-07-21
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration 必讀

搜尋型 agent 老是卡迴圈?SearchOS 把搜尋進度變成「顯性的共享狀態」,加上失敗記憶機制,讓 multi-agent 協同搜尋比 baseline 快 24%、F1 提升 4.3 分。

arxiv: 2607.15257
2026-07-23
MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation 必讀

首個把「完成網頁任務」和「生成操作教學」合為一個 benchmark 的多模態評測,完全基於截圖;目前最強模型任務完成率低於 40%,GRPO 訓練讓 9B 小模型完成率從 6.9% 近乎翻倍到 13.2%。

arxiv: 2607.10079
2026-07-29
A Comparative Study of MCP and A2A for Inter-Agent Coordination in LLM-Based Systems 必讀

MCP 管「模型接工具」,A2A 管「Agent 跟 Agent 講話」,兩者不是競爭關係而是分層設計,就像 USB 跟 Wi-Fi 各管各的事,都需要。

arxiv: 2607.23884
2026-07-30
TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI 必讀

多步驟 Agent 任務不能每次呼叫 LLM 都重新選模型;TRACE-ROUTER 改成任務入場時選一次模型並釘死到任務結束,用最終結果回饋訓練選模型的策略,比傳統路由方式在相同延遲下多出 7–8 個準確率百分點。

arxiv: 2607.22465
2026-08-02
ProACT: Towards Breakdown-Aware Proactive Agent in Multi-User Collaboration 必讀

教 Agent 在多人對話中辨識「有人卡住了」,然後選對時機插一句有用的話,而不是一直打擾或一直沉默。

arxiv: 2607.03730
2026-08-03
Toward an Organizational Science of Multi-Agent LLM Systems 必讀

把「哪些 agent 上場」、「怎麼溝通」、「最終怎麼整合答案」三件事分開設計,讓你可以各自換掉,不用每次重頭架系統。

arxiv: 2607.25446

相關 Digest(23 篇)

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-20

Volcengine(字節跳動旗下)開源 OpenViking,用 viking:// 虛擬檔案系統取代黑盒向量搜尋做 Agent 記憶,官方測試把準確率拉到 80%+ 同時省 34–91% token;munder-difflin 把多個 coding CLI 包成桌面辦公室、用共享記憶層互相協作;ai-memory 用 Rust MCP server 解決『換 CLI 就失憶』的痛點;mukul975 的資安技能包一天內衝到近 2.8 萬星。pydantic-ai v2.32.0 補強 OpenRouter/xAI 附件搜尋與 instrumentation。

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-16

Vercel 推出 filesystem-first 的 TypeScript agent 框架 eve,深度綁定自家 AI Gateway/Sandboxes;Prime Intellect 的 Prime Agent 把整個對話 context 當程式變數,搭配可自我改寫的 Continual Harness;aden-hive 的 Hive 用『複製 Queen』取代預先編譯的執行圖;HKUDS 的 nanobot 靠 v0.3.0 Agency Release 半年內衝上 4.7 萬星。今日 watchlist 框架無重大版號更新。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-05

ToolLIFT 把工具軌跡抽象成函數級工作流圖,OOD 準確率平均提升 4+ 百分點;HyperAgent 用工具-Schema 超圖建構缺口驅動的支援子圖,在 AppWorld 上比 ReAct 高 14.3 百分點且 token 用量更低;多語言多 Agent 規劃診斷發現低資源語言的規劃失敗佔比隨語言資源下降而升高,TART 修正法平均提升 5.6 百分點

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-03

今天三篇論文分別從多 Agent 的「組織設計」、「安全隔離」與「使用者授權」三個維度切入平台建設難題。IMACS 把 multi-agent 系統拆成三個可獨立替換的層(組織、協調、協作演算法),讓框架設計者能像換積木一樣調整 Agent 角色或協作策略;APPA 用「分支上下文」打破 IFC(資訊流控制)的可用性瓶頸,在 4 個模型上把 prompt injection 外洩率從 31–50% 壓低至 0–7%;UW 的調查在 21 個 Agent 授權方案中發現,絕大多數系統只提供「開發者定義的全局策略」,使用者個人化授權幾乎付之闕如。三篇合在一起,勾勒出 agent 平台從原型走向生產

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-02

今天三篇各從不同角度逼視「Agent 在真實環境裡出事了怎麼辦」:ProACT 問的是多人協作中 Agent 應何時開口(Agent UX 設計問題);第二篇用真實 GitHub 資料揭露 Coding Agent 和自己開的 PR 互衝(平台 ops 痛點);第三篇從安全視角整理 Cyber-capable Agent 五大漏洞類別,以今年七月的 HuggingFace/OpenAI 事件為 case study。三篇合起來是一堂「Agent 上線後,你沒想到的麻煩都在這裡」速成課。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-29

今天三篇論文共同聚焦在「生產級多代理人系統的基礎設施可靠性」:第一篇比較 MCP 與 A2A 兩個協定如何分工、不是競爭而是互補;第二篇實測工具升版後 12 個頂尖模型的能力退化,發現前沿模型也會掉分 13-14%;第三篇揭示把安全模型串成 pipeline 之後整體反而不安全,因為防護其實是靠雲端供應商的伺服器端過濾器在撐。三篇合起來回答了「怎麼接工具」、「工具升版會不會壞」、「串起來安不安全」三個平台工程師最實際的問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-21

今天三篇論文從不同層面回答同一個問題:「怎樣才算一個真正能用的 agent 系統?」SearchOS-V1 給出架構答案——把搜尋進度外顯成結構化狀態、記錄失敗路徑,讓 multi-agent 協作搜尋更可靠;AutoSynthesis 展示高度結構化的學術任務(系統性文獻統合分析)可以被 multi-agent 流水線全自動化;Digital Pantheon 則解決「如何讓 agent 在壓力下維持既定人設」的角色工程問題,並引入可審計的多 agent 協商架構。三篇合看,分別對應 agent runtime 設計、workflow 編排、與人設工程三個核心挑戰的最新解法。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-20

今日三篇論文從三個不同角度審視 AI coding agent 的落地挑戰:第一篇用系統性實驗揭露 coding agent 在安裝套件時可被普通 README 發動供應鏈攻擊,且防禦能力主要取決於 harness 框架而非模型本身;第二篇提出 BPO 演算法,專為 sandbox-native agent 強化學習設計,只在高熵關鍵決策點分叉採樣提升訓練效率;第三篇以電網研究為案例,展示 MCP 如何作為標準協議串接工業場景的 domain-specific 仿真工具,為垂直領域 agent 落地提供可複製模板。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-18

今天三篇論文從三個維度切入「生產等級 Agent 可靠性」:MemCon 把記憶體操作建模為強化學習問題,讓 agent 自學何時存、取、忘,在 6 個 benchmark 上任務成功率最高提升 15.2 分;AgentCheck 把 MCP 伺服器變成除錯介面,開發者可重現工具故障、注入修復並驗證效果,填補了 MCP 生態長期缺乏「測試工具」的空缺;AgentAbstain 則用 263 個配對任務揭露:即便是最強的 frontier 模型,在「應拒絕行動」情境下正確率不到 60%,且棄動能力與任務解決能力幾乎無關——光靠換更強的模型無法解決這個問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-16

三篇論文不約而同都在問同一個問題:agent 的每一步執行單元,到底應該怎麼設計才能讓它可稽核、可重用、出了錯能最小範圍修復?ATG 把任務分解成有向無環圖(DAG)讓子任務並行、中間結果可複用;PalmClaw 把手機原生 API 直接包成結構化工具,甩掉難以追蹤的 GUI 點擊序列;IoAT 則把 agent 網路延伸到 IoT 物理世界,從智慧建築到邊緣設備,畫出跨雲端、邊緣、感測器層的協調藍圖。共同主軸:執行邊界要清楚、動作要可稽核、失敗要能局部恢復。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-07

今天三篇論文都圍繞「讓 agent 系統更安全、更可預測、不出包」這個主軸。前兩篇出自同一研究團隊,以靜態分析角度出發:一篇系統性揭露 agent 陷入無限循環的成因與規模,另一篇則為整個 agent 程式碼建立依賴圖,讓安全審計和元件盤點成為可能。第三篇針對 multi-agent 軟體開發,把 LLM 輸出的信心分數引入協作流程,防止早期幻覺向下游蔓延。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-01

今天三篇涵蓋 AI Agent 生態的不同維度:Qwen 團隊推出首個跨七大 agent 領域的「語言世界模型」,讓 agent 能在模擬環境中訓練而非倚賴真實 API;快手 AgentX 展示多 Agent 系統在工業規模下的生產部署成果,把推薦算法迭代效率提升至人工的 13.8 倍;OpenAI 則用 Codex 真實使用數據,首次量化 agentic AI 正在如何改變各職能工作者的實際產出,並揭示非技術職能(法務、研究)的 agentic 紅利甚至超越工程師。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-26

今天三篇各攻一個角度:第一篇 **RigorBench** 問的是「AI coding agent 怎麼解題」而非只看答對率,提出五維流程紀律指標;第二篇來自產業實踐,教你如何把大型 LLM multi-agent 系統客製化、加速,讓企業真的用得起(實測 4.48 倍吞吐量提升);第三篇則從治理角度出發,為 AI 融入軟體開發生命週期提出一套正式協議語言,讓「哪些決定讓 AI 做、哪些要人工審核」從 prompt 裡的一句話,變成可機器驗證的規格。三篇合起來覆蓋「怎麼評估、怎麼部署、怎麼治理」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-24

今天三篇從工具可靠性、協定選型、多 Agent 協作三個角度切入 Agent 平台的痛點:PlanBench-XL 揭露頂尖 LLM 在真實大型工具環境下一遇到工具失效就崩潰(GPT-5.4 從 52% 跌至 11%);TU Munich 給出第一份 MCP/A2A/ACP/ANP 等 9 個協定的技術分類法,讓選型有系統依據;AMD 的 Arbor 提出以樹狀搜尋作為多 Agent 的共享認知空間,讓失敗也成為有用的探索訊號。三篇合在一起,恰好描繪出 2026 年 Agent 平台的三塊基礎設施缺口。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-14

今天三篇論文從不同角度切入同一核心問題:**如何在真實部署條件下評估與運行 AI Agent?** Emergence World 建立持續運行數週的多 Agent 沙盒,揭露短期 benchmark 看不到的行為漂移與跨模型交叉影響;Survey 論文為 agent 執行環境設計建立完整分類學(8 屬性 × 8 領域),並提出 symbolic vs. neural 兩種自動合成範式;Martin Monperrus 的 position paper 則直接宣告:coding agent 已達門檻,人工 code review 可以退場了。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-08

今天三篇分別對應 agent 平台堆疊的三個層次:AgentJet(訓練層)提出讓多個異質 LLM 同步做強化學習訓練的分散式框架,解決現有工具只能單模型訓練的根本痛點;AdaPlanBench(評測層)用 67.75% 的成績上限揭示 LLM agent 在「規則邊走邊揭露」的現實場景中遠未成熟,是第一個系統量化這種適應性規劃能力的 benchmark;Beyond Tokens(通訊層)整理了 multi-agent 系統改用「傳 embedding 而非傳文字」的研究現狀,提供分類框架評估這條新通訊路徑的工程取捨。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-01

今天三篇論文聚焦「agent 規模化部署的成本-能力邊界」:SR²AM 重新設計規劃架構,讓 30B 模型少用九成 token 就能競爭 685B-1T 系統;GroupMemBench 揭示現有記憶系統在多人群組對話中徹底崩潰(最強系統只有 46% 準確率,1990 年代的 BM25 關鍵字搜尋反而打贏它);AgentFloor 用 16,542 次測試確認,agent pipeline 大量的短程 tool use 根本不需要大模型。共同主軸:在算力成本壓力下,精確判斷「哪個環節需要多少智慧」已成為 agent 平台設計的核心課題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-30

今天三篇分別從「設計語言」、「安全地圖」、「認知侷限」三個面向挑戰 AI Agent 實務:第一篇建立雙軸分類框架,讓工程師和研究者有共同語言溝通 agent 架構的設計取捨;第二篇系統整理 agentic AI 在工具呼叫、記憶體、多步驟執行中的安全與隱私風險全景;第三篇最具衝擊——用近 4 萬個 AI 生成想法的大規模實驗揭示,AI 研究 agent 傾向圍著舊文獻打轉而非真正拓寬科學探索。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-25

今天三篇圍繞 2026 年 agent 平台最迫切的問題:**多代理系統的安全規範,在執行過程中能維持住嗎?** 2605.10481 命名了一個新失效模式——「約束漂移」(constraint drift):系統設計時寫好的安全限制,會在代理人傳遞、記憶讀寫、工具呼叫過程中悄悄弱化,到輸出端時早已走樣。2605.07728(SARC)提出架構解法:把規範編譯成四個可執行卡關點,嵌進代理人執行迴圈,不再依賴 prompt 提醒,已開源。2605.13851 則用心理學實驗發現:當多代理系統的協調者是「隱形的」,整個系統的保護性行為會顯著下降——這對主流 orchestrator-based 架