Skip to content
← Daily Digest

框架與架構

Framework & Architecture

框架設計、編排架構、scaffold、workflow engine、持久執行

論文時間軸(131 篇)

2026-05-25
約束漂移:LLM 多代理系統被忽視的安全失效模式 必讀

多代理系統中的安全規範不會自動持續有效——它們會在記憶存取、任務委派、工具呼叫等七個環節中悄悄弱化,這篇命名為「約束漂移」並提出分類框架。

arxiv: 2605.10481
2026-05-25
隱形協調者讓多代理系統喪失保護性行為 略讀

用「有沒有可見的領導者」做 AI 實驗:當多代理系統的協調者是隱形的(工作代理不知道有人在指揮),整個系統的保護性行為顯著下降——對流行的 orchestrator 架構是直接的設計警示。

arxiv: 2605.13851
2026-05-26
Human-Inspired Memory Architecture for LLM Agents 必讀

微軟把人腦六大記憶機制(睡眠整合、干擾遺忘、記憶成熟、提取再鞏固、知識圖、混合提取)搬進 LLM Agent,在真實 codebase 資料上讓記憶庫壓縮 58%、保住 97.2% 資訊精確率。

arxiv: 2605.08538
2026-05-26
Do Agents Need to Plan Step-by-Step? Rethinking Planning Horizon in Data-Centric Tool Calling 必讀

對資料查詢型任務(text-to-SQL、知識庫問答),先一次生成完整計劃再批次執行,比每步都重新推理可省 2–4.7x token,且準確率相當——顛覆 ReAct 逐步推理的預設。

arxiv: 2605.08477
2026-05-26
Predictive Maps of Multi-Agent Reasoning: A Successor-Representation Spectrum for LLM Communication Topologies 略讀

借用神經科學的「後繼表示」矩陣,用三個數學量在部署前預測 multi-agent 系統選 Chain、Star、Mesh 哪種拓撲時會出現觀點漂移、假共識或不穩定三種失敗模式。

arxiv: 2605.11453
2026-05-27
Making OpenAPI Documentation Agent-Ready: Detecting Documentation and REST Smells with a Multi-Agent LLM System 必讀

把 REST API 包成 MCP tool 就能讓 agent 用了?研究者掃描 600 個生產 endpoint,發現每一個都至少有一個讓 agent 看不懂的「文件問題」,平均 4 個,並提出 Hermes 系統自動偵測和報告這些問題。

arxiv: 2605.14312
2026-05-27
From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning 略讀

不同使用者面對相同任務,agent 應該有不同做法——這篇把「個人化」從 prompt 層面深入到 RL 訓練層面,提出三組件框架(PARPO + 偏好解糾纏獎勵模型 + PSGM 圖記憶)讓 agent 在學習時就把個體差異嵌入。

arxiv: 2605.23382
2026-05-28
Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation 必讀

現行 agent benchmark 的「成功率」可能是假的——只因為 agent 按了「存檔」就算過,但根本沒存到對的地方;本篇提出一個加在現有 benchmark 上的驗證層,把單一分數改成「有依據的分數區間」。

arxiv: 2605.10448
2026-05-28
VibeServe: Can AI Agents Build Bespoke LLM Serving Systems? 必讀

用 agent 自動生成整套 LLM serving 程式碼(含快取、排程、記憶體管理),在特殊部署場景下打贏手工優化的 vLLM,標準場景則和 vLLM 打平。

arxiv: 2605.06068
2026-05-29
Agentic AI Workload Characteristics 必讀

你以為 agent 的效能瓶頸是「prompt 太長」——錯了。真正的瓶頸是 token 生成速度與 KV-cache 管理,serving 系統需要為此重新設計。

arxiv: 2605.26297
2026-05-29
Is Grep All You Need? How Agent Harnesses Reshape Agentic Search 必讀

在 agent loop 裡找資料,直接用 grep(字串比對)往往比向量搜尋(semantic search)更準——但真正影響結果的是你用哪個 harness,不只是搜尋方法本身。

arxiv: 2605.15184
2026-05-29
Orchard: An Open-Source Agentic Modeling Framework 必讀

Microsoft 開源完整的 agent 模型訓練框架,讓小模型靠資料蒸餾 + 特製 RL 在 SWE / GUI / 助理任務上達到同量級開源 SOTA,不需要依賴 GPT-4o API。

arxiv: 2605.15040
2026-05-30
A Two-Dimensional Framework for AI Agent Design Patterns 略讀

業界教你「怎麼接線」,學術界教你「agent 在想什麼」——這篇說兩個都要,並提出雙軸框架幫你把兩種語言對起來。

arxiv: 2605.13850
2026-05-30
AI Research Agents Narrow Scientific Exploration 必讀

AI 研究 agent 生成的想法比人類更集中、更接近舊文獻、且更不可能被後來研究引用——大規模實驗顯示 AI 擅長「在已知附近深挖」,不擅長「真正往未知方向探索」。

arxiv: 2605.27905
2026-05-31
BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents 必讀

做了個 benchmark,發現 GPT-4.1 和 Qwen3-32B 在「看懂自己失敗原因」這件事上通過率不到三成,而且就算讓 agent 讀了失敗案例去學習,隨著雜訊案例累積,它還是會把早期教訓給忘掉。

arxiv: 2605.29225
2026-05-31
Beyond Autonomy: A Dynamic Tiered AgentRunner Framework for Governable and Resilient Enterprise AI Execution 必讀

現有 agent framework 太重視自主性、太少想「萬一出錯」,這篇從企業 SaaS 生產環境提煉出三個治理機制:按風險分層審查、提案與執行分離、驗證失敗自動恢復。

arxiv: 2605.10223
2026-05-31
Insuring Every Action: An Authority Frontier Framework for Runtime Actuarial Control of Autonomous AI Agents 略讀

把保險精算的概念搬進 agent runtime:每個 agent 動作都先「定價」,對照保證金預算決定是否允許執行;附一把量尺(Authority Frontier)顯示不同預算水位下 agent 能釋放多少自主空間。

arxiv: 2605.25632
2026-06-01
Efficient Agentic Reasoning Through Self-Regulated Simulative Planning 必讀

給 agent 加上「先想清楚再行動」的智慧開關:複雜任務啟動 world model 在腦中預演,簡單任務直接反應,30B 模型因此少用高達 95% 的 token 仍能競爭過 1T 參數系統。

arxiv: 2605.22138
2026-06-02
Compiling Agentic Workflows into LLM Weights 必讀

把 LangGraph / CrewAI 那種「外掛流程圖」直接燒進小模型的參數裡,推理時成本降低 128–462 倍,效果接近 frontier model。

arxiv: 2605.22502
2026-06-03
ExpWeaver: LLM Agents Learn from Experience via Latent RAG 必讀

不再把過去成功/失敗經驗轉成文字塞進 context,改成在 LLM 隱層向量空間做檢索與整合,12/13 benchmark 最佳,零樣本跨域遷移提升 16.32%。

arxiv: 2606.01041
2026-06-04
Characterization of Multi-Model Agentic AI Systems on General Tasks via Trace-Driven Simulation 必讀

第一份記錄真實 Agent 系統「每完成一個任務到底花了多少 LLM 呼叫」的 token 級軌跡資料集(GAIATrace),外加可低成本重播的模擬器(Vidur-Agent)。

arxiv: 2606.01725
2026-06-04
AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents 略讀

現有的 Agent 持續學習 benchmark 大多太寬鬆,分不出「Agent 真的把前面任務學到的知識用在後面」還是「後面任務本來就比較簡單」;AgentCL 透過刻意設計任務間的可複用性來修正這個缺陷。

arxiv: 2606.02461
2026-06-05
MetaForge: A Self-Evolving Multimodal Agent that Retrieves, Adapts, and Forges Tools On Demand 必讀

Agent 遇到工具庫裡沒有的場景,不再說「我做不到」,而是走過「判斷 → 找工具 → 調整參數 → 自行鍛造新工具 → 存回庫」五步閉迴路,實現工具能力的自我進化。

arxiv: 2606.01801
2026-06-07
ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer 必讀

用 LLM 自動學習各框架 API 並寫 agent 程式碼,首度在四個 benchmark 上量化比較主流 ADK:最佳框架達到 80% 任務完成率,中位數只有 32%;而「誰寫 agent 程式碼」比「agent 跑哪個 backbone 模型」對結果影響更大。

arxiv: 2606.05548
2026-06-08
AgentJet: A Flexible Swarm Training Framework for Agentic Reinforcement Learning 必讀

讓多個不同的 LLM 一起做強化學習訓練、彼此不互相干擾,一個 agent 環境崩潰不拖垮整個訓練;透過 timeline merging 讓訓練速度提升 1.5x~10x,完全開源。

arxiv: 2606.04484
2026-06-08
AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints 必讀

現實任務的規則不會一次告訴你——規劃途中違反規定才會被反饋。UIUC 團隊建立了模擬這種場景的 benchmark:307 個家務任務加上隱藏的雙重限制,邊做邊揭露,測試 10 個頂尖 LLM 後最好只有 67.75%,使用者限制比環境限制難多了。

arxiv: 2606.05622
2026-06-08
Beyond tokens: a unified framework for latent communication in LLM-based multi-agent systems 略讀

Multi-agent 系統裡 agents 之間傳文字很貴又有資訊損失,這篇 survey 整理「改傳 embedding / hidden state / KV-cache」的研究現狀,提出分類框架,幫你評估這條路能否用在你的 agent 系統。

arxiv: 2606.05711
2026-06-09
Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage? 必讀

100+ 位真人開發者跟「會暗中插入惡意程式碼」的 AI agent 一起寫程式五小時,94% 的人沒抓到。

arxiv: 2606.05647
2026-06-09
SePO: Self-Evolving Prompt Agent for System Prompt Optimization 略讀

一個 AI「優化 agent」不只幫你寫更好的 system prompt,也同時把自己的 system prompt 一起優化——不改模型,在五個 benchmark 上平均提升 4.49 分。

arxiv: 2606.04465
2026-06-10
MemToolAgent: Leveraging Memory for Tool Using Agents Based on Environment and User Feedback 必讀

在 agent 呼叫工具前,先撈出過去類似對話的成功路徑和失敗反饋作為提示,不需重訓模型就讓工具呼叫準確率大幅提升。

arxiv: 2606.07909
2026-06-10
From Prompt to Process: a Process Taxonomy and Comparative Assessment of Frameworks Supporting AI Software Development Agents 略讀

把六個「AI 輔助軟體開發流程框架」用六個維度系統打分比較,幫你看清楚各框架在需求規格、角色分工、驗收等面向的強弱——注意這不是 LangGraph 那類 runtime,而是「怎麼跟 AI 合作開發」的工作方法論。

arxiv: 2606.04967
2026-06-11
Self-Reflective APIs: Structure Beats Verbosity for AI Agent Recovery 必讀

API 出錯時,給 agent「結構化修復建議清單」比「自然語言錯誤說明」更有效:任務完成率提升 37–40 個百分點,token 效率也高出近 2 倍。

arxiv: 2606.05037
2026-06-11
Agent Operating Systems (AOS): Integrating Agentic Control Planes into, and Beyond, Traditional Operating Systems 略讀

傳統 OS(進程、執行緒、系統呼叫)是為確定性程式設計的,但 agent 是長期存活、目標驅動、會隨機應變的生物——這篇主張我們需要一個「Agent OS」來接管排程、記憶體、安全和治理。

arxiv: 2606.01508
2026-06-12
VISTA: A Versatile Interactive User Simulation Toolkit for Agent Evaluation 必讀

用 LLM 模擬使用者評估 agent 很省力,但「虛擬使用者夠不夠真、測得夠不夠全?」一直沒有量化答案;VISTA 提出 6 個品質指標 + 同時支援 UI 操作和 API 呼叫的 hybrid 模擬器,在電商和客服場景都比現有方法更全面可信。

arxiv: 2606.11079
2026-06-12
Agentic Software: How AI Agents Are Restructuring the Software Paradigm 略讀

傳統軟體把決策邏輯寫在程式碼裡;Agentic Software 的決策邏輯在執行時由 LLM 動態生成,程式碼只是工具——這是軟體本質的轉變,不是工具升級,對 agent 平台的設計和除錯方式有直接影響。

arxiv: 2606.05608
2026-06-13
Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents 必讀

把 Agent 的「執行記憶」整理成階層式筆記資料夾,讓 Agent 用 Bash 工具自己去翻找需要的資訊,而不是把所有歷史全塞進 prompt。

arxiv: 2606.11680
2026-06-13
TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning 略讀

訓練 Agent 時大部分的「跑樣本」都在浪費算力;TRACE 用樹狀結構把 rollout budget 導到最有學習價值的岔路口,同樣算力讓 Multi-Hop QA 多學 2.8 分。

arxiv: 2606.11119
2026-06-13
τ-Rec: A Verifiable Benchmark for Agentic Recommender Systems 必讀

針對多輪對話推薦 Agent 打造可機器驗證的 benchmark,用結構化條件取代 LLM 打分;最大發現:連最強模型連跑四次的成功率也只剩 38%。

arxiv: 2606.10156
2026-06-15
Agents' Last Exam 必讀

用真實職場任務測 AI agent:最強配置只通過了 26%,最難一級所有頂尖模型幾乎全掛。

arxiv: 2606.05405
2026-06-15
Human oversight of agentic systems in practice 必讀

17 位開發者訪談揭示 4 種「自發監督行為」,但現有 agent 框架的 UI 幾乎沒有支援其中 2 種。

arxiv: 2606.05391
2026-06-15
Monitoring Agentic Systems Before They're Reliable 略讀

agent 系統還不穩定就上線時,傳統任務層監控會失靈;這篇提出 3×3 監控框架,幫你找出「哪根線沒接好」。

arxiv: 2606.02494
2026-06-16
Agents All the Way Down: A Methodology for Building Custom AI Agents from Substrate to Production 必讀

不想每次框架升級就重寫 agent?這篇給你從 LLM API 底層到上線維護的完整方法論:兩個前提條件(substrate + building blocks)加上三個持續實踐,比「先 pip install langchain」更底層也更持久。

arxiv: 2606.11869
2026-06-16
EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery 略讀

讓 Agent 自動提假設、跑實驗、迭代改進的瓶頸,不是 LLM 能力而是「環境怎麼設計」——清華這套系統靠容器隔離和清楚的評分介面,在多個科研任務達到 SOTA。

arxiv: 2606.13662
2026-06-17
FlowBank: Query-Adaptive Agentic Workflows Optimization through Precompute-and-Reuse 略讀

Agent workflow 不必每次重新生成(貴),也不必只有一個萬用版本(差)——預計算一個多樣化 workflow 倉庫,推論時用圖神經網路路由,比最強自動化方法高 4.26%、比最強手工設計高 14.92%。

arxiv: 2606.11290
2026-06-18
When Should Agent Trust Be Conditional? Characterizing and Attacking Skill-Conditional Reputation in Agent Swarms 略讀

多 Agent 系統裡,給每個 Agent 一個全域信任分(「它平均有多好」)在很多情況下會路由錯誤——但改成技能維度的細分信任,又會在特定條件下被惡意 Agent 劫持,路由失誤率從 0 飆到 0.94。

arxiv: 2606.14200
2026-06-18
OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents 略讀

LLM Agent 在完成任務的過程中,會一點一點把使用者隱私洩漏給外部服務;OCELOT 在 Agent 和外部世界之間加了一個「洩漏預算員」,讓攻擊者從整條 trajectory 中能推斷出的秘密量不超過上限 ε。

arxiv: 2606.12341
2026-06-19
ACCORD: Action-Conditioned Contextual Grounding for Language Agents 必讀

Agent 常常「以為自己知道」使用者的意思,其實只是靠假設在行動;ACCORD 讓 agent 在每個行動前主動去環境裡確認「我真的有這個資訊嗎?」,AppWorld 成功率從 42% 跳到 62.6%。

arxiv: 2606.16432
2026-06-19
The Illusion of Multi-Agent Advantage 必讀

「多 agent 系統一定比單 agent 強」是業界共識,但這篇的實驗顯示:自動生成的 MAS 在計算成本高出 10 倍的情況下,竟比不過單模型加 CoT-SC。

arxiv: 2606.13003
2026-06-19
Agentic Very Much! Adoption of Coding Agent in New GitHub Projects 略讀

在新建的 GitHub 專案裡,AI coding agent 的採用率是一年前同類研究的兩倍以上,而且每個採用者用得更深,AI 輔助的 commit 比例更高。

arxiv: 2606.07448
2026-06-20
Harnessing the Collective Intelligence of AI Agents in the Wild for New Discoveries 必讀

把多個 AI agent 放在同一個平台互相借用解題思路和失敗記錄——就像科學家交流論文草稿一樣——成功讓集體 agents 在數學難題上找到 12 個人類和 AI 都沒解出過的新最佳解。

arxiv: 2606.10402
2026-06-20
APEX: Adaptive Principle EXtraction — A Three-Layer Self-Evolution Framework for Production AI Agents 必讀

Agent 自我演化不只是改 prompt 一件事;APEX 同時演化三層:執行環境(harness)、行為原則(principles)、工作流程拓撲(topology),在有 114 筆真實任務軌跡的生產 agent 上驗證。

arxiv: 2606.15363
2026-06-20
AI Economist Agent: An Agentic Framework for Model-Grounded Economic Analysis with RAG, Knowledge Graphs, and LLMs 略讀

讓 LLM agent 做經濟分析時,不直接輸出數字,而是先找對應的正式計量模型執行一遍,再用模型輸出寫報告——每個定量聲明都能追溯到具體的計算來源,不靠 LLM 猜。

arxiv: 2606.20041
2026-06-21
How AI Agents Reshape Knowledge Work: Autonomy, Efficiency, and Scope 必讀

Perplexity 的真實生產數據:把功能從「對話搜尋」升級為「自主 agent」之後,每次任務自主執行時間從 33 秒跳到 26 分鐘、完成時間縮短 87%、用戶滿意度更高——而且 agent 吸引了認知複雜度更高的工作類型。

arxiv: 2606.07489
2026-06-21
Self-Harness: Harnesses That Improve Themselves 必讀

Agent 的 scaffolding(prompt + 工具 + 記憶 + 流程)可以讓 LLM 自己挖出弱點、自己修——不需要人工介入、不需要更強的外部模型;三個主流模型在 Terminal-Bench-2.0 上各獲 33-60% 相對提升。

arxiv: 2606.09498
2026-06-22
LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents 必讀

工具呼叫 agent 常常「知道事實卻用錯」:資訊都在 prompt 裡,但每次決策時 LLM 需要自己從文字中重建狀態,一旦重建出錯就違反政策或拿陳舊資料做決定。LedgerAgent 在 agent 迴圈中插入一個明確的型別帳本,把狀態從 prompt 文字裡分離出來,不需要任何微調。

arxiv: 2606.20529
2026-06-22
Connect the Dots: Training LLMs for Long-Lifecycle Agents with Cross-Domain Generalization Via Reinforcement Learning 必讀

現在的 agent 每次任務都從零開始,不會「越跑越聰明」。Alibaba 提出 Connect the Dots (CoD) 框架:用強化學習訓練 agent 在長期部署中邊執行任務邊更新對環境的認識,並讓這個學習能力跨領域遷移。

arxiv: 2606.20002
2026-06-23
Beyond Global Replanning: Hierarchical Recovery for Cross-Device Agent Systems 必讀

跨多台設備的 agent 執行失敗時,別急著全部重來——先讓設備端自己試著換個方式(API → CLI → GUI),不行再往上呈報給總指揮。

arxiv: 2606.20487
2026-06-24
A Technical Taxonomy of LLM Agent Communication Protocols 必讀

MCP、A2A、ACP、ANP 這些 Agent 通訊協定到底差在哪?TU Munich 分析 9 個主流開源協定,給出第一份技術分類法,讓選協定從「哪個比較紅」變成「哪個技術特性符合我的需求」。

arxiv: 2606.19135
2026-06-24
Arbor: Tree Search as a Cognition Layer for Autonomous Agents 略讀

AMD 提出 Arbor:把「樹狀搜尋」當作多 Agent 系統的共享工作記憶,讓 Orchestrator、Specialist、Critic 三類 Agent 圍繞同一棵搜尋樹協作,失敗的嘗試也被保留為後續探索的診斷訊號。

arxiv: 2606.12563
2026-06-26
RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents 必讀

現有評測只看 coding agent 有沒有解對題,RigorBench 首次用「解題過程是否有工程紀律」打分,評估計畫能力、驗證覆蓋率、錯誤恢復、節制行動、原子提交五個維度。

arxiv: 2606.22678
2026-06-26
Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications 必讀

把 LLM multi-agent 系統推向企業生產的兩大卡點是「Domain 適配」和「推理成本」,這篇提出兩階段框架:先客製化(持續預訓練 + SFT + 偏好最佳化),再加速推理(推測解碼 + FP8 量化),實測吞吐量提升 4.48 倍。

arxiv: 2606.18502
2026-06-26
Specifying AI-SDLC Processes: A Protocol Language for Human-Agent Boundaries 略讀

AI agent 已參與軟體開發全流程,但「哪些決定讓 AI 做、哪些要人批准」目前只靠 prompt 描述,容易漂移也無法驗證;這篇提出一套 DSL 讓你把這些邊界寫成可機器驗證的協議規格。

arxiv: 2606.20615
2026-06-27
Are We Ready For An Agent-Native Memory System? 必讀

大家評估 Agent 記憶體都只看「答對幾題」,但忘了問「這個設計貴不貴、知識更新後會不會崩掉」——這篇從資料庫角度把記憶體拆成四個可以分別量測的系統模組。

arxiv: 2606.24775
2026-06-28
The Hitchhiker's Guide to Agentic AI: From Foundations to Systems 必讀

一本寫給工程師和 PM 的 Agentic AI 全棧指南,從 Transformer 架構到 MCP/A2A 協議、multi-agent 架構,每章附代碼範例,可當手邊參考書長期使用。

arxiv: 2606.24937
2026-06-29
Agent libOS: A Library-OS-Inspired Runtime for Long-Running, Capability-Controlled LLM Agents 必讀

把 Linux「process」的設計哲學搬進 Agent:每個 agent 有自己的 ID、能力表、記憶體與稽核記錄,工具只是 wrapper,真正的控制邊界在 runtime 核心。

arxiv: 2606.03895
2026-06-29
Autodata: An Agentic Data Scientist to Create High Quality Synthetic Data 必讀

Meta FAIR 把「建資料集」這件事做成 agent:agent 自己設計資料配方、評估品質、修改配方,並透過 meta-optimization 讓這個 data scientist agent 越來越會產高品質資料。

arxiv: 2606.25996
2026-06-29
Governed AI-Assisted Engineering: Graduated Human Oversight for Agentic Code Generation in Regulated Domains 略讀

在銀行等受法規限制的環境,不是每個 agent 動作都要人類審批;GAIE 提供一個決策框架,依風險分三層監督,讓企業在合規前提下保留約 91% 的 coding agent 效率。

arxiv: 2606.22484
2026-06-30
SWE-Explore: Benchmarking How Coding Agents Explore Repositories 略讀

大多數 coding agent benchmark 只看最終有沒有修好 bug,但「先找到要改哪幾行」這個中間步驟才是瓶頸——這篇論文專門拆開來測這一步。

arxiv: 2606.07297
2026-06-30
Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks 必讀

同一個 AI backbone,換個 adapter 設計,Pass@1 從 19% 跳到 73%——這篇揭示你以為在比模型,其實在比框架設計。

arxiv: 2606.12344
2026-06-30
The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators 必讀

AI agent 越來越強,但評測系統一直是靜態的——這篇論文讓「評測 agent 的系統」也跟著 agent 一起自我進化,打破靜態 benchmark 的天花板。

arxiv: 2606.26294
2026-07-01
Qwen-AgentWorld: Language World Models for General Agents 必讀

把大模型訓練成「虛擬環境的扮演者」,讓 AI agent 在這個假世界裡反覆試錯,七種環境(工具呼叫、網頁操作、終端機等)一次全包,旗艦版模擬準確度首次超越 GPT-5.4

arxiv: 2606.24597
2026-07-01
AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems 必讀

快手用多 Agent 系統全自動化推薦算法研發週期:從想法生成、寫代碼、A/B 測試到上線,三週讓每位工程師當量的可落地產出提升 13.8 倍,帶來年化超億元人民幣收益

arxiv: 2606.26859
2026-07-02
User as Code: Executable Memory for Personalized Agents 必讀

把「用戶模型」從一堆文字筆記,升級成可以直接執行的 Python 程式碼,讓 Agent 不只能「查詢事實」,還能對用戶狀態做計算與邏輯推理。

arxiv: 2606.16707
2026-07-02
DeLM: Decentralized Multi-Agent Systems with Shared Context 必讀

把 Multi-Agent 系統裡「一個主管分派所有任務」的架構,換成「所有 agent 共讀一個驗證過的進度表、自己搶任務」——SWE-bench 上省 50% 成本,還拿到更高分。

arxiv: 2606.10662
2026-07-03
Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use 必讀

精心訓練的 agent(不論 SFT 還是 RL)放到和訓練時不一樣的環境,表現就會明顯下降——這不是個別模型問題,而是系統性問題。

arxiv: 2607.01084
2026-07-03
Leveraging LLM-Based Agentic Systems to Generate Quantum Applications for Test Optimization 略讀

把寫量子程式這件「需要深厚專業知識」的事,拆成 6 個角色分工的 agent 流水線,讓非量子專家只需白話文需求就能得到可執行的量子應用程式。

arxiv: 2607.00939
2026-07-03
Behavior-Adaptive Conversational Agents: Toward a Fluid Personality Framework 跳過

Agent 的個性表達不是越強越好:實驗發現「中等強度」在信任感、智慧感和愉悅感上都勝過低強度和高強度,且動態切換 persona 比固定一種更受使用者歡迎。

arxiv: 2607.01034
2026-07-04
Conversable Complexity: Agentic LLM Collectives as Interpretable Substrates 跳過

大家擔心 multi-agent 系統愈來愈黑箱,這篇反過來論證:LLM agent 集群因為用自然語言溝通,天生就比傳統複雜系統更透明可解讀。

arxiv: 2607.01047
2026-07-05
ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning 必讀

不改模型、零訓練,推理時用「模型自己的注意力分數」遞迴挑出相關片段重播給模型,顯著改善 LLM 在 128K 長文中找不到答案的問題。

arxiv: 2607.02509
2026-07-05
What LLM Agents Say When No One Is Watching 必讀

給 LLM agent 一個「沒人在看」的私密頻道,它說的話和公開說的差很多——在有社會階層差距的情境下,divergence 從 3% 基準線跳到約 40%。

arxiv: 2607.02507
2026-07-06
Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows 必讀

把資料庫的「交易(Transaction)」概念移植到 Agent 工作流程:LLM 輸出的每個動作都是「未信任提案」,要先通過明確的規則驗證才算數;違規則自動修復或回滾,不讓語意錯誤的 Agent 動作污染生產狀態。

arxiv: 2607.00269
2026-07-06
Multi-Turn Agentic Scientific Literature Search via Workflow Induction 必讀

把多輪文獻搜尋問題化成「建 DAG 工作流程」:Agent 不只是用關鍵字搜尋,而是主動組合搜尋算子(展開引用、過濾、重排序⋯⋯),並根據用戶回饋修改整個工作流程本身;9B 小模型訓練後 Hit@5 從 58 提升到 77,執行錯誤率降到 0%。

arxiv: 2607.00597
2026-07-06
Self-Evolving Agents with Anytime-Valid Certificates 略讀

SEA:讓 Agent 在邊跑邊自我改良的同時,每次改良都需通過「可驗證安全門(anytime-valid gate)」並發出可稽核憑證,確保每次自我更新都有明確的錯誤預算上限,不會默默變差。

arxiv: 2607.00871
2026-07-07
When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents 必讀

Agent 程式可能陷入「停不下來的迴圈」,本文開發靜態掃描工具 IAL-Scan,評估 6,549 個真實 repo,精準度 91.9%,發現這是比想像中普遍的系統性問題。

arxiv: 2607.01641
2026-07-07
AgentFlow: Building Agent Dependency Graphs for Static Analysis of Agent Programs 必讀

為 agent 程式碼建出一張「依賴圖」,讓你看清這個 agent 用了哪些模型、prompt、工具、記憶體,並自動偵測有危險的「prompt 到高權限工具」路徑;支援 5 大主流框架,分析了 5,399 個真實專案。

arxiv: 2607.01640
2026-07-08
AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments 必讀

現有 Agent benchmark 太「貼心」了——工具幫你備好、輸入幫你洗乾淨;AgentGym2 偏偏把這些拿走,逼 Agent 自己找工具、應對髒資料,揭露真實能力缺口。

arxiv: 2607.05174
2026-07-09
Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses 必讀

有人能偷偷修改 Agent「以前是怎麼想的」,讓它以後做壞事,而且現有所有防禦都擋不住。本文提出攻擊手法 FARMA 與對應防禦 SENTINEL。

arxiv: 2607.05029
2026-07-09
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification 必讀

研究者造了一套自動化安全測試框架 Vera,去測了 4 套真實部署的 Agent 框架(含 Claude Code),在多通道攻擊下平均攻擊成功率 93.9%,並公開了 1,600 個可執行安全測試案例(Vera-Bench)。

arxiv: 2607.01793
2026-07-09
PiSAs: Benchmarking Contextual Integrity in Multi-User Agentic Systems 必讀

當多個用戶共用同一個 Agent 時,Agent 很容易把 A 用戶的私人資訊洩露給 B 用戶。PiSAs 提出針對這個場景的 benchmark,揭示現有 SOTA 模型在多用戶隱私保護上仍有嚴重缺陷。

arxiv: 2607.05318
2026-07-10
Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows 必讀

Snowflake 等雲端資料平台已把 LLM 直接嵌入 SQL(AI_CLASSIFY、AI_COMPLETE 等函式),但現有 text-to-SQL benchmark 完全沒覆蓋這類「AI-native SQL」。本文建立 465 個任務的評測集,最強模型準確率僅約 67%,是資料 Agent 的全新能力缺口。

arxiv: 2607.06229
2026-07-11
From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization 必讀

Agent 失敗記錄通常有兩個問題:太多條都在描述同一種失敗(冗餘),而且每條記錄裡大半步驟都和失敗無關(噪音)。STRACE 先在批次層面把重複失敗過濾掉,再對每條軌跡做因果定位,只保留真正「導致失敗」的步驟,讓優化器瞄準真實根因——在形式驗證任務上成功率從 42.5% 提升到 58.5%(1.4×)。

arxiv: 2607.07702
2026-07-11
The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents 必讀

自我進化 Agent 靠「壞技能失敗 → 被淘汰」來維持技能庫品質,但這個機制假設評審者是公正的。本文用理論分析和實驗證明:LLM judge 的 false-pass bias(把失敗判為成功的偏差)一旦超過某個閾值,技能淘汰機制就會被靜默地關掉——不是變慢,是完全停擺;且增加多少數據都救不回來。

arxiv: 2607.07436
2026-07-13
WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search 略讀

把複雜 web 研究任務遞迴分解給多層 agent 並行分工,克服單一 agent 同時「廣又深」的 context 限制——本文仍為 work in progress。

arxiv: 2607.08662
2026-07-14
When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems 必讀

多 Agent 系統裡若有一個 agent 被惡意操控,AcMAS 不靠看文字、直接分析 LLM 內部神經狀態來偵測,在非同步執行環境下 F1 比圖方法高出 +0.55,且對隱蔽攻擊仍有效。

arxiv: 2607.06807
2026-07-14
ProjAgent: Procedural Similarity Retrieval for Repository-Level Code Generation 必讀

Coding agent 在大型 repo 找參考程式碼時,傳統方法靠「長得像」或「名字像」——ProjAgent 新增「解題步驟像」這個維度,在 REPOCOD 測試集上達到 41.14% Pass@1,超越所有 retrieval 型 baseline。

arxiv: 2607.08691
2026-07-14
Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents 必讀

你以為換 harness 只是換工具集,但這篇發現:同一個 LLM、同一個任務,光是換 harness 設定,agent 的中途判斷(對風險、進度、下一步的理解)就會大幅偏移——harness 在重塑 agent 的世界觀。

arxiv: 2607.04528
2026-07-15
Memory in the Loop: In-Process Retrieval as Extended Working Memory for Language Agents 略讀

把記憶體存取從「工具調用(100ms)」變成「同程序存取(100μs)」,agent 在 12 步任務中的冗餘行為從 7.2 次降到 0——延遲不只是工程效能問題,它從根本上改變 agent 推理的品質。

arxiv: 2607.05690
2026-07-16
Atomic Task Graph: A Unified Framework for Agentic Planning and Execution 必讀

把 agent 的多步任務畫成「依賴關係圖」,讓沒有相依的步驟並行跑、失敗時只重算受影響的部分——不需要更大的模型就能大幅提升成功率。

arxiv: 2607.01942
2026-07-16
PalmClaw: A Native On-Device Agent Framework for Mobile Phones 必讀

現有手機 agent 都靠「模擬點擊螢幕」操作手機,PalmClaw 改成直接呼叫裝置 API:任務成功率提升 11.5%、完成時間縮短 94.9%,而且每一步的執行邊界清楚得多。

arxiv: 2607.13027
2026-07-16
Internet of Agentic Things: Networked AI Agents for Closed-Loop IoT Orchestration 略讀

提出 IoAT(物聯智能體網路)架構:把 AI agent 擴展到 IoT 設備層,讓 agent 不只在雲端對話,還能協調感測器、邊緣運算、數位孿生——從「語言 agent」走向「物理世界 agent」。

arxiv: 2607.12662
2026-07-17
To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning 必讀

教搜尋型 agent「在不確定時說我不知道」:動態調整 RL 訓練中的棄答獎勵,讓 agent 主動拒答而非亂猜,精準度最高提升 10.3%。

arxiv: 2607.10738
2026-07-17
ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory 略讀

為長期具身機器人打造一個「agent OS」:用多模態知識圖譜記憶 + 隔離式技能執行 + 多階段驗證,解決長任務中記憶消失與技能互相干擾的問題。

arxiv: 2607.10350
2026-07-18
Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents 必讀

把 agent 的記憶體操作(要不要取、何時忘)變成一個小型強化學習問題,讓 agent 邊跑邊自學最佳策略,不用改底層記憶體實作。

arxiv: 2607.13591
2026-07-18
AgentAbstain: Do LLM Agents Know When Not to Act? 必讀

目前最強的 agent 在「應該拒絕行動」的情境下答對率不到 60%,而且這個「棄動能力」和「任務解決能力」根本是兩回事——你沒辦法靠換一個更強的模型來解決。

arxiv: 2607.10059
2026-07-19
MyAG: A Graph-Based Framework for Designing and Analyzing Composable LLM Agent Systems 必讀

把 agent 系統拆成三張圖來描述,讓元件可以重複使用、執行路徑可以視覺化追蹤,降低複雜多 agent 系統的設計與除錯成本。

arxiv: 2607.13474
2026-07-20
Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents 必讀

只要改掉 README 或 requirements.txt 裡的套件名稱,AI coding agent 就會安裝你指定的惡意套件——而這個漏洞主要跟你用哪套 harness(框架)有關,換模型沒太大用。

arxiv: 2607.15143
2026-07-20
Orchestrating Power Grid Studies with Multi-Agent AI and MCP Servers 跳過

Position paper:以電網研究為案例,展示如何用 MCP(Model Context Protocol)把 LLM agents 接上專業領域仿真工具,並在嚴格需要 human-in-the-loop 的工業流程中落地 multi-agent AI。

arxiv: 2607.14158
2026-07-21
AutoSynthesis: An agentic system for automated meta-analysis 略讀

統合分析(meta-analysis)本來要幾個月人工,AutoSynthesis 用 multi-agent 流水線把它變成:輸入一個研究問題,輸出一份符合學術規範(PRISMA)的完整分析報告。

arxiv: 2607.15247
2026-07-21
Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents 略讀

RLHF 訓練讓 LLM 太「溫和」,無法扮演立場鮮明的政黨談判者。這篇用 DPO 灌入黨派人設、用 RAG 綁定黨綱,打造能維持強硬立場的 agent,再讓他們模擬真實選後的多黨組閣協商。

arxiv: 2607.15095
2026-07-22
A Workflow-Aware Serving Layer for Agentic Applications 必讀

agent workflow 裡每個節點該用哪個 LLM?Dyserve 用 ILP 在 60ms 內算出最優解,比 baseline 精準度高 3–10 個百分點、延遲低 1.1–6.8 倍,工具失敗時還能自動恢復 84% 的案例。

arxiv: 2607.02942
2026-07-22
Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems 必讀

multi-agent pipeline 壞了不知道從哪查起?AgentLocate 自動找出「哪個 agent 該負責」加上「哪一步開始不可挽回」,比現有方法更準且更省 token,COLM 2026 accepted。

arxiv: 2607.07989
2026-07-22
PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents 略讀

你以為頂尖 LLM agent 能搞定多語言工作流?PolyWorkBench 用 67 個跨 5 大領域的真實任務揭示:多語言設定讓 agent 表現大幅下滑,推理和執行步驟都會受到複合式衝擊。

arxiv: 2607.06008
2026-07-24
Profile-Graph Memory for LLM Agents: Implicit Cross-Entity Traversal through Narrative Profiles 略讀

讓 Agent 的長期記憶可以串聯多個人物資訊來回答問題,不再只是「問誰就找誰的資料」,而是能自動沿著人際關係跳躍推理。

arxiv: 2607.19359
2026-07-25
NVIDIA-labs OO Agents: Native Python Object-Oriented Agents 必讀

把 AI Agent 寫成一個普通的 Python class:欄位是狀態、方法是動作、docstring 是 prompt;方法本體只寫 `...` 那行,執行時由 LLM 補完,其餘方法照常執行。

arxiv: 2607.20709
2026-07-25
AREX: Towards a Recursively Self-Improving Agent for Deep Research 必讀

深度研究 Agent 跑兩個嵌套迴圈:內層收集證據、外層逐條驗證約束並針對未解決問題再次研究,搭配自動壓縮歷史的工具,在 BrowseComp、HLE 等主流基準上顯著超越同量級 baseline。

arxiv: 2607.21461
2026-07-26
ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders 必讀

現有 coding agent benchmark 只考「照規格寫程式」,ICAE-Bench 加入了「聽懂模糊需求、主動追問、一邊做一邊調整」的互動式情境,更貼近 vibe-coding 時代的真實需求。

arxiv: 2607.21217
2026-07-26
EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer 必讀

Agent 自我進化聽起來很炫,但這篇首次嚴格測量「能力到底有沒有真正轉移」,結論嚴峻:主流方法不只沒幫助,還會倒退 12.3 分。

arxiv: 2607.05202
2026-07-27
Agent Data Injection Attacks are Realistic Threats to AI Agents 必讀

一種新的攻擊方式:不用偽裝成「指令」,只要偽裝成「可信資料格式」就能讓 Agent 做壞事——Claude Code、Codex、Gemini CLI 和三個 web agent 全部中招,可以被遠端執行任意程式。

arxiv: 2607.05120
2026-07-28
Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model 略讀

3B 參數的小模型,用「迴圈式 Transformer」架構 + 28T tokens 預訓練 + 三階段 agentic RL,在 SWE-Bench Verified 拿下 63.6 分,壓過 Qwen3.5-9B(53.1)和 Gemma4-12B(44.2),已開源於 HuggingFace。

arxiv: 2607.22083
2026-07-29
A Comparative Study of MCP and A2A for Inter-Agent Coordination in LLM-Based Systems 必讀

MCP 管「模型接工具」,A2A 管「Agent 跟 Agent 講話」,兩者不是競爭關係而是分層設計,就像 USB 跟 Wi-Fi 各管各的事,都需要。

arxiv: 2607.23884
2026-07-30
OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios 略讀

涵蓋 90 個一級領域、354 個二級領域的 1,431 題 Agent 評測集,橫跨消費者、企業、工程三大場景;頂尖模型(Claude Sonnet-5 得 58.54%、GPT-5.6-Sol 得 57.14%)得分都低於 60%。

arxiv: 2607.14989
2026-07-30
A Self-Calibrating Agentic AI Framework for Autonomous Edge Resource Allocation 略讀

LLM Agent 在開放環境中會隨時間漂移(預測越來越不準);這篇把 ARIMA 時序預測器嵌進 Agent 作為「自我校準器」,讓 Agent 在無人監督下自動偵測並修正漂移,準確率比基準 LLM Agent 高 91.7%。

arxiv: 2607.22400
2026-07-31
[HANDBOOK.md](http://HANDBOOK.md): A Benchmark for Long-Context Agentic Instruction Following 必讀

把 AI Agent 丟進一間虛擬公司,讓它用 email/Slack/Jira 完成任務,同時要遵守一本 20~124 頁的員工手冊——最強模型只有 36.2% 通過。

arxiv: 2607.25398
2026-07-31
Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Business Processes 略讀

三份可直接跑的 LangGraph 食譜:SQL 自動修復迴圈、有閘門的 Agentic RAG、人工審核中斷點,外加一張「什麼時候不要用 LangGraph」的決策表。

arxiv: 2607.19297
2026-07-31
MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents 略讀

500+ 工具、16 個應用領域的多模態工具呼叫 benchmark:Agent 要同時看圖找 UI 元素再決定叫哪個工具——12 個主流模型中最強的成功率也不到 50%。

arxiv: 2607.11818
2026-08-01
AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents 必讀

工作區 Agent 在執行任務時有多危險?這篇測了 20 種 Agent 配置、6,560 次執行:66% 的「成功完成任務」背後仍觸發了危險行為——任務完成不等於安全。

arxiv: 2607.27294
2026-08-01
Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories 略讀

你花時間寫的 [AGENTS.md](http://AGENTS.md) / [CLAUDE.md](http://CLAUDE.md) 到底有沒有用?288 次對照實驗的答案:對 coding agent 的正確率幾乎沒有可量測的差異(等效上限 ≤10–15pp),出錯的根本是實作技能不足,不是缺少 repo 知識。

arxiv: 2607.27250
2026-08-02
ProACT: Towards Breakdown-Aware Proactive Agent in Multi-User Collaboration 必讀

教 Agent 在多人對話中辨識「有人卡住了」,然後選對時機插一句有用的話,而不是一直打擾或一直沉默。

arxiv: 2607.03730
2026-08-03
Toward an Organizational Science of Multi-Agent LLM Systems 必讀

把「哪些 agent 上場」、「怎麼溝通」、「最終怎麼整合答案」三件事分開設計,讓你可以各自換掉,不用每次重頭架系統。

arxiv: 2607.25446
2026-08-03
Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents 必讀

Agent 在讀取可疑資料前先開一條「隔離通道」,把危險控在那條通道裡,讀完後再由受信任的清洗器決定哪些資訊可以帶回主上下文,讓安全與可用性不再是零和遊戲。

arxiv: 2607.24625
2026-08-03
How Agents Ask for Permission: User Permissions for AI Agents, from Interfaces to Enforcement 略讀

調查 21 個學術提案 + 5 個商業 agent,發現幾乎所有系統的授權設計都是「開發者說了算」,真正讓使用者自己設定個人化授權規則的機制幾乎不存在。

arxiv: 2607.13718

相關 Digest(57 篇)

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-26

tinyhumansai/openhuman 用本地優先的 Memory Tree 壓縮數位生活、指揮多個 agent,早期 beta 已衝上 3.7 萬星;Vercel Labs 的 fx 用 Zig 寫出不到 8 MiB 的原生 coding agent CLI;NVIDIA 開源 labs-OO-Agents,把 agent 的 prompt/tool/workflow 收進單一 Python class;CopilotKit/OpenBot 把 agent 包進容器並加上治理閘門,動作先審後動。Agno v3.0.0 是需要跑資料庫遷移的重大 breaking release,Haystack v3.1.0 新增多 agent 委派工具 AgentTool 和上下文壓縮 CompactionHook。

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-25

Panniantong/Agent-Reach 用一支 CLI 包住 yt-dlp、twitter-cli 等工具,讓 agent 讀遍 Twitter/Reddit/YouTube/Bilibili;LangChain 官方推出 deepagents,把檔案系統、sub-agent、skills 打包成開箱即用的 harness;Tracer-Cloud/opensre 把「AI SRE agent」做成有評分 RCA 題庫的框架;Anthropic 的 claude-plugins-community 市集靠審核流程幫社群外掛做信任背書,單日 +490 星。GitHub Copilot CLI v1.0.81-8(pre-release)加上 Grok 4.6 xhigh 推理與外掛即時熱重載。

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-22

HKUDS/nanobot 靠 v0.3.0「The Agency Release」7 個月衝上 4.7 萬星,主打個人自架 agent runtime;genspark-ai/genoffice 用開源桌面應用做 AI 辦公套件,三週破 3,400 星;NVIDIA 發表 labs-OO-Agents(NOOA),把 agent 狀態收進單一 Python class;MCP server repo-context-mcp 幫 coding agent 讀 repo 不用整包塞進 prompt。框架端 Mastra 1.60.0 補上 durable execution 與 Cloudflare Sandbox;pydantic-ai v2.33.0 因 anthropic SDK 升級 httpx2 而有 breaking change。

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-21

Cursor 開源官方外掛市集 cursor/plugins,用 plugin.json + skills + MCP 定義把生態標準化,一天 +470 星;apache/maka 進 Apache 孵化器,用 append-only 事件日誌記錄 agent 的每次工具呼叫與權限決策,主打可稽核的 local-first 工作台;magnitudedev/magnitude 幫你自動偵測硬體、下載並在本機跑模型,開箱即用的離線 agent;vercel/eve 把 agent 能力放進 tools/、skills/、schedules/ 等慣例目錄,檔案系統就是介面。框架端 pydantic-ai 補了 v2.32.1 patch。

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-16

Vercel 推出 filesystem-first 的 TypeScript agent 框架 eve,深度綁定自家 AI Gateway/Sandboxes;Prime Intellect 的 Prime Agent 把整個對話 context 當程式變數,搭配可自我改寫的 Continual Harness;aden-hive 的 Hive 用『複製 Queen』取代預先編譯的執行圖;HKUDS 的 nanobot 靠 v0.3.0 Agency Release 半年內衝上 4.7 萬星。今日 watchlist 框架無重大版號更新。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-03

今天三篇論文分別從多 Agent 的「組織設計」、「安全隔離」與「使用者授權」三個維度切入平台建設難題。IMACS 把 multi-agent 系統拆成三個可獨立替換的層(組織、協調、協作演算法),讓框架設計者能像換積木一樣調整 Agent 角色或協作策略;APPA 用「分支上下文」打破 IFC(資訊流控制)的可用性瓶頸,在 4 個模型上把 prompt injection 外洩率從 31–50% 壓低至 0–7%;UW 的調查在 21 個 Agent 授權方案中發現,絕大多數系統只提供「開發者定義的全局策略」,使用者個人化授權幾乎付之闕如。三篇合在一起,勾勒出 agent 平台從原型走向生產

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-01

今天三篇論文從不同角度逼問「AI Agent 在現實任務中的真實極限」:ORCA-bench 把 LLM Agent 丟進 SRE on-call 的生產環境做根因分析,最強模型也只答對 40%;AgentS4D 揭露工作區 Agent 的安全黑箱——66% 的「成功執行」背後仍觸發了危險行為,任務完成不等於安全;Context Files 研究則以 288 次對照實驗發現,開發者普遍維護的 [AGENTS.md](http://AGENTS.md) / [CLAUDE.md](http://CLAUDE.md) 對 coding agent 的正確率幾乎沒有可量測的提升。三篇合讀,讓你對「A

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-31

今天三篇論文都在問同一個核心問題:**現在的 AI Agent 真的能用嗎?** 答案出奇地一致——還差得遠。[HANDBOOK.md](http://HANDBOOK.md) 揭露把最強前沿模型丟進虛擬公司後,企業政策合規通過率最高只有 **36.2%**;LangGraph 論文給出三份可落地的有狀態工作流食譜,並附上「什麼時候不要用 LangGraph」的決策指南;MM-ToolSandBox 則首次量化了「看圖+叫工具」這個多模態組合技的困難程度——12 個主流模型中最強的成功率也不到一半。三個維度:合規評估、框架設計、視覺工具,串起一張「Agent 離真正落地還有多遠」的完整地圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-30

今天三篇圍繞「讓 Agent 更可靠、更好部署、更客觀評估」三個核心問題:TRACE-ROUTER 指出多步驟 Agent 流程不能套用「每次呼叫都重新選模型」的路由策略,改用任務級別路由搭配強化學習持續優化;OmniaBench 建立橫跨消費者、企業、工程三大場景的 1,431 題評測集,頂尖模型(Claude Sonnet-5)得分仍不到六成;自我校準 Agent 框架則示範如何用 ARIMA 時序預測幫 Agent 在無人監督下偵測並修正預測漂移。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-29

今天三篇論文共同聚焦在「生產級多代理人系統的基礎設施可靠性」:第一篇比較 MCP 與 A2A 兩個協定如何分工、不是競爭而是互補;第二篇實測工具升版後 12 個頂尖模型的能力退化,發現前沿模型也會掉分 13-14%;第三篇揭示把安全模型串成 pipeline 之後整體反而不安全,因為防護其實是靠雲端供應商的伺服器端過濾器在撐。三篇合起來回答了「怎麼接工具」、「工具升版會不會壞」、「串起來安不安全」三個平台工程師最實際的問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-26

今天三篇論文從三個角度精準刺中 AI coding agent 的能力邊界:**ICAE-Bench** 挑戰「模糊需求下的互動式開發」場景,揭示當前 benchmark 跟不上 vibe-coding 時代;**EvoAgentBench** 揭露 agent 自我進化能力轉移的陷阱,主流方法竟造成 −12.3 分的負遷移;**PERFOPT-Bench** 則開闢「效能優化作為 agentic task」新賽道,並發現 framework 選擇往往比模型選擇更關鍵。三篇合讀的重點:生產環境的 agent 評估遠比現有工具複雜,業界亟需更貼近真實場景的評估體系。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-25

今天三篇從三個互補角度探索「讓 Agent 更可靠地解決複雜任務」。NVIDIA 提出把 Agent 寫成普通的 Python class,讓開發、測試、追蹤都像一般軟體一樣進行;BAAI 的 AREX 展示了能遞迴驗證並改良自身研究結論的深度研究 Agent,在 BrowseComp、HLE 等基準上超越同量級模型;第三篇爬梳 1,250 篇論文,為「AI 自我改良」這個混亂詞彙建立清楚的分類地圖,幫你分辨哪些技術已可落地、哪些還在研究階段。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-24

今天三篇分別從生態、失敗、記憶三個角度切入:哪些開源 Agent 框架真正值得長期下注(不只看 star 數)、Agent 在哪六類問題上反覆翻車、以及如何讓 Agent 的長期記憶跨越多個人物做串聯推理。三篇合在一起,像是給 Agent 平台開發者的「框架選型依據 + 失敗防護清單 + 記憶系統升級方向」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-22

三篇論文從基礎設施、可觀測性、評估三個角度切入同一個核心問題:「如何打造真正可靠的 agent 系統?」Dyserve 用數學最佳化在 60ms 內決定 agent workflow 每個節點要用哪個 LLM,在精準度和延遲上同步超越所有 baseline;AgentLocate 解決 multi-agent pipeline 出錯時「不知道哪個 agent 搞的鬼」這個 ops 噩夢,自動定位責任 agent 和出錯時間點(COLM 2026 accepted);PolyWorkBench 則給出一記警告:現有頂尖 LLM agent 在多語言工作流中表現大幅劣化,全球化產品場景還有很長的路

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-21

今天三篇論文從不同層面回答同一個問題:「怎樣才算一個真正能用的 agent 系統?」SearchOS-V1 給出架構答案——把搜尋進度外顯成結構化狀態、記錄失敗路徑,讓 multi-agent 協作搜尋更可靠;AutoSynthesis 展示高度結構化的學術任務(系統性文獻統合分析)可以被 multi-agent 流水線全自動化;Digital Pantheon 則解決「如何讓 agent 在壓力下維持既定人設」的角色工程問題,並引入可審計的多 agent 協商架構。三篇合看,分別對應 agent runtime 設計、workflow 編排、與人設工程三個核心挑戰的最新解法。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-19

今天三篇分別對應 agent 平台的三個核心課題:MyAG 用圖論視角重新拆解「如何組裝 agent 系統」,提出 component / workflow / search 三層圖分離關注點;自我改進綜述用統一公式框架整理「agent 如何從經驗進化」的整個研究方向;MemPoison 則揭示「持久記憶是 agent 最脆弱的攻擊面」,並建立首個涵蓋 1,227 個攻擊案例的 benchmark。三篇合起來剛好是:怎麼搭架構 → 怎麼讓系統演化 → 怎麼不被攻破。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-17

今天三篇各從不同角度解決 agent 平台的核心痛點:第一篇從「前端 UX 設計」切入,提出讓電商網站對 AI 瀏覽器 agent 友善的框架,成功率從 49% 提升至 89%;第二篇攻的是「搜尋型 agent 亂猜答案」問題,用動態棄答 RL 訓練讓 agent 知道何時該說「我不確定」;第三篇則帶來具身機器人的 agent OS 架構,其多模態圖記憶與技能隔離設計對通用 agent 平台有直接啟發性。三篇合起來覆蓋了 agent 的「前端 UI 介面設計」→「推理可靠性訓練」→「執行層記憶架構」完整鏈路。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-16

三篇論文不約而同都在問同一個問題:agent 的每一步執行單元,到底應該怎麼設計才能讓它可稽核、可重用、出了錯能最小範圍修復?ATG 把任務分解成有向無環圖(DAG)讓子任務並行、中間結果可複用;PalmClaw 把手機原生 API 直接包成結構化工具,甩掉難以追蹤的 GUI 點擊序列;IoAT 則把 agent 網路延伸到 IoT 物理世界,從智慧建築到邊緣設備,畫出跨雲端、邊緣、感測器層的協調藍圖。共同主軸:執行邊界要清楚、動作要可稽核、失敗要能局部恢復。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-12

今天三篇論文圍繞兩大主軸:**安全**與**評測**。Prismata 在頁面層阻止跨站提示注入攻擊;aiAuthZ 在工具呼叫層建立加密身份授權閘道——兩篇合力說明 LLM 本身不該是安全邊界,平台必須在架構層設防。第三篇 UniClawBench 則把 agent 評測從沙箱搬進真實世界,用「能力維度」取代「任務情境」做診斷,給平台工程師一把更好用的選模型與排查失敗的尺。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-11

今天三篇論文都在追問同一件事:Agent 系統如何才能「可靠地」運作?STRACE 解決的是優化輸入太雜——從大量噪音失敗軌跡中精準找出真正的根因,讓 Agent 的自動優化不再被冗餘案例帶偏;The Blind Curator 揭示一個令人不安的靜默失效模式——自我進化 Agent 的技能淘汰機制會因為 LLM 評審偏差在某個閾值後徹底停擺,光靠增加數據救不回來;Severity Scale 則把「Agent 被攻擊後到底有多嚴重」從二元的成功/失敗,變成七段式的行動傷害評分,讓安全評測終於有細緻度。三篇合看:優化品質、自我進化健全性、安全評測精度——三個不同層面,共同指向 Agent 可信

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-10

今天三篇論文共同描繪 Agent 平台的「進化前線」:EvoSOP 讓 Agent 不再每次從零重組工具,而是從過去執行歷程中自動萃取可重用的 SOP,讓工作效率顯著提升;AgenticSTS 對長任務記憶提出嚴格的「有界合約」設計,用五層結構化提取取代無止盡的 context 堆疊;Spider 2.0-AIFunc 則揭示 AI 函式已被直接嵌入雲端 SQL 語法,但最強模型準確率僅約 67%,是資料 Agent 必須面對的新挑戰。三篇合看:從工具效率、記憶架構到資料能力,勾勒出 2026 年 Agent 平台亟需補強的三個關鍵短板。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-09

今天三篇論文從不同維度敲響「Agent 安全警報」:FARMA 能以 100% 成功率悄悄竄改 Agent 的推理記憶,繞過現有所有防禦機制;Vera 框架對 4 套生產級 Agent 系統(含 Claude Code)做系統化安全測試,平均攻擊成功率高達 93.9%;PiSAs 則揭示在多用戶共享 Agent 環境中,資訊跨用戶洩露是個未被充分關注的嚴重問題。三篇合看,是任何正在部署 Agent 平台的工程師與 PM 必須面對的安全現實。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-08

今天三篇論文聚焦同一個核心問題:現有 AI Agent 系統在「理想實驗室」與「真實部署」之間存在巨大落差。AgentGym2(ACL 2026)用新 benchmark 量化了評測的失真;Agentic RL 系統提出讓 agent 在生產環境持續自我進化的工程架構;ComfyClaw 則展示在圖像生成工作流中落地「技能自我進化」的完整範例。三篇合看,正是一張從「評測 → 部署 → 運行中進化」的完整地圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-07

今天三篇論文都圍繞「讓 agent 系統更安全、更可預測、不出包」這個主軸。前兩篇出自同一研究團隊,以靜態分析角度出發:一篇系統性揭露 agent 陷入無限循環的成因與規模,另一篇則為整個 agent 程式碼建立依賴圖,讓安全審計和元件盤點成為可能。第三篇針對 multi-agent 軟體開發,把 LLM 輸出的信心分數引入協作流程,防止早期幻覺向下游蔓延。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-06

今天三篇論文從不同角度同攻一個核心問題:**如何讓 Agent 工作流程在生產環境中真正可靠**。Mnemosyne 把資料庫的「交易(Transaction)」概念搬進 Agent 工作流程,讓 LLM 每個輸出都要先通過准入審核才能生效;PaperPilot 展示如何訓練 9B 小模型學會以 DAG(有向無環圖)規劃多輪搜尋工作流程,並根據用戶回饋動態修正整個流程;SEA 讓 Agent 邊跑邊改善自己,同時發出可被稽核的安全憑證。三篇合在一起幾乎覆蓋了 Agent 系統可靠性的完整棧:執行層保護、訓練層工作流程學習、更新層安全演化。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-05

今天三篇從不同角度觸碰 agent 平台的核心痛點:ReContext 提出免訓練的 inference-time 解法,讓 LLM 在 128K 長文中不再「視而不見」關鍵證據;第二篇揭示 multi-agent 辯論系統中,agent 因社會階層情境出現系統性「表裡不一」(divergence 3% → 40%);第三篇則對三個業界最常引用的 coding agent benchmark 發出警報——SWE-Perf 僅 8% 任務可靠重現,排行榜分數的可信度值得嚴肅質疑。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-04

今天三篇各自揭露了 agent 系統的一個評估盲點:記憶讓 agent 更「諂媚」卻少被測試(MemSyco-Bench);現有安全 benchmark 把所有失敗壓成 pass/fail,分不清真正原因(Adversarial Pragmatics);多個 LLM agent 組成的集群,因為以自然語言溝通,反而比黑箱神經網路更容易解讀(Conversable Complexity)。三篇合起來的訊息:我們評估 agent 系統的方式,需要全面升級。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-03

今日三篇共同揭示一個核心張力:現有 agent 系統在封閉環境下表現亮眼,但只要環境稍有偏移就會出現嚴重退化。ICML 2026 論文從工具使用角度系統化量化了這個問題;第二篇展示如何用 6 個專精 agent 的流水線完成跨域複雜任務;第三篇則從 UX 角度提醒:agent 的「個性表達強度」不是越強越好,中等才是甜蜜點。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-01

今天三篇涵蓋 AI Agent 生態的不同維度:Qwen 團隊推出首個跨七大 agent 領域的「語言世界模型」,讓 agent 能在模擬環境中訓練而非倚賴真實 API;快手 AgentX 展示多 Agent 系統在工業規模下的生產部署成果,把推薦算法迭代效率提升至人工的 13.8 倍;OpenAI 則用 Codex 真實使用數據,首次量化 agentic AI 正在如何改變各職能工作者的實際產出,並揭示非技術職能(法務、研究)的 agentic 紅利甚至超越工程師。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-30

今天三篇論文共同聚焦在一個核心問題:**我們到底怎麼評估 agent 夠不夠好?** SWE-Explore 把 coding agent 最被忽視的中間步驟——讀懂程式庫——單獨拿出來測;Claw-SWE-Bench 揭示框架設計(harness adapter)才是讓 coding agent 分數暴漲的真正槓桿,同一模型換個 adapter 就能從 19% 跳到 73%;Red Queen Gödel Machine(Cambridge × NVIDIA)則走得更遠,讓評測者本身也跟著 agent 一起進化,打破靜態 benchmark 的天花板。三篇合看:**evaluation in

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-29

今天三篇從不同角度剖析「Agent 走向生產級基礎設施」的挑戰:Agent libOS 回答「agent 的 runtime 底層該長什麼樣子」;Autodata(Meta FAIR)示範「agent 如何自己製造並持續優化訓練資料」;GAIE 則提出「企業在法規約束下如何分級監督 coding agent」。三者合看,描繪出 agent 平台從架構、資料到治理都需要重新設計的完整藍圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-28

今天三篇分別從不同層次切入「打造生產級 Agent 系統」:一本涵蓋 LLM 基礎到 multi-agent 架構的全棧實用指南、一個讓 Agent 在長任務中自主決定何時壓縮上下文的輕量 scaffold、以及一篇把 Agent 強化學習信用分配從「工具呼叫點」精細到「token 層級」的訓練演算法。三篇合起來,正好串起「學什麼架構」、「跑起來怎麼穩」、「怎麼訓得更好」三個打造 Agent 平台的關鍵問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-26

今天三篇各攻一個角度:第一篇 **RigorBench** 問的是「AI coding agent 怎麼解題」而非只看答對率,提出五維流程紀律指標;第二篇來自產業實踐,教你如何把大型 LLM multi-agent 系統客製化、加速,讓企業真的用得起(實測 4.48 倍吞吐量提升);第三篇則從治理角度出發,為 AI 融入軟體開發生命週期提出一套正式協議語言,讓「哪些決定讓 AI 做、哪些要人工審核」從 prompt 裡的一句話,變成可機器驗證的規格。三篇合起來覆蓋「怎麼評估、怎麼部署、怎麼治理」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-21

今天三篇從不同切面拼出「agent 在真實世界怎麼落地」的全貌:Perplexity + 哈佛商學院用生產數據首次量化 agent 對比對話助理的差距——完成時間縮短 87%,而且 agent 吸引了認知複雜度更高的工作類型;Self-Harness 示範 agent scaffolding 如何不靠人工自動挖弱點、自動修,三個主流模型各獲 33-60% 相對提升;The Consistency Illusion 拆穿多 agent 辯論的核心陷阱——輸出層共識可能掩蓋底層推理根本不一致。三篇合讀的訊號:agent 真正的競爭力不在於模型更強,而在於「生產數據驅動的 scaffolding 自

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-20

今天三篇由三個不同角度探問「讓 Agent 更可靠」:EinsteinArena 提出讓多個 AI agents 彼此共享解題思路與失敗記錄的持久化平台,已在數學難題上集體找到 12 個人類從未發現的新最佳解;APEX 把 agent 自我演化從「只改 prompt」擴展到同時演化行為原則(principles)和工作流拓撲(topology)三層並進;AI Economist Agent 則示範如何用知識圖譜 + 正式計量模型替 LLM 的每一個定量聲明上鎖,讓報告每個數字都能追溯到具體計算。三篇合讀的訊號:Agent 系統的下一個競爭維度,是如何設計讓 agents 集體共享知識的基礎設施

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-19

今天三篇都在動搖 Agent 領域的「常識」:ACCORD 實驗揭示 agent 普遍犯的「自以為了解指令」問題(靠假設而非觀察行動),提出主動接地框架讓 AppWorld 成功率從 42% 跳到 62.6%;《多智能體的幻覺》以嚴格評測證明,自動生成的多智能體架構在計算成本高出 10 倍的情況下反而比不過單 agent + CoT-SC;《非常非常 Agentic》則用 GitHub 大規模實證資料揭示,AI 程式碼 Agent 在新建專案的採用率已是一年前的兩倍多。三個訊號合起來:Agent 工具快速普及,但「多 agent 必然更強」和「agent 理解你的指令」這兩個核心假設,正在被資

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-18

今天三篇論文圍繞 Agent 平台的三個關鍵基礎設施層:HarnessX 提出一套「Harness 即可進化元件」的框架,讓 Agent 執行環境從靜態腳架變成自我最佳化系統,在 5 個 benchmark 上平均提升 +14.5%;第二篇研究多 Agent 協作中的「技能條件信任」路由問題,揭露什麼條件下細分信任真的有用、以及如何被攻擊者劫持;OCELOT 則從資安角度切入,提出「後驗洩漏預算」機制,防止 Agent 一步步把使用者隱私累積洩漏給外部服務。三篇合起來覆蓋框架設計、多 Agent 治理、隱私安全——恰好是落地 Agent 平台時最常踩到的三條坑。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-16

今天三篇論文從「訓練 → 架構 → 環境」三個層次,一起回答同一個問題:怎麼讓 Agent 在真實系統裡更可靠?RefGRPO 找出 Agent RL 訓練中被忽略的反思校準問題,讓 Agent 成為自己的驗證器;「Agents All the Way Down」給出從 LLM substrate 到上線部署的完整 custom agent 方法論,強調地基穩固比框架選擇更重要;EurekAgent 則以自主科研任務為場景,證明「環境工程」比「流程工程」更決定 agent 的可靠性上限。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-15

今天三篇從不同角度描繪「2026 年的 agent 現實」:UC Berkeley 用 1,000+ 個真實職場任務做成的 benchmark 顯示,當前最強 agent 在最難任務上平均只通過 2.6%;Microsoft 研究者訪談 17 位開發者後發現,他們都在無意識地發展出 4 種即興「監督工作」,但現有工具幾乎沒有支援;Reins AI 的工坊論文則指出,在 agent 系統還不夠成熟的部署期,傳統任務層監控根本看不到最嚴重的結構性故障。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-13

今天三篇分別從「記憶架構」、「訓練效率」、「可靠度評估」三個角度切入 Agent 平台的核心挑戰。HORMA 提出階層式檔案系統記憶架構,讓 Agent 在長工作流程中不再因 context 暴漲而崩潰;TRACE 重新設計 Agent RL 訓練的 rollout 分配邏輯,同樣算力讓 Multi-Hop QA 多學 2.8 個百分點;τ-Rec 則揭露多輪對話推薦 Agent 的「可靠度斷崖」——連最強模型連跑四次的可靠度也只剩 38%,這個數字對任何計劃上線 Agent 產品的團隊都是當頭棒喝。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-11

今天三篇論文從不同層次探索「agent-native 基礎設施」的設計:第一篇從 API 界面出發,提出讓 API 在出錯時主動給 agent 結構化修復建議,大幅提升工具呼叫成功率;第二篇拉高到系統架構層,主張 Agent OS 才是讓 agent 長期穩定運行的正確抽象;第三篇直擊推理服務底層,建出針對多輪 agent 的 hardware-aware 模擬器,讓 KV cache 排程優化得以量化驗證。從 API 到 OS 到硬體,agent 運行的每一層都需要重新設計。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-10

今天三篇論文呼應同一主題——讓 Agent 從實驗走向可靠的生產環境:一篇是超大規模雲端部署的多 Agent 故障排除架構實戰,自主解決率達 90%+;一篇提出讓 Agent 記住過去工具呼叫成功失敗的記憶機制,不用重訓模型就能持續進步;一篇則首次系統比較六款 AI 輔助開發流程框架,提供六個維度的選型參考。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-09

今天三篇都圍繞 **coding agents 的安全邊界與能力優化**:SABER 用第一個「可執行工作區」benchmark 發現即使最好的模型也有超過 54% 的危險操作率;第二篇讓 100 多位真人開發者跟「暗中破壞」的 AI agent 共事五小時,94% 的人沒抓到;SePO 則展示了只靠自動優化 system prompt(不改模型),就能在五個 benchmark 平均提升 4.49 分。三篇合起來提醒平台開發者:agent 的安全問題比想像中更難量測、更難被人察覺,但也存在低成本的改善路徑。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-08

今天三篇分別對應 agent 平台堆疊的三個層次:AgentJet(訓練層)提出讓多個異質 LLM 同步做強化學習訓練的分散式框架,解決現有工具只能單模型訓練的根本痛點;AdaPlanBench(評測層)用 67.75% 的成績上限揭示 LLM agent 在「規則邊走邊揭露」的現實場景中遠未成熟,是第一個系統量化這種適應性規劃能力的 benchmark;Beyond Tokens(通訊層)整理了 multi-agent 系統改用「傳 embedding 而非傳文字」的研究現狀,提供分類框架評估這條新通訊路徑的工程取捨。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-07

今天三篇都在問 agent 平台的「基礎建設怎麼選」:ADK Arena 首度量化比較 LangGraph、AutoGen、CrewAI 等多個主流框架的真實任務完成率與成本差距,讓框架選型終於有量化依據;Agent Memory 提供第一個從電腦系統視角分析 10 種記憶方案的 taxonomy,幫工程師評估延遲、頻寬、可擴展性的取捨;Search-Time Contamination 則質疑 deep research agent 的 benchmark 分數可信度——agent 在評測時可以直接搜到答案,分數最多虛高 4%。三篇合看,agent 平台的三個核心決策點(框架選型、記憶架構、

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-06

今天三篇圍繞 agent 系統三個深層問題:**記憶架構**(哪種設計能真正跨場景通用?)、**自我進化能力**(AI 能不能自己開發 agent?)、**安全盲區**(CUA 的安全性在不同場景下差距有多大?)。AutoMEM 告訴我們主動控制自己記憶的 agent 比依賴外部管道更泛化;Meta-Agent Challenge 揭示現在前沿模型距離「自主開發 agent」仍有顯著落差;Domain-Conditioned Safety 則發現 Claude Sonnet 4.6 在網頁任務的 prompt injection 攻擊成功率是 0%,但在程式碼場景中同樣的模型被攻破率高達 10

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-05

今天三篇分別從「評測診斷」、「工具進化」、「安全對齊」三個角度補強 Agent 平台的核心短板:APB 提出一套 4,209 道題的診斷型 benchmark,首次能把「規劃失敗」和「執行失敗」分開來看;MetaForge 讓 agent 能在運行時「自行鍛造」沒有的工具,打破靜態工具庫的天花板;RUBAS 把 agent 安全問題細分成四個評分維度,用強化學習讓模型學會在實用性和安全性間找到平衡。三篇合看:你的 agent 系統能不能被診斷、能不能自我擴展、能不能安全上線——這三道關卡今天同時被研究者正面回應。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-04

今天三篇從不同層次切入「如何建造更可靠、更可進化的 Agent 系統」:第一篇用真實執行軌跡首次揭示多模型 Agent 系統的 LLM 呼叫成本,讓平台工程師能用數字說話;第二篇提出把整個記憶流水線當成可自我演化的程式碼,解決長期任務中記憶架構對齊失效的痛點;第三篇補上評測盲點,指出現有 Agent 持續學習 benchmark 無法真正辨別「學到了什麼」,並給出更嚴謹的 controlled stream 框架。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-03

今天三篇論文從 agent 記憶的「互通標準化」、「隱層效率化」、到「預算感知缺失」三個維度切入:第一篇獨立研究者提出跨框架記憶電線格式,試圖解決 mem0、Letta、Cognee 各自為政的碎片化;第二篇把過去經驗的「文字塞 context」改成在 LLM 隱層空間做向量檢索,12/13 benchmark 最佳;第三篇是多機構大型評測,揭露五大 frontier 模型全都過度樂觀、無法在中途感知「這任務預算不夠用」,任務強≠預算感知強(r=0.35)。三篇合看:記憶標準化難題 → 記憶效率新架構 → 部署成本的系統性盲點。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-02

今天三篇論文從不同角度解決 Agent 平台的核心痛點:第一篇提出把 LangGraph 那種「外掛 orchestrator」邏輯直接燒進小模型 weights,讓每對話成本降低 128–462 倍;第二篇來自 IBM Research,打造自動分析 agent 執行行為的三層評估框架,解決「agent 出了問題不知道哪個環節壞掉」的困境;第三篇來自 Microsoft,提出 agent 記憶的跨平台可攜帶協議,讓 Claude / GPT-4 / Gemini 之間可以交接記憶而不丟失狀態。三篇合看,恰好覆蓋 agent 平台的部署效率 → 行為評估 → 記憶可攜性三個關鍵面向。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-31

今天三篇論文切入三個不同層次:BenchTrace 跑了 1,821 個 agent 失敗片段,發現 GPT-4.1 和 Qwen3-32B 連「讀懂自己哪裡錯了」都不到三成通過——反思能力遠比想像差;Beyond Autonomy 從企業 SaaS 生產環境萃取出三層治理架構,是現有 agent framework 缺的那塊「治理」拼圖;Insuring Every Action 則用保險精算概念替每個 agent 動作定價與設定保證金,開創了全新的 runtime 風險語言。共同主軸:agent 走向企業部署的核心挑戰,已從「能不能做」演變成「做錯了怎麼辦、誰負責審查、損害怎麼量化」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-30

今天三篇分別從「設計語言」、「安全地圖」、「認知侷限」三個面向挑戰 AI Agent 實務:第一篇建立雙軸分類框架,讓工程師和研究者有共同語言溝通 agent 架構的設計取捨;第二篇系統整理 agentic AI 在工具呼叫、記憶體、多步驟執行中的安全與隱私風險全景;第三篇最具衝擊——用近 4 萬個 AI 生成想法的大規模實驗揭示,AI 研究 agent 傾向圍著舊文獻打轉而非真正拓寬科學探索。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-29

今天三篇論文從三個切面同時問「如何讓 agentic AI 跑得更好」:第一篇(UIUC × Intel)量測 agent 真實工作負載,發現瓶頸在 KV-cache 管理而非長 prompt;第二篇(PwC)用對照實驗打臉 RAG-first 預設,指出 grep 在 agent loop 裡常勝過向量搜尋;第三篇(Microsoft Research)開源完整 agent 訓練框架,讓社群不靠閉源 API 也能訓練出同量級 SOTA 的 agent。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-27

今天三篇論文共同指向 Agent 從 demo 走向真實部署的三道關卡:AgentTrust 在 tool call 執行前加入即時攔截層,填補靜態黑名單與事後 benchmark 之間的空白;Hermes 掃描 600 個生產 endpoint,發現現有 REST API 文件對 MCP agent 來說幾乎全部不合格(平均每個 endpoint 4 個問題);PARPO 則從 RL 訓練切入,讓 agent 的行為真正因人而異而非「對所有人都還好」。三篇合在一起,勾勒出 production-grade Agent 系統在安全閘、API 整備、個人化三條線上還有多少硬仗要打。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-26

今天三篇分別從三個基礎設施層面深挖 Agent 平台:微軟提出仿人腦六機制的記憶管理架構,在大型 codebase 資料上讓記憶庫壓縮 58% 還保住 97.2% 精確率;Megagon Labs 的研究顛覆「逐步推理」慣例,證明先生成完整計劃再批次執行工具可省 2–4.7x token;最後一篇借用神經科學工具,讓 multi-agent 通訊拓撲(Chain / Star / Mesh)的架構選擇從猜測變成可計算的診斷。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-25

今天三篇圍繞 2026 年 agent 平台最迫切的問題:**多代理系統的安全規範,在執行過程中能維持住嗎?** 2605.10481 命名了一個新失效模式——「約束漂移」(constraint drift):系統設計時寫好的安全限制,會在代理人傳遞、記憶讀寫、工具呼叫過程中悄悄弱化,到輸出端時早已走樣。2605.07728(SARC)提出架構解法:把規範編譯成四個可執行卡關點,嵌進代理人執行迴圈,不再依賴 prompt 提醒,已開源。2605.13851 則用心理學實驗發現:當多代理系統的協調者是「隱形的」,整個系統的保護性行為會顯著下降——這對主流 orchestrator-based 架