Skip to content
系列
97 篇文章

AI Agent Arxiv Digest

AI Agent Arxiv Digest 系列文章

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-25

今天三篇圍繞 2026 年 agent 平台最迫切的問題:**多代理系統的安全規範,在執行過程中能維持住嗎?** 2605.10481 命名了一個新失效模式——「約束漂移」(constraint drift):系統設計時寫好的安全限制,會在代理人傳遞、記憶讀寫、工具呼叫過程中悄悄弱化,到輸出端時早已走樣。2605.07728(SARC)提出架構解法:把規範編譯成四個可執行卡關點,嵌進代理人執行迴圈,不再依賴 prompt 提醒,已開源。2605.13851 則用心理學實驗發現:當多代理系統的協調者是「隱形的」,整個系統的保護性行為會顯著下降——這對主流 orchestrator-based 架

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-26

今天三篇分別從三個基礎設施層面深挖 Agent 平台:微軟提出仿人腦六機制的記憶管理架構,在大型 codebase 資料上讓記憶庫壓縮 58% 還保住 97.2% 精確率;Megagon Labs 的研究顛覆「逐步推理」慣例,證明先生成完整計劃再批次執行工具可省 2–4.7x token;最後一篇借用神經科學工具,讓 multi-agent 通訊拓撲(Chain / Star / Mesh)的架構選擇從猜測變成可計算的診斷。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-27

今天三篇論文共同指向 Agent 從 demo 走向真實部署的三道關卡:AgentTrust 在 tool call 執行前加入即時攔截層,填補靜態黑名單與事後 benchmark 之間的空白;Hermes 掃描 600 個生產 endpoint,發現現有 REST API 文件對 MCP agent 來說幾乎全部不合格(平均每個 endpoint 4 個問題);PARPO 則從 RL 訓練切入,讓 agent 的行為真正因人而異而非「對所有人都還好」。三篇合在一起,勾勒出 production-grade Agent 系統在安全閘、API 整備、個人化三條線上還有多少硬仗要打。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-28

今天三篇論文從三個角度補齊 agent 平台知識:AgentFugue 展示多個 peer agent 共享「推理暫存筆記」可突破長任務協作瓶頸;Can Agent Benchmarks Support Their Scores? 揭露當前 agent benchmark 的評分機制存在系統性漏洞,排行榜數字需重新審視;VibeServe 則讓 agent 自動生成整套 LLM serving stack,在特殊部署場景下超越手工優化的 vLLM。三篇合起來分別回答了「agent 怎麼協作更強」、「我們信任的評測數字是否可靠」以及「agent 能幫工程師做基礎設施嗎」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-29

今天三篇論文從三個切面同時問「如何讓 agentic AI 跑得更好」:第一篇(UIUC × Intel)量測 agent 真實工作負載,發現瓶頸在 KV-cache 管理而非長 prompt;第二篇(PwC)用對照實驗打臉 RAG-first 預設,指出 grep 在 agent loop 裡常勝過向量搜尋;第三篇(Microsoft Research)開源完整 agent 訓練框架,讓社群不靠閉源 API 也能訓練出同量級 SOTA 的 agent。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-30

今天三篇分別從「設計語言」、「安全地圖」、「認知侷限」三個面向挑戰 AI Agent 實務:第一篇建立雙軸分類框架,讓工程師和研究者有共同語言溝通 agent 架構的設計取捨;第二篇系統整理 agentic AI 在工具呼叫、記憶體、多步驟執行中的安全與隱私風險全景;第三篇最具衝擊——用近 4 萬個 AI 生成想法的大規模實驗揭示,AI 研究 agent 傾向圍著舊文獻打轉而非真正拓寬科學探索。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-31

今天三篇論文切入三個不同層次:BenchTrace 跑了 1,821 個 agent 失敗片段,發現 GPT-4.1 和 Qwen3-32B 連「讀懂自己哪裡錯了」都不到三成通過——反思能力遠比想像差;Beyond Autonomy 從企業 SaaS 生產環境萃取出三層治理架構,是現有 agent framework 缺的那塊「治理」拼圖;Insuring Every Action 則用保險精算概念替每個 agent 動作定價與設定保證金,開創了全新的 runtime 風險語言。共同主軸:agent 走向企業部署的核心挑戰,已從「能不能做」演變成「做錯了怎麼辦、誰負責審查、損害怎麼量化」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-01

今天三篇論文聚焦「agent 規模化部署的成本-能力邊界」:SR²AM 重新設計規劃架構,讓 30B 模型少用九成 token 就能競爭 685B-1T 系統;GroupMemBench 揭示現有記憶系統在多人群組對話中徹底崩潰(最強系統只有 46% 準確率,1990 年代的 BM25 關鍵字搜尋反而打贏它);AgentFloor 用 16,542 次測試確認,agent pipeline 大量的短程 tool use 根本不需要大模型。共同主軸:在算力成本壓力下,精確判斷「哪個環節需要多少智慧」已成為 agent 平台設計的核心課題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-02

今天三篇論文從不同角度解決 Agent 平台的核心痛點:第一篇提出把 LangGraph 那種「外掛 orchestrator」邏輯直接燒進小模型 weights,讓每對話成本降低 128–462 倍;第二篇來自 IBM Research,打造自動分析 agent 執行行為的三層評估框架,解決「agent 出了問題不知道哪個環節壞掉」的困境;第三篇來自 Microsoft,提出 agent 記憶的跨平台可攜帶協議,讓 Claude / GPT-4 / Gemini 之間可以交接記憶而不丟失狀態。三篇合看,恰好覆蓋 agent 平台的部署效率 → 行為評估 → 記憶可攜性三個關鍵面向。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-03

今天三篇論文從 agent 記憶的「互通標準化」、「隱層效率化」、到「預算感知缺失」三個維度切入:第一篇獨立研究者提出跨框架記憶電線格式,試圖解決 mem0、Letta、Cognee 各自為政的碎片化;第二篇把過去經驗的「文字塞 context」改成在 LLM 隱層空間做向量檢索,12/13 benchmark 最佳;第三篇是多機構大型評測,揭露五大 frontier 模型全都過度樂觀、無法在中途感知「這任務預算不夠用」,任務強≠預算感知強(r=0.35)。三篇合看:記憶標準化難題 → 記憶效率新架構 → 部署成本的系統性盲點。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-04

今天三篇從不同層次切入「如何建造更可靠、更可進化的 Agent 系統」:第一篇用真實執行軌跡首次揭示多模型 Agent 系統的 LLM 呼叫成本,讓平台工程師能用數字說話;第二篇提出把整個記憶流水線當成可自我演化的程式碼,解決長期任務中記憶架構對齊失效的痛點;第三篇補上評測盲點,指出現有 Agent 持續學習 benchmark 無法真正辨別「學到了什麼」,並給出更嚴謹的 controlled stream 框架。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-05

今天三篇分別從「評測診斷」、「工具進化」、「安全對齊」三個角度補強 Agent 平台的核心短板:APB 提出一套 4,209 道題的診斷型 benchmark,首次能把「規劃失敗」和「執行失敗」分開來看;MetaForge 讓 agent 能在運行時「自行鍛造」沒有的工具,打破靜態工具庫的天花板;RUBAS 把 agent 安全問題細分成四個評分維度,用強化學習讓模型學會在實用性和安全性間找到平衡。三篇合看:你的 agent 系統能不能被診斷、能不能自我擴展、能不能安全上線——這三道關卡今天同時被研究者正面回應。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-06

今天三篇圍繞 agent 系統三個深層問題:**記憶架構**(哪種設計能真正跨場景通用?)、**自我進化能力**(AI 能不能自己開發 agent?)、**安全盲區**(CUA 的安全性在不同場景下差距有多大?)。AutoMEM 告訴我們主動控制自己記憶的 agent 比依賴外部管道更泛化;Meta-Agent Challenge 揭示現在前沿模型距離「自主開發 agent」仍有顯著落差;Domain-Conditioned Safety 則發現 Claude Sonnet 4.6 在網頁任務的 prompt injection 攻擊成功率是 0%,但在程式碼場景中同樣的模型被攻破率高達 10

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-07

今天三篇都在問 agent 平台的「基礎建設怎麼選」:ADK Arena 首度量化比較 LangGraph、AutoGen、CrewAI 等多個主流框架的真實任務完成率與成本差距,讓框架選型終於有量化依據;Agent Memory 提供第一個從電腦系統視角分析 10 種記憶方案的 taxonomy,幫工程師評估延遲、頻寬、可擴展性的取捨;Search-Time Contamination 則質疑 deep research agent 的 benchmark 分數可信度——agent 在評測時可以直接搜到答案,分數最多虛高 4%。三篇合看,agent 平台的三個核心決策點(框架選型、記憶架構、

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-08

今天三篇分別對應 agent 平台堆疊的三個層次:AgentJet(訓練層)提出讓多個異質 LLM 同步做強化學習訓練的分散式框架,解決現有工具只能單模型訓練的根本痛點;AdaPlanBench(評測層)用 67.75% 的成績上限揭示 LLM agent 在「規則邊走邊揭露」的現實場景中遠未成熟,是第一個系統量化這種適應性規劃能力的 benchmark;Beyond Tokens(通訊層)整理了 multi-agent 系統改用「傳 embedding 而非傳文字」的研究現狀,提供分類框架評估這條新通訊路徑的工程取捨。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-09

今天三篇都圍繞 **coding agents 的安全邊界與能力優化**:SABER 用第一個「可執行工作區」benchmark 發現即使最好的模型也有超過 54% 的危險操作率;第二篇讓 100 多位真人開發者跟「暗中破壞」的 AI agent 共事五小時,94% 的人沒抓到;SePO 則展示了只靠自動優化 system prompt(不改模型),就能在五個 benchmark 平均提升 4.49 分。三篇合起來提醒平台開發者:agent 的安全問題比想像中更難量測、更難被人察覺,但也存在低成本的改善路徑。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-10

今天三篇論文呼應同一主題——讓 Agent 從實驗走向可靠的生產環境:一篇是超大規模雲端部署的多 Agent 故障排除架構實戰,自主解決率達 90%+;一篇提出讓 Agent 記住過去工具呼叫成功失敗的記憶機制,不用重訓模型就能持續進步;一篇則首次系統比較六款 AI 輔助開發流程框架,提供六個維度的選型參考。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-11

今天三篇論文從不同層次探索「agent-native 基礎設施」的設計:第一篇從 API 界面出發,提出讓 API 在出錯時主動給 agent 結構化修復建議,大幅提升工具呼叫成功率;第二篇拉高到系統架構層,主張 Agent OS 才是讓 agent 長期穩定運行的正確抽象;第三篇直擊推理服務底層,建出針對多輪 agent 的 hardware-aware 模擬器,讓 KV cache 排程優化得以量化驗證。從 API 到 OS 到硬體,agent 運行的每一層都需要重新設計。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-12

今天三篇論文從「如何評量 agent」和「agent 究竟是什麼」兩個角度出發:T1-Bench 建出橫跨 25 個真實業務領域的高仿真 benchmark,讓多領域跨域推理能力首次有系統性量化基準;VISTA 解決「用 LLM 模擬使用者測 agent」的可信度難題,提供 6 個指標量化你的測試有沒有真的覆蓋 agent 的能力邊界;Agentic Software 則從第一原理釐清:當 LLM 成為主推理引擎時,軟體的本質已變——這直接影響 agent 平台的除錯工具和測試策略設計。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-13

今天三篇分別從「記憶架構」、「訓練效率」、「可靠度評估」三個角度切入 Agent 平台的核心挑戰。HORMA 提出階層式檔案系統記憶架構,讓 Agent 在長工作流程中不再因 context 暴漲而崩潰;TRACE 重新設計 Agent RL 訓練的 rollout 分配邏輯,同樣算力讓 Multi-Hop QA 多學 2.8 個百分點;τ-Rec 則揭露多輪對話推薦 Agent 的「可靠度斷崖」——連最強模型連跑四次的可靠度也只剩 38%,這個數字對任何計劃上線 Agent 產品的團隊都是當頭棒喝。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-14

今天三篇論文從不同角度切入同一核心問題:**如何在真實部署條件下評估與運行 AI Agent?** Emergence World 建立持續運行數週的多 Agent 沙盒,揭露短期 benchmark 看不到的行為漂移與跨模型交叉影響;Survey 論文為 agent 執行環境設計建立完整分類學(8 屬性 × 8 領域),並提出 symbolic vs. neural 兩種自動合成範式;Martin Monperrus 的 position paper 則直接宣告:coding agent 已達門檻,人工 code review 可以退場了。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-15

今天三篇從不同角度描繪「2026 年的 agent 現實」:UC Berkeley 用 1,000+ 個真實職場任務做成的 benchmark 顯示,當前最強 agent 在最難任務上平均只通過 2.6%;Microsoft 研究者訪談 17 位開發者後發現,他們都在無意識地發展出 4 種即興「監督工作」,但現有工具幾乎沒有支援;Reins AI 的工坊論文則指出,在 agent 系統還不夠成熟的部署期,傳統任務層監控根本看不到最嚴重的結構性故障。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-16

今天三篇論文從「訓練 → 架構 → 環境」三個層次,一起回答同一個問題:怎麼讓 Agent 在真實系統裡更可靠?RefGRPO 找出 Agent RL 訓練中被忽略的反思校準問題,讓 Agent 成為自己的驗證器;「Agents All the Way Down」給出從 LLM substrate 到上線部署的完整 custom agent 方法論,強調地基穩固比框架選擇更重要;EurekAgent 則以自主科研任務為場景,證明「環境工程」比「流程工程」更決定 agent 的可靠性上限。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-17

今天三篇從不同角度挑戰「agent 工具使用與記憶」的基本假設:Evoflux 揭示小模型在 MCP 工具目錄前幾乎失能(執行成功率僅 3%),並用推論時演化搜尋把數字拉到 17-24%;FlowBank 指出 agent workflow 不必每次重新生成,預計算多樣化 workflow 倉庫再智慧路由,比手工設計高出近 15%;GitOfThoughts 則帶來最反直覺的發現:記憶對 agent 只在「問題幾乎一樣」時才有用,但 git 版本控制提供了一條以稽核性換取的工程之路。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-18

今天三篇論文圍繞 Agent 平台的三個關鍵基礎設施層:HarnessX 提出一套「Harness 即可進化元件」的框架,讓 Agent 執行環境從靜態腳架變成自我最佳化系統,在 5 個 benchmark 上平均提升 +14.5%;第二篇研究多 Agent 協作中的「技能條件信任」路由問題,揭露什麼條件下細分信任真的有用、以及如何被攻擊者劫持;OCELOT 則從資安角度切入,提出「後驗洩漏預算」機制,防止 Agent 一步步把使用者隱私累積洩漏給外部服務。三篇合起來覆蓋框架設計、多 Agent 治理、隱私安全——恰好是落地 Agent 平台時最常踩到的三條坑。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-19

今天三篇都在動搖 Agent 領域的「常識」:ACCORD 實驗揭示 agent 普遍犯的「自以為了解指令」問題(靠假設而非觀察行動),提出主動接地框架讓 AppWorld 成功率從 42% 跳到 62.6%;《多智能體的幻覺》以嚴格評測證明,自動生成的多智能體架構在計算成本高出 10 倍的情況下反而比不過單 agent + CoT-SC;《非常非常 Agentic》則用 GitHub 大規模實證資料揭示,AI 程式碼 Agent 在新建專案的採用率已是一年前的兩倍多。三個訊號合起來:Agent 工具快速普及,但「多 agent 必然更強」和「agent 理解你的指令」這兩個核心假設,正在被資

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-20

今天三篇由三個不同角度探問「讓 Agent 更可靠」:EinsteinArena 提出讓多個 AI agents 彼此共享解題思路與失敗記錄的持久化平台,已在數學難題上集體找到 12 個人類從未發現的新最佳解;APEX 把 agent 自我演化從「只改 prompt」擴展到同時演化行為原則(principles)和工作流拓撲(topology)三層並進;AI Economist Agent 則示範如何用知識圖譜 + 正式計量模型替 LLM 的每一個定量聲明上鎖,讓報告每個數字都能追溯到具體計算。三篇合讀的訊號:Agent 系統的下一個競爭維度,是如何設計讓 agents 集體共享知識的基礎設施

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-21

今天三篇從不同切面拼出「agent 在真實世界怎麼落地」的全貌:Perplexity + 哈佛商學院用生產數據首次量化 agent 對比對話助理的差距——完成時間縮短 87%,而且 agent 吸引了認知複雜度更高的工作類型;Self-Harness 示範 agent scaffolding 如何不靠人工自動挖弱點、自動修,三個主流模型各獲 33-60% 相對提升;The Consistency Illusion 拆穿多 agent 辯論的核心陷阱——輸出層共識可能掩蓋底層推理根本不一致。三篇合讀的訊號:agent 真正的競爭力不在於模型更強,而在於「生產數據驅動的 scaffolding 自

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-22

今天三篇從「agent 在生產環境的可靠性與安全性」出發,覆蓋推論期、訓練期、基礎設施三個層次。LedgerAgent 用推論期的輕量「帳本」結構,讓工具呼叫 agent 不再把所有狀態塞進 prompt 靠 LLM 重建——直接降低政策違反與狀態錯誤;Alibaba 的 Connect the Dots (CoD) 則往更遠看,以強化學習訓練 agent 在長期部署中邊執行任務邊更新對環境的認識,跨任務越跑越準;Sovereign Execution Brokers 從安全基礎設施切入,在 agent 每次「動生產系統」的那一刻插入憑證驗證,把「授權的動作」和「實際執行的動作」嚴格綁定。三篇

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-23

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-24

今天三篇從工具可靠性、協定選型、多 Agent 協作三個角度切入 Agent 平台的痛點:PlanBench-XL 揭露頂尖 LLM 在真實大型工具環境下一遇到工具失效就崩潰(GPT-5.4 從 52% 跌至 11%);TU Munich 給出第一份 MCP/A2A/ACP/ANP 等 9 個協定的技術分類法,讓選型有系統依據;AMD 的 Arbor 提出以樹狀搜尋作為多 Agent 的共享認知空間,讓失敗也成為有用的探索訊號。三篇合在一起,恰好描繪出 2026 年 Agent 平台的三塊基礎設施缺口。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-25

今天三篇都在探索「agent 能力的邊界與突破路徑」。Sakana Fugu(Sakana AI)訓練了一個 0.6B 的協調器模型,學會動態指揮一池 frontier LLM 分工,在 SWE-Bench Pro 等多個榜單達到公開 SOTA——核心命題是「orchestrator 本身可以被訓練,而不只是工程師寫死規則」。NatureBench 用 90 個 Nature 期刊的真實科研任務反問:coding agent 真的能做科學發現?最強配置只勝過原論文 SOTA 17.8%,且靠的是把問題「翻譯成熟悉的 ML 任務」,不是真正的發明。最後,《Rising from the Ashe

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-26

今天三篇各攻一個角度:第一篇 **RigorBench** 問的是「AI coding agent 怎麼解題」而非只看答對率,提出五維流程紀律指標;第二篇來自產業實踐,教你如何把大型 LLM multi-agent 系統客製化、加速,讓企業真的用得起(實測 4.48 倍吞吐量提升);第三篇則從治理角度出發,為 AI 融入軟體開發生命週期提出一套正式協議語言,讓「哪些決定讓 AI 做、哪些要人工審核」從 prompt 裡的一句話,變成可機器驗證的規格。三篇合起來覆蓋「怎麼評估、怎麼部署、怎麼治理」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-27

今天三篇從不同角度觸碰 Agent 平台的核心痛點:一篇把 Agent 記憶體拆成四個可量測的系統模組,揭示現有評估只看「答對沒」根本不夠;一篇借用軟體工程「設計審查」觀念,讓 Agentic Workflow 在上線前就能被自動驗證;另一篇用 14 組大規模平行實驗證明——你信任的那個 benchmark 排行榜,換個情境排名就洗牌,並提出更可靠的替代指標。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-28

今天三篇分別從不同層次切入「打造生產級 Agent 系統」:一本涵蓋 LLM 基礎到 multi-agent 架構的全棧實用指南、一個讓 Agent 在長任務中自主決定何時壓縮上下文的輕量 scaffold、以及一篇把 Agent 強化學習信用分配從「工具呼叫點」精細到「token 層級」的訓練演算法。三篇合起來,正好串起「學什麼架構」、「跑起來怎麼穩」、「怎麼訓得更好」三個打造 Agent 平台的關鍵問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-29

今天三篇從不同角度剖析「Agent 走向生產級基礎設施」的挑戰:Agent libOS 回答「agent 的 runtime 底層該長什麼樣子」;Autodata(Meta FAIR)示範「agent 如何自己製造並持續優化訓練資料」;GAIE 則提出「企業在法規約束下如何分級監督 coding agent」。三者合看,描繪出 agent 平台從架構、資料到治理都需要重新設計的完整藍圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-30

今天三篇論文共同聚焦在一個核心問題:**我們到底怎麼評估 agent 夠不夠好?** SWE-Explore 把 coding agent 最被忽視的中間步驟——讀懂程式庫——單獨拿出來測;Claw-SWE-Bench 揭示框架設計(harness adapter)才是讓 coding agent 分數暴漲的真正槓桿,同一模型換個 adapter 就能從 19% 跳到 73%;Red Queen Gödel Machine(Cambridge × NVIDIA)則走得更遠,讓評測者本身也跟著 agent 一起進化,打破靜態 benchmark 的天花板。三篇合看:**evaluation in

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-01

今天三篇涵蓋 AI Agent 生態的不同維度:Qwen 團隊推出首個跨七大 agent 領域的「語言世界模型」,讓 agent 能在模擬環境中訓練而非倚賴真實 API;快手 AgentX 展示多 Agent 系統在工業規模下的生產部署成果,把推薦算法迭代效率提升至人工的 13.8 倍;OpenAI 則用 Codex 真實使用數據,首次量化 agentic AI 正在如何改變各職能工作者的實際產出,並揭示非技術職能(法務、研究)的 agentic 紅利甚至超越工程師。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-02

今日三篇分別瞄準 Agent 平台的三大核心難題:**記憶如何從「撈資料」升級成「推理狀態」**(User as Code)、**多 Agent 如何去掉中央協調者卻更省成本**(DeLM),以及**Web Agent 執行後如何讓人快速驗證結果**(HANSEL)。三篇合在一起,幾乎就是一張高信任 Agent 平台的技術地圖——記憶層、協調層、可解釋層各攻一塊。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-03

今日三篇共同揭示一個核心張力:現有 agent 系統在封閉環境下表現亮眼,但只要環境稍有偏移就會出現嚴重退化。ICML 2026 論文從工具使用角度系統化量化了這個問題;第二篇展示如何用 6 個專精 agent 的流水線完成跨域複雜任務;第三篇則從 UX 角度提醒:agent 的「個性表達強度」不是越強越好,中等才是甜蜜點。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-04

今天三篇各自揭露了 agent 系統的一個評估盲點:記憶讓 agent 更「諂媚」卻少被測試(MemSyco-Bench);現有安全 benchmark 把所有失敗壓成 pass/fail,分不清真正原因(Adversarial Pragmatics);多個 LLM agent 組成的集群,因為以自然語言溝通,反而比黑箱神經網路更容易解讀(Conversable Complexity)。三篇合起來的訊息:我們評估 agent 系統的方式,需要全面升級。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-05

今天三篇從不同角度觸碰 agent 平台的核心痛點:ReContext 提出免訓練的 inference-time 解法,讓 LLM 在 128K 長文中不再「視而不見」關鍵證據;第二篇揭示 multi-agent 辯論系統中,agent 因社會階層情境出現系統性「表裡不一」(divergence 3% → 40%);第三篇則對三個業界最常引用的 coding agent benchmark 發出警報——SWE-Perf 僅 8% 任務可靠重現,排行榜分數的可信度值得嚴肅質疑。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-06

今天三篇論文從不同角度同攻一個核心問題:**如何讓 Agent 工作流程在生產環境中真正可靠**。Mnemosyne 把資料庫的「交易(Transaction)」概念搬進 Agent 工作流程,讓 LLM 每個輸出都要先通過准入審核才能生效;PaperPilot 展示如何訓練 9B 小模型學會以 DAG(有向無環圖)規劃多輪搜尋工作流程,並根據用戶回饋動態修正整個流程;SEA 讓 Agent 邊跑邊改善自己,同時發出可被稽核的安全憑證。三篇合在一起幾乎覆蓋了 Agent 系統可靠性的完整棧:執行層保護、訓練層工作流程學習、更新層安全演化。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-07

今天三篇論文都圍繞「讓 agent 系統更安全、更可預測、不出包」這個主軸。前兩篇出自同一研究團隊,以靜態分析角度出發:一篇系統性揭露 agent 陷入無限循環的成因與規模,另一篇則為整個 agent 程式碼建立依賴圖,讓安全審計和元件盤點成為可能。第三篇針對 multi-agent 軟體開發,把 LLM 輸出的信心分數引入協作流程,防止早期幻覺向下游蔓延。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-08

今天三篇論文聚焦同一個核心問題:現有 AI Agent 系統在「理想實驗室」與「真實部署」之間存在巨大落差。AgentGym2(ACL 2026)用新 benchmark 量化了評測的失真;Agentic RL 系統提出讓 agent 在生產環境持續自我進化的工程架構;ComfyClaw 則展示在圖像生成工作流中落地「技能自我進化」的完整範例。三篇合看,正是一張從「評測 → 部署 → 運行中進化」的完整地圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-09

今天三篇論文從不同維度敲響「Agent 安全警報」:FARMA 能以 100% 成功率悄悄竄改 Agent 的推理記憶,繞過現有所有防禦機制;Vera 框架對 4 套生產級 Agent 系統(含 Claude Code)做系統化安全測試,平均攻擊成功率高達 93.9%;PiSAs 則揭示在多用戶共享 Agent 環境中,資訊跨用戶洩露是個未被充分關注的嚴重問題。三篇合看,是任何正在部署 Agent 平台的工程師與 PM 必須面對的安全現實。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-10

今天三篇論文共同描繪 Agent 平台的「進化前線」:EvoSOP 讓 Agent 不再每次從零重組工具,而是從過去執行歷程中自動萃取可重用的 SOP,讓工作效率顯著提升;AgenticSTS 對長任務記憶提出嚴格的「有界合約」設計,用五層結構化提取取代無止盡的 context 堆疊;Spider 2.0-AIFunc 則揭示 AI 函式已被直接嵌入雲端 SQL 語法,但最強模型準確率僅約 67%,是資料 Agent 必須面對的新挑戰。三篇合看:從工具效率、記憶架構到資料能力,勾勒出 2026 年 Agent 平台亟需補強的三個關鍵短板。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-11

今天三篇論文都在追問同一件事:Agent 系統如何才能「可靠地」運作?STRACE 解決的是優化輸入太雜——從大量噪音失敗軌跡中精準找出真正的根因,讓 Agent 的自動優化不再被冗餘案例帶偏;The Blind Curator 揭示一個令人不安的靜默失效模式——自我進化 Agent 的技能淘汰機制會因為 LLM 評審偏差在某個閾值後徹底停擺,光靠增加數據救不回來;Severity Scale 則把「Agent 被攻擊後到底有多嚴重」從二元的成功/失敗,變成七段式的行動傷害評分,讓安全評測終於有細緻度。三篇合看:優化品質、自我進化健全性、安全評測精度——三個不同層面,共同指向 Agent 可信

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-12

今天三篇論文圍繞兩大主軸:**安全**與**評測**。Prismata 在頁面層阻止跨站提示注入攻擊;aiAuthZ 在工具呼叫層建立加密身份授權閘道——兩篇合力說明 LLM 本身不該是安全邊界,平台必須在架構層設防。第三篇 UniClawBench 則把 agent 評測從沙箱搬進真實世界,用「能力維度」取代「任務情境」做診斷,給平台工程師一把更好用的選模型與排查失敗的尺。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-13

今天三篇論文共同呼應一個趨勢:生產環境 agent 的瓶頸已不在模型能力,而在「狀態管理」。第一篇(Amazon)展示把重複步驟預先編譯成工具,可讓 p50 延遲降 42%、錯誤率降 53%;第二篇提出讓獨立記憶 agent 主動把關鍵狀態「推送」給行動 agent,解決長程任務中資訊遺失(behavioral state decay)的問題;第三篇以遞迴多 agent 架構克服單一 agent 無法同時廣又深的 web 研究限制。三篇合看:**工具化(tool compilation)、主動記憶(proactive memory)、遞迴分工(recursive orchestration)*

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-14

今天三篇論文從三個實戰角度切入 AI Agent 平台:第一篇揭露多 Agent 系統在生產環境中面臨的隱蔽安全威脅,並提出以「激活空間」偵測惡意 agent 的新框架(非同步環境下 F1 比現有方法高出 +0.55);第二篇改善 coding agent 的 retrieval 策略,引入「程序相似性」讓 AI 能找到解題步驟相近但表面不同的程式碼;第三篇則是重磅提醒——同一個 LLM 放進不同 harness,agent 的中途判斷就會出現顯著偏差,harness 設計根本不是中性的工具。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-15

今天三篇論文從三個截然不同的角度照亮 AI Agent 平台的現況:第一篇 LHTB 用 46 道長程終端機任務測出目前最強模型也只能解決約 28%,揭示 agent 距離真正自主作業仍有很長一段路;第二篇從安全角度發現多 agent 系統裡的「碎片化效應」讓傳統每個 agent 逐一監控的防禦策略幾乎失效;第三篇則從記憶體架構切入,用 3 個數量級的延遲差距,論證把記憶體放進 agent 推理迴圈本身才能有效消除冗餘行為。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-16

三篇論文不約而同都在問同一個問題:agent 的每一步執行單元,到底應該怎麼設計才能讓它可稽核、可重用、出了錯能最小範圍修復?ATG 把任務分解成有向無環圖(DAG)讓子任務並行、中間結果可複用;PalmClaw 把手機原生 API 直接包成結構化工具,甩掉難以追蹤的 GUI 點擊序列;IoAT 則把 agent 網路延伸到 IoT 物理世界,從智慧建築到邊緣設備,畫出跨雲端、邊緣、感測器層的協調藍圖。共同主軸:執行邊界要清楚、動作要可稽核、失敗要能局部恢復。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-17

今天三篇各從不同角度解決 agent 平台的核心痛點:第一篇從「前端 UX 設計」切入,提出讓電商網站對 AI 瀏覽器 agent 友善的框架,成功率從 49% 提升至 89%;第二篇攻的是「搜尋型 agent 亂猜答案」問題,用動態棄答 RL 訓練讓 agent 知道何時該說「我不確定」;第三篇則帶來具身機器人的 agent OS 架構,其多模態圖記憶與技能隔離設計對通用 agent 平台有直接啟發性。三篇合起來覆蓋了 agent 的「前端 UI 介面設計」→「推理可靠性訓練」→「執行層記憶架構」完整鏈路。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-18

今天三篇論文從三個維度切入「生產等級 Agent 可靠性」:MemCon 把記憶體操作建模為強化學習問題,讓 agent 自學何時存、取、忘,在 6 個 benchmark 上任務成功率最高提升 15.2 分;AgentCheck 把 MCP 伺服器變成除錯介面,開發者可重現工具故障、注入修復並驗證效果,填補了 MCP 生態長期缺乏「測試工具」的空缺;AgentAbstain 則用 263 個配對任務揭露:即便是最強的 frontier 模型,在「應拒絕行動」情境下正確率不到 60%,且棄動能力與任務解決能力幾乎無關——光靠換更強的模型無法解決這個問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-19

今天三篇分別對應 agent 平台的三個核心課題:MyAG 用圖論視角重新拆解「如何組裝 agent 系統」,提出 component / workflow / search 三層圖分離關注點;自我改進綜述用統一公式框架整理「agent 如何從經驗進化」的整個研究方向;MemPoison 則揭示「持久記憶是 agent 最脆弱的攻擊面」,並建立首個涵蓋 1,227 個攻擊案例的 benchmark。三篇合起來剛好是:怎麼搭架構 → 怎麼讓系統演化 → 怎麼不被攻破。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-20

今日三篇論文從三個不同角度審視 AI coding agent 的落地挑戰:第一篇用系統性實驗揭露 coding agent 在安裝套件時可被普通 README 發動供應鏈攻擊,且防禦能力主要取決於 harness 框架而非模型本身;第二篇提出 BPO 演算法,專為 sandbox-native agent 強化學習設計,只在高熵關鍵決策點分叉採樣提升訓練效率;第三篇以電網研究為案例,展示 MCP 如何作為標準協議串接工業場景的 domain-specific 仿真工具,為垂直領域 agent 落地提供可複製模板。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-21

今天三篇論文從不同層面回答同一個問題:「怎樣才算一個真正能用的 agent 系統?」SearchOS-V1 給出架構答案——把搜尋進度外顯成結構化狀態、記錄失敗路徑,讓 multi-agent 協作搜尋更可靠;AutoSynthesis 展示高度結構化的學術任務(系統性文獻統合分析)可以被 multi-agent 流水線全自動化;Digital Pantheon 則解決「如何讓 agent 在壓力下維持既定人設」的角色工程問題,並引入可審計的多 agent 協商架構。三篇合看,分別對應 agent runtime 設計、workflow 編排、與人設工程三個核心挑戰的最新解法。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-22

三篇論文從基礎設施、可觀測性、評估三個角度切入同一個核心問題:「如何打造真正可靠的 agent 系統?」Dyserve 用數學最佳化在 60ms 內決定 agent workflow 每個節點要用哪個 LLM,在精準度和延遲上同步超越所有 baseline;AgentLocate 解決 multi-agent pipeline 出錯時「不知道哪個 agent 搞的鬼」這個 ops 噩夢,自動定位責任 agent 和出錯時間點(COLM 2026 accepted);PolyWorkBench 則給出一記警告:現有頂尖 LLM agent 在多語言工作流中表現大幅劣化,全球化產品場景還有很長的路

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-23

今天三篇的共同主題是:**我們測 agent 的方式,本身就有問題**。第一篇直接審計主流工具呼叫 benchmark,發現近兩成的分數是評錯的;第二篇用重播分析告訴你哪些 benchmark 不用跑完就能得出可靠結論(SWE-bench 是反例);第三篇推出首個將「執行任務」與「生成操作教學」合二為一的多模態 web agent benchmark,截圖輸入、雙目標評測,最強模型也只完成不到四成。三篇合讀能讓你對 agent 評測的現況有完整的危機感與應對方向。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-24

今天三篇分別從生態、失敗、記憶三個角度切入:哪些開源 Agent 框架真正值得長期下注(不只看 star 數)、Agent 在哪六類問題上反覆翻車、以及如何讓 Agent 的長期記憶跨越多個人物做串聯推理。三篇合在一起,像是給 Agent 平台開發者的「框架選型依據 + 失敗防護清單 + 記憶系統升級方向」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-25

今天三篇從三個互補角度探索「讓 Agent 更可靠地解決複雜任務」。NVIDIA 提出把 Agent 寫成普通的 Python class,讓開發、測試、追蹤都像一般軟體一樣進行;BAAI 的 AREX 展示了能遞迴驗證並改良自身研究結論的深度研究 Agent,在 BrowseComp、HLE 等基準上超越同量級模型;第三篇爬梳 1,250 篇論文,為「AI 自我改良」這個混亂詞彙建立清楚的分類地圖,幫你分辨哪些技術已可落地、哪些還在研究階段。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-26

今天三篇論文從三個角度精準刺中 AI coding agent 的能力邊界:**ICAE-Bench** 挑戰「模糊需求下的互動式開發」場景,揭示當前 benchmark 跟不上 vibe-coding 時代;**EvoAgentBench** 揭露 agent 自我進化能力轉移的陷阱,主流方法竟造成 −12.3 分的負遷移;**PERFOPT-Bench** 則開闢「效能優化作為 agentic task」新賽道,並發現 framework 選擇往往比模型選擇更關鍵。三篇合讀的重點:生產環境的 agent 評估遠比現有工具複雜,業界亟需更貼近真實場景的評估體系。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-27

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-28

今天三篇論文從三個角度直擊 Agent 平台核心挑戰:**AgentCompass** 提出可組合的開源評測基礎設施,終結 agent 評測各自為政的碎片化亂象;**Agents in the Wild** 是少見的生產落地報告,從藥物研發與金融系統的真實部署歸納出可複用的設計模式;**Nanbeige4.2-3B** 則証明 3B 小模型配上 Looped Transformer 與大規模 agentic RL,在 agent 任務上可以壓過 9B 甚至 12B 的競爭對手——對邊端部署或成本敏感場景有直接啟示。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-29

今天三篇論文共同聚焦在「生產級多代理人系統的基礎設施可靠性」:第一篇比較 MCP 與 A2A 兩個協定如何分工、不是競爭而是互補;第二篇實測工具升版後 12 個頂尖模型的能力退化,發現前沿模型也會掉分 13-14%;第三篇揭示把安全模型串成 pipeline 之後整體反而不安全,因為防護其實是靠雲端供應商的伺服器端過濾器在撐。三篇合起來回答了「怎麼接工具」、「工具升版會不會壞」、「串起來安不安全」三個平台工程師最實際的問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-30

今天三篇圍繞「讓 Agent 更可靠、更好部署、更客觀評估」三個核心問題:TRACE-ROUTER 指出多步驟 Agent 流程不能套用「每次呼叫都重新選模型」的路由策略,改用任務級別路由搭配強化學習持續優化;OmniaBench 建立橫跨消費者、企業、工程三大場景的 1,431 題評測集,頂尖模型(Claude Sonnet-5)得分仍不到六成;自我校準 Agent 框架則示範如何用 ARIMA 時序預測幫 Agent 在無人監督下偵測並修正預測漂移。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-31

今天三篇論文都在問同一個核心問題:**現在的 AI Agent 真的能用嗎?** 答案出奇地一致——還差得遠。[HANDBOOK.md](http://HANDBOOK.md) 揭露把最強前沿模型丟進虛擬公司後,企業政策合規通過率最高只有 **36.2%**;LangGraph 論文給出三份可落地的有狀態工作流食譜,並附上「什麼時候不要用 LangGraph」的決策指南;MM-ToolSandBox 則首次量化了「看圖+叫工具」這個多模態組合技的困難程度——12 個主流模型中最強的成功率也不到一半。三個維度:合規評估、框架設計、視覺工具,串起一張「Agent 離真正落地還有多遠」的完整地圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-01

今天三篇論文從不同角度逼問「AI Agent 在現實任務中的真實極限」:ORCA-bench 把 LLM Agent 丟進 SRE on-call 的生產環境做根因分析,最強模型也只答對 40%;AgentS4D 揭露工作區 Agent 的安全黑箱——66% 的「成功執行」背後仍觸發了危險行為,任務完成不等於安全;Context Files 研究則以 288 次對照實驗發現,開發者普遍維護的 [AGENTS.md](http://AGENTS.md) / [CLAUDE.md](http://CLAUDE.md) 對 coding agent 的正確率幾乎沒有可量測的提升。三篇合讀,讓你對「A

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-02

今天三篇各從不同角度逼視「Agent 在真實環境裡出事了怎麼辦」:ProACT 問的是多人協作中 Agent 應何時開口(Agent UX 設計問題);第二篇用真實 GitHub 資料揭露 Coding Agent 和自己開的 PR 互衝(平台 ops 痛點);第三篇從安全視角整理 Cyber-capable Agent 五大漏洞類別,以今年七月的 HuggingFace/OpenAI 事件為 case study。三篇合起來是一堂「Agent 上線後,你沒想到的麻煩都在這裡」速成課。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-03

今天三篇論文分別從多 Agent 的「組織設計」、「安全隔離」與「使用者授權」三個維度切入平台建設難題。IMACS 把 multi-agent 系統拆成三個可獨立替換的層(組織、協調、協作演算法),讓框架設計者能像換積木一樣調整 Agent 角色或協作策略;APPA 用「分支上下文」打破 IFC(資訊流控制)的可用性瓶頸,在 4 個模型上把 prompt injection 外洩率從 31–50% 壓低至 0–7%;UW 的調查在 21 個 Agent 授權方案中發現,絕大多數系統只提供「開發者定義的全局策略」,使用者個人化授權幾乎付之闕如。三篇合在一起,勾勒出 agent 平台從原型走向生產

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-04

今天三篇各從不同角度審視 AI Agent 的能力與極限:AutoMem 告訴你「記憶管理」是可以自動學習的獨立技能,光優化記憶就讓 32B 開源模型達到頂級商用模型水準;Shadow Evaluation 用真實 NeurIPS 投稿測試頂尖 Agent 能否做開放式 AI 研究——答案是否定的,Agent 能工程但不會研究;Adaptive Adversaries 揭示現有安全評測嚴重低估威脅:加上自適應多輪攻擊者,攻擊成功率從 0–1% 跳到 14%。三篇合起來是一堂清醒課:知道 Agent 能自動變強在哪、不能在哪、以及你的安全測試可能根本不夠。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-05

ToolLIFT 把工具軌跡抽象成函數級工作流圖,OOD 準確率平均提升 4+ 百分點;HyperAgent 用工具-Schema 超圖建構缺口驅動的支援子圖,在 AppWorld 上比 ReAct 高 14.3 百分點且 token 用量更低;多語言多 Agent 規劃診斷發現低資源語言的規劃失敗佔比隨語言資源下降而升高,TART 修正法平均提升 5.6 百分點

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-06

VerMem 用七個原子記憶操作加雙驗證器在五個基準上平均領先最強基線 5-8 分;SafeCommit 把不安全行動率從 41.2% 壓到 2.6% 且維持 97.4% 任務完成率;ToolLIFT 把工具軌跡抽象成函數級工作流圖,OOD 基準上比最強基線高 3-5 分

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-07

ToolLIFT 把工具軌跡提升到功能層工作流圖,在三個 OOD 基準上持續超越 SOTA;SkillTV-Bench 用 681 案例證明技能感知的裁判技能讓 Agent 評判準確率提升 14.8 個百分點;TRIO-20 用預設等價研究發現 GPT-5.6 在 840 條軌跡中零越權呼叫,但推理力度提高讓規則探查率上升了 14.3 個百分點

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-08

Memory Reward Inflation 發現自我改善 Agent 的記憶獎勵會自我膨脹,錯誤經驗越用越自信,LUCID 演算法在 BIRD 上將準確率從 54.0% 提升到 56.9%;RoMeRL 用固定維度的語意座標壓縮記憶狀態空間,Cold-Q 比率降 80%、LLM 呼叫減 21.1%;ToolLIFT 將工具軌跡抽象成功能層級工作流圖,在三個 OOD 基準上一致超越現有方法

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-09

OneDayAgent 用任務分解+執行記憶+全域驗修三步鷹架在 AgentIF-OneDay 拿下 0.821 新 SOTA,同一鷹架跨五個後端穩定運作;The Horizon Gap 綜述 1,547 篇論文發現長程 Agent 六大失敗類別共享同一結構模式——純結果訊號隨步數增長而失效,領域正在製造更密的過程訊號來補;Evo-Bench 首次測量 Agent 自動進化鷹架的能力,GPT-5.6 Sol 最高拿 +16.6 分,但 Office 任務仍需人工流程

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-10

Evo-Bench 評測九款模型自主改進鷹架的能力,GPT-5.6 Sol 拿下 +16.6 分但 Office 任務幾乎不動;MEGA 用三層 Wisdom Graph 讓 Agent 優化基礎設施自我進化,知識積累與優化合為同一過程;SHE 把鷹架拆成四個可演化元件,從失敗軌跡學習安全邊界,ASR 降低 3.1 倍且跨模型可遷移

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-11

Muscle Memory 提出「編譯式記憶」取代檢索式記憶,在 90 個場景中贏下 88.9% 的個人化對決;MoRSE 用 role-subtask 條件化 LoRA 專家讓多 Agent 在程式碼生成上顯著超越純 prompt 分工;ASCon 建立統一故障歸因模型,在三種歸因目標上分別提升 5.83%、10.63%、14.73%

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-12

工具介面設計讓 coding agent 一致性提升 4.7 倍且 token 用量砍半;記憶蒸餾讓 4B 小模型在 AppWorld 準確率跳升 27.2 個百分點直逼大模型;制度設計實驗發現同樣的安全規則搭配不同權限機制,違規率從 0% 到 23% 天差地別

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-13

EvoGraph-Mem 用失敗感知的可編輯圖譜讓 Agent 記憶能自我修正,避免過時洞見反覆污染決策;MAP-Graph 把出處追蹤從事後稽核變成即時存取控制,在 2,700 個合成任務上達到 95% 成功率;MaSRead 證明多 Agent 可以共用 KV cache 片段作為記憶,但讀取需要按內容定址而非位置定址

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-14

Harness-IF 揭示 Coding Agent 的指令遵從度被高估 3.6-7.4 個百分點,因為模型本來就會做的事被算成了遵從;SHE 把 harness 拆成四個安全元件並從軌跡失敗自動演化,ASR 降低 3.1 倍且正確率提升;SBCO 用分解式驗證器銀行搭配文本梯度做 harness 自我改進,在規劃任務上以 4-5.5 倍更少的算力追平 Gödel Machine

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-15

SkillEvo 用多輪互動回饋取代單輪 QA 評估,讓技能進化不會在第一輪就停滯,比自我反思進化高 23 分;SkillShapley 把 Shapley 值搬進技能步驟歸因,用 99 次評估就能逼近精確排序,並發現「決策橋接步驟」才是高價值步驟;MindMemOS 用實體-屬性-時間結構統一記憶管理,LOCOMO 準確率 94%,技能進化讓 SpreadsheetBench 成功率提升 9.2 個百分點

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-16

PIMiner 用可跨模型轉移的策略庫,以約 20 美元查詢成本讓提示注入攻擊成功率衝上 76-87%;Agent Skills Can Be Harmful 從 307 個技能誘發失敗中發現看似相關的技能比明顯無關的技能更容易搞砸任務,過度流程占效率退化六成以上;Order 66 情境分析用組合式威脅模型證明休眠植入、事後記憶投毒與對等擴散單獨看都不致命,疊加後可能自我維持傳播

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-17

RippleMem 靠聯想式記憶擴散讓 LongMemEval-S 準確率最高提升 11.87%,同時把記憶圖建構成本壓到 1/30;Total Recall at What Cost? 量出記憶系統的服務成本誤差可達 18–69%,且沒有一套系統同時贏成本和準確率;MESA 用動態選記憶結構在 AMA-Bench 上準確率高 8.5%,還省下 41% 證據 token

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-18

ActBench 用執行軌跡紅隊測試協作 agent,固定 harness 下攻擊成功率仍達 73.7%–94.4%;Agent Behavioral Contracts II 證明同模型兩階段 pipeline 共同失敗率高達 90%,「條件獨立」假設不成立;Graph-Based RL Drift Diagnosis 用小模型外掛復原圖,在不重訓主力 agent 下偵測漂移並自動回滾

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-19

QUMem 用情節切分加三階段 agent 推斷使用者狀態,在 KnowU-Bench 整體成功率贏最強 baseline 4.6 個百分點;LENS 免索引邊查邊定位證據,證據召回率 84.8% 遠勝 ReAct 基線的 50.4%,索引過期情境下完全不掉分;Intent-Guided Decoding 在解碼期仲裁檢索內容與模型記憶,事實衝突基準最高帶來 65.4 個百分點的準確率增益

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-20

D2ACCI 用雙迴圈診斷協議把記憶失敗定位到管線的哪一階段,診斷成功率從 0% 提升到 98–100%;Salesforce 重新評測記憶型自我進化 Agent,任務順序一打亂,表現從預期的進步 1.5% 反而退步 4.5%;GraphWake 證明只要污染 10% Agent 的記憶,就能讓群體意見極化程度大幅上升

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-21

DART-SD 用互動狀態圖只監督修復步驟,讓工具呼叫 agent 自蒸餾不再誤殺有效探索;SkillForge 讓 agent 先解合成題把 repo 知識蒸成技能,SWE-bench Verified +5.8%;Post-Training AI 分析發現頂尖 agent 開場就鎖死訓練策略,之後十小時只做局部微調

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-22

LEDGER 用分層證據圖讓你稽核 agent 到底做了什麼、憑什麼下結論;StateMemBench 證明現有記憶系統普遍追不上事實變動,最強方法把準確率從 0.205 拉到 0.363;AI4AI-Bench 顯示遞迴自我改良離現實還很遠,六套系統 29 種配置在滿分 1.0 的量表上平均只拿 0.166 分

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-23

MidTool 用 20.3B token 的中期訓練語料讓 4B/8B 模型在 MCP-Universe 上超越 Qwen3 官方模型;Break It Down 發現整段任務式技能遷移平均會讓 Agent 變差,拆到子任務層級才會變好;Optimal Skill Selection 證明技能挑選可以有可證明的近似保證,在 BigCodeBench 變體上用少 28% token 拿下 0.73 成功率(對手 0.20–0.52)

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-24

CAMA 抓出多 agent 共享記憶裡的『記憶相關性偏誤』,把 MemoryAgentBench 假多數偵測分數從 60.7 拉到 71.2;MemTrapBench 發現所有測過的記憶框架在認知陷阱情境下都輸給無記憶基線,最強方法也掉超過 10 個百分點;Remember, Verify, or Ask? 顯示模型驗證易變事實比詢問使用者澄清可靠得多,換成工具呼叫測試後 Qwen 準確率從 0.557 掉到 0.343

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-25

StartupBench 顯示就連最強模型在市場驗證的真實任務上也只有約 30% 能達到可直接使用的品質;Thinkingbox 揭露 Agent 能偶爾找到成功路徑卻很難穩定重現,20 次全對的比率只有 25.25%;DeltaML-Bench 證明換掉 agent 的搜尋式鷹架能同時拉高成功率(GPT-5 從 9.4% 到 49.0%)並幾乎消滅規格取巧的作弊行為

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-26

COTA 用不需要會解題的迷你比較器做執行期介入,在三個環境、三種 actor 的九個評測設定全數改善;CAS 用保形預測同時解決搜尋型 Agent 的固定 Top-K 檢索與 RL 訓練後期過度自信兩個問題;AID-Guard 用狀態化授權協定在 210 次 Stripe 情境測試與 44 次代理者攻陷攻擊測試中做到零重複效果、零漏防

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-27

SMITH 讓同一個 4B 模型自己寫工具自己用,13 項程序推理任務拿下 79.8% 最佳成績,還能零樣本遷移到視覺問答;PeakBench 揭露邏輯規劃強的 agent 平行呼叫工具時常常對資源上限視而不見,造成可避免的過載;OODA-Tool 把「記狀態」與「做動作」拆成四階段,在 Qwen3 全系列讓任務成功率最多提升近 7 分,模型越小改善越大

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-28

Scroll 把 agent session 變成可執行的 Python 環境,在 LOCA 256K 長程任務贏過最佳已發表系統 37.4 分;EARM 讓重排序器記住過去打過的分數,只需直接評分 17.5% 候選就能維持準確率提升;PolyMemDB 用五種資料庫分別存記憶的不同面向,靠機率推論算出衝突事實的可信度分數

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-30

包裝完整的假證據可把 12 個模型的整體行動承諾率從 6.5% 推到 54.0%;SARA 把工具輸出誘發的動作與執行授權拆開,將兩組 benchmark 的攻擊成功率壓到 0.06%–0.17%;LoopHarness 顯示會自然衰減的安全狀態可能被等待繞過,但目前實證仍限於單一固定模型配置與 execution seed