Skip to content
← Daily Digest

Agent 記憶

Agent Memory

記憶管理、context window、遺忘機制、episodic memory、長程任務記憶

論文時間軸(32 篇)

2026-05-25
SARC: 把法規義務編譯成執行時約束 必讀

與其把「請遵守法規」寫在 prompt 裡然後希望 AI 記得,SARC 把規範編譯成四個硬性卡關站嵌進代理人的執行迴圈,不依賴 AI 的「記憶力」。

arxiv: 2605.07728
2026-05-26
Human-Inspired Memory Architecture for LLM Agents 必讀

微軟把人腦六大記憶機制(睡眠整合、干擾遺忘、記憶成熟、提取再鞏固、知識圖、混合提取)搬進 LLM Agent,在真實 codebase 資料上讓記憶庫壓縮 58%、保住 97.2% 資訊精確率。

arxiv: 2605.08538
2026-05-30
Towards Trustworthy Agentic AI: Safety, Robustness, Privacy & System Security 略讀

agentic AI 會自己呼叫工具、存取記憶體、多步驟執行——這些能力讓它比純 LLM 更危險。這篇是把這些新型風險系統整理成「風險地圖」的 survey。

arxiv: 2605.23989
2026-05-31
BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents 必讀

做了個 benchmark,發現 GPT-4.1 和 Qwen3-32B 在「看懂自己失敗原因」這件事上通過率不到三成,而且就算讓 agent 讀了失敗案例去學習,隨著雜訊案例累積,它還是會把早期教訓給忘掉。

arxiv: 2605.29225
2026-06-01
GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations 必讀

現有 agent 記憶系統根本沒為多人對話設計:最強系統在群組設定下只有 46% 準確率、知識更新只有 27.1%,而 1990 年代的 BM25 關鍵字搜尋就能打贏大多數新型語意記憶系統。

arxiv: 2605.14498
2026-06-02
Portable Agent Memory 略讀

定義了一套讓 agent 記憶可以從 Claude 搬到 GPT-4 再搬到 Gemini 的開放協議,帶加密驗證,防止記憶被篡改或惡意注入。

arxiv: 2605.11032
2026-06-03
AMP: A Vendor-Neutral Wire Format for Agent Memory Operations 必讀

提出 memorywire,一個讓 mem0、Letta、Cognee、pgvector 等記憶框架「插頭共用」的 JSON 電線格式,定義 5 個記憶操作與 4 種記憶類型,附帶 5 個後端 adapter 的開源實作。

arxiv: 2606.01138
2026-06-04
MemPro: Agentic Memory Systems as Evolvable Programs 必讀

把 Agent 的整個記憶系統(包含「如何存」和「如何取」的邏輯與程式碼)當成一支可自我迭代的程式,讓 Agent 從失敗中學習並更新記憶架構本身,而不只是更新記憶內容。

arxiv: 2606.00619
2026-06-07
Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads 必讀

首篇從「電腦系統」而非「LLM 能力」角度分析 agent 記憶:10 種記憶系統用 4 個 axes 分類,揭示不同設計在延遲、頻寬、可擴展性上的實際取捨,給工程師系統化框架來選記憶方案。

arxiv: 2606.06448
2026-06-10
Autonomous Incident Resolution at Hyperscale: An Agentic AI Architecture for Network Operations 必讀

一套分層多 Agent 系統在真實雲端環境自動偵測、診斷並修復網路故障,生產部署後達 90%+ 自主解決率,不需人工介入。

arxiv: 2606.09122
2026-06-13
Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents 必讀

把 Agent 的「執行記憶」整理成階層式筆記資料夾,讓 Agent 用 Bash 工具自己去翻找需要的資訊,而不是把所有歷史全塞進 prompt。

arxiv: 2606.11680
2026-06-14
Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy 必讀

讓配備 120+ 工具與三層持久記憶的 LLM Agent 群體在共享沙盒裡連續跑幾週,觀察短期 benchmark 完全看不到的「行為漂移」與跨模型交叉影響現象。

arxiv: 2606.08367
2026-06-17
FlowBank: Query-Adaptive Agentic Workflows Optimization through Precompute-and-Reuse 略讀

Agent workflow 不必每次重新生成(貴),也不必只有一個萬用版本(差)——預計算一個多樣化 workflow 倉庫,推論時用圖神經網路路由,比最強自動化方法高 4.26%、比最強手工設計高 14.92%。

arxiv: 2606.11290
2026-06-17
GitOfThoughts: Version-Controlled Reasoning and Agent Memory You Can Replay, Diff, and Merge 必讀

大家都在說要給 Agent 加記憶,但這篇系統實驗後的答案是:除非新問題跟記憶中的案例幾乎一模一樣(相似度 > 0.8),加任何記憶基底都沒有統計顯著幫助——但 git 提供了一條以稽核性、可重播性為價值的工程路徑。

arxiv: 2606.14470
2026-06-20
Harnessing the Collective Intelligence of AI Agents in the Wild for New Discoveries 必讀

把多個 AI agent 放在同一個平台互相借用解題思路和失敗記錄——就像科學家交流論文草稿一樣——成功讓集體 agents 在數學難題上找到 12 個人類和 AI 都沒解出過的新最佳解。

arxiv: 2606.10402
2026-06-23
Multi-Agent Transactive Memory 必讀

讓 agent 把完整的執行軌跡(怎麼一步步完成任務)存進共享庫,讓其他 agent 之後能撈出來參考,而不是每次遇到類似任務都重新摸索。

arxiv: 2606.19911
2026-06-28
The Hitchhiker's Guide to Agentic AI: From Foundations to Systems 必讀

一本寫給工程師和 PM 的 Agentic AI 全棧指南,從 Transformer 架構到 MCP/A2A 協議、multi-agent 架構,每章附代碼範例,可當手邊參考書長期使用。

arxiv: 2606.24937
2026-06-28
Self-Compacting Language Model Agents 必讀

Agent 跑長任務時 trace 越積越長最終爆 context,SelfCompact 讓 LLM 自己判斷何時壓縮記憶,比固定間隔方案更準確,且節省 30-70% token 成本。

arxiv: 2606.23525
2026-06-29
Agent libOS: A Library-OS-Inspired Runtime for Long-Running, Capability-Controlled LLM Agents 必讀

把 Linux「process」的設計哲學搬進 Agent:每個 agent 有自己的 ID、能力表、記憶體與稽核記錄,工具只是 wrapper,真正的控制邊界在 runtime 核心。

arxiv: 2606.03895
2026-07-08
Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents 必讀

問題不是 RL 演算法不夠好,而是缺乏讓 agent 在生產中「邊跑邊進化」的系統基礎設施;這篇提出三大工程支柱讓企業規模的 agent 能持續自我更新。

arxiv: 2607.01120
2026-07-10
From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents 必讀

讓 Agent 把反覆做過的「多步驟工具流程」萃取成可重用的 SOP(標準作業程序),下次遇到類似任務直接呼叫,避免重新發明輪子,任務成功率提升 2.5%~13.4%。

arxiv: 2607.07321
2026-07-10
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents 必讀

長任務 Agent 不應把所有對話歷史塞進 context,而應用「有界合約」:每個決策的輸入由五個有型別的記憶層結構化提取而來,prompt 大小始終有限。用《Slay the Spire 2》幾百回合的連續決策當 testbed,並公開 298 條軌跡供比較研究。

arxiv: 2607.02255
2026-07-13
Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems 必讀

Amazon 把 agent 每次都要「重新生成」的固定操作程式碼,預先離線編譯成版本化工具——生產環境 p50 延遲降 42%、錯誤率降 53%。

arxiv: 2607.08010
2026-07-13
Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents 必讀

另開一個「記憶 agent」並行跑在行動 agent 旁邊,在關鍵時刻主動把重要資訊推送給它——Terminal-Bench 2.0 提升 +8.3pp,τ²-Bench 提升 +6.8pp。

arxiv: 2607.08716
2026-07-17
To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning 必讀

教搜尋型 agent「在不確定時說我不知道」:動態調整 RL 訓練中的棄答獎勵,讓 agent 主動拒答而非亂猜,精準度最高提升 10.3%。

arxiv: 2607.10738
2026-07-18
Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents 必讀

把 agent 的記憶體操作(要不要取、何時忘)變成一個小型強化學習問題,讓 agent 邊跑邊自學最佳策略,不用改底層記憶體實作。

arxiv: 2607.13591
2026-07-19
Self-Improvements in Modern Agentic Systems: A Survey 必讀

用統一公式整理「agent 怎麼從自己的執行經驗中學習和進化」,把所有方法按「更新什麼」和「用什麼訊號更新」兩個維度分類。

arxiv: 2607.13104
2026-07-19
MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents 必讀

持久記憶讓 agent 記得過去,但也讓攻擊者能「先植入一段話,等之後特定情境出現時 agent 自動執行惡意行為」——這篇建立 1,227 個案例的 benchmark,量化這個威脅有多嚴重。

arxiv: 2607.14651
2026-07-21
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration 必讀

搜尋型 agent 老是卡迴圈?SearchOS 把搜尋進度變成「顯性的共享狀態」,加上失敗記憶機制,讓 multi-agent 協同搜尋比 baseline 快 24%、F1 提升 4.3 分。

arxiv: 2607.15257
2026-07-24
Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents 必讀

整合 27 篇 Agent 評測論文,歸納出六大失敗類別,讓你知道你的 Agent 最可能在哪裡翻車。

arxiv: 2607.05775
2026-07-24
Profile-Graph Memory for LLM Agents: Implicit Cross-Entity Traversal through Narrative Profiles 略讀

讓 Agent 的長期記憶可以串聯多個人物資訊來回答問題,不再只是「問誰就找誰的資料」,而是能自動沿著人際關係跳躍推理。

arxiv: 2607.19359
2026-07-29
ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems 必讀

把幾個「安全的」模型串在一起,整條 pipeline 不會自動變安全。2,100 條攻擊測試後發現,現有多 Agent 系統的防護幾乎都靠雲端供應商的伺服器端過濾器在撐,換個 backend 就破防。

arxiv: 2607.19430

相關 Digest(35 篇)

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-29

calesthio/OpenMontage 用 12 條產線、700+ 個 skill 檔把通用 coding agent 變成影片後製棚,本週衝上 5 萬星;Anthropic 官方外掛市集 claude-plugins-official 單日 +292 星;rohitg00/agentmemory 用 BM25+向量+知識圖譜做 coding agent 跨 session 記憶,自家 benchmark 宣稱 LongMemEval-S R@5 95.2%;sodiumsun/agenttrail 幫 Claude Code / Codex / Cursor 做本機即時任務地圖。今日框架端無重大 release。

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-28

thedotmack/claude-mem 用壓縮記憶讓 context 跨 session 存活,總星數破 9 萬;volcengine/OpenViking 把記憶/RAG/skills 統一成用 viking:// 協定瀏覽的虛擬檔案系統,本週 +3,078 星;apache/maka 進 Apache Incubator,把 agent 執行過程做成可回放的 event-sourcing log;K-Dense-AI/scientific-agent-skills 讓 17.5 萬科學家用 163 個 skill 把通用 coding agent 變成領域專家。Haystack v3.1.0 加入 AgentTool 支援多 agent 委派。

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-20

Volcengine(字節跳動旗下)開源 OpenViking,用 viking:// 虛擬檔案系統取代黑盒向量搜尋做 Agent 記憶,官方測試把準確率拉到 80%+ 同時省 34–91% token;munder-difflin 把多個 coding CLI 包成桌面辦公室、用共享記憶層互相協作;ai-memory 用 Rust MCP server 解決『換 CLI 就失憶』的痛點;mukul975 的資安技能包一天內衝到近 2.8 萬星。pydantic-ai v2.32.0 補強 OpenRouter/xAI 附件搜尋與 instrumentation。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-19

QUMem 用情節切分加三階段 agent 推斷使用者狀態,在 KnowU-Bench 整體成功率贏最強 baseline 4.6 個百分點;LENS 免索引邊查邊定位證據,證據召回率 84.8% 遠勝 ReAct 基線的 50.4%,索引過期情境下完全不掉分;Intent-Guided Decoding 在解碼期仲裁檢索內容與模型記憶,事實衝突基準最高帶來 65.4 個百分點的準確率增益

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-17

RippleMem 靠聯想式記憶擴散讓 LongMemEval-S 準確率最高提升 11.87%,同時把記憶圖建構成本壓到 1/30;Total Recall at What Cost? 量出記憶系統的服務成本誤差可達 18–69%,且沒有一套系統同時贏成本和準確率;MESA 用動態選記憶結構在 AMA-Bench 上準確率高 8.5%,還省下 41% 證據 token

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-15

SkillEvo 用多輪互動回饋取代單輪 QA 評估,讓技能進化不會在第一輪就停滯,比自我反思進化高 23 分;SkillShapley 把 Shapley 值搬進技能步驟歸因,用 99 次評估就能逼近精確排序,並發現「決策橋接步驟」才是高價值步驟;MindMemOS 用實體-屬性-時間結構統一記憶管理,LOCOMO 準確率 94%,技能進化讓 SpreadsheetBench 成功率提升 9.2 個百分點

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-08

Memory Reward Inflation 發現自我改善 Agent 的記憶獎勵會自我膨脹,錯誤經驗越用越自信,LUCID 演算法在 BIRD 上將準確率從 54.0% 提升到 56.9%;RoMeRL 用固定維度的語意座標壓縮記憶狀態空間,Cold-Q 比率降 80%、LLM 呼叫減 21.1%;ToolLIFT 將工具軌跡抽象成功能層級工作流圖,在三個 OOD 基準上一致超越現有方法

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-25

今天三篇從三個互補角度探索「讓 Agent 更可靠地解決複雜任務」。NVIDIA 提出把 Agent 寫成普通的 Python class,讓開發、測試、追蹤都像一般軟體一樣進行;BAAI 的 AREX 展示了能遞迴驗證並改良自身研究結論的深度研究 Agent,在 BrowseComp、HLE 等基準上超越同量級模型;第三篇爬梳 1,250 篇論文,為「AI 自我改良」這個混亂詞彙建立清楚的分類地圖,幫你分辨哪些技術已可落地、哪些還在研究階段。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-21

今天三篇論文從不同層面回答同一個問題:「怎樣才算一個真正能用的 agent 系統?」SearchOS-V1 給出架構答案——把搜尋進度外顯成結構化狀態、記錄失敗路徑,讓 multi-agent 協作搜尋更可靠;AutoSynthesis 展示高度結構化的學術任務(系統性文獻統合分析)可以被 multi-agent 流水線全自動化;Digital Pantheon 則解決「如何讓 agent 在壓力下維持既定人設」的角色工程問題,並引入可審計的多 agent 協商架構。三篇合看,分別對應 agent runtime 設計、workflow 編排、與人設工程三個核心挑戰的最新解法。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-13

今天三篇論文共同呼應一個趨勢:生產環境 agent 的瓶頸已不在模型能力,而在「狀態管理」。第一篇(Amazon)展示把重複步驟預先編譯成工具,可讓 p50 延遲降 42%、錯誤率降 53%;第二篇提出讓獨立記憶 agent 主動把關鍵狀態「推送」給行動 agent,解決長程任務中資訊遺失(behavioral state decay)的問題;第三篇以遞迴多 agent 架構克服單一 agent 無法同時廣又深的 web 研究限制。三篇合看:**工具化(tool compilation)、主動記憶(proactive memory)、遞迴分工(recursive orchestration)*

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-12

今天三篇論文圍繞兩大主軸:**安全**與**評測**。Prismata 在頁面層阻止跨站提示注入攻擊;aiAuthZ 在工具呼叫層建立加密身份授權閘道——兩篇合力說明 LLM 本身不該是安全邊界,平台必須在架構層設防。第三篇 UniClawBench 則把 agent 評測從沙箱搬進真實世界,用「能力維度」取代「任務情境」做診斷,給平台工程師一把更好用的選模型與排查失敗的尺。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-10

今天三篇論文共同描繪 Agent 平台的「進化前線」:EvoSOP 讓 Agent 不再每次從零重組工具,而是從過去執行歷程中自動萃取可重用的 SOP,讓工作效率顯著提升;AgenticSTS 對長任務記憶提出嚴格的「有界合約」設計,用五層結構化提取取代無止盡的 context 堆疊;Spider 2.0-AIFunc 則揭示 AI 函式已被直接嵌入雲端 SQL 語法,但最強模型準確率僅約 67%,是資料 Agent 必須面對的新挑戰。三篇合看:從工具效率、記憶架構到資料能力,勾勒出 2026 年 Agent 平台亟需補強的三個關鍵短板。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-09

今天三篇論文從不同維度敲響「Agent 安全警報」:FARMA 能以 100% 成功率悄悄竄改 Agent 的推理記憶,繞過現有所有防禦機制;Vera 框架對 4 套生產級 Agent 系統(含 Claude Code)做系統化安全測試,平均攻擊成功率高達 93.9%;PiSAs 則揭示在多用戶共享 Agent 環境中,資訊跨用戶洩露是個未被充分關注的嚴重問題。三篇合看,是任何正在部署 Agent 平台的工程師與 PM 必須面對的安全現實。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-08

今天三篇論文聚焦同一個核心問題:現有 AI Agent 系統在「理想實驗室」與「真實部署」之間存在巨大落差。AgentGym2(ACL 2026)用新 benchmark 量化了評測的失真;Agentic RL 系統提出讓 agent 在生產環境持續自我進化的工程架構;ComfyClaw 則展示在圖像生成工作流中落地「技能自我進化」的完整範例。三篇合看,正是一張從「評測 → 部署 → 運行中進化」的完整地圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-04

今天三篇各自揭露了 agent 系統的一個評估盲點:記憶讓 agent 更「諂媚」卻少被測試(MemSyco-Bench);現有安全 benchmark 把所有失敗壓成 pass/fail,分不清真正原因(Adversarial Pragmatics);多個 LLM agent 組成的集群,因為以自然語言溝通,反而比黑箱神經網路更容易解讀(Conversable Complexity)。三篇合起來的訊息:我們評估 agent 系統的方式,需要全面升級。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-02

今日三篇分別瞄準 Agent 平台的三大核心難題:**記憶如何從「撈資料」升級成「推理狀態」**(User as Code)、**多 Agent 如何去掉中央協調者卻更省成本**(DeLM),以及**Web Agent 執行後如何讓人快速驗證結果**(HANSEL)。三篇合在一起,幾乎就是一張高信任 Agent 平台的技術地圖——記憶層、協調層、可解釋層各攻一塊。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-29

今天三篇從不同角度剖析「Agent 走向生產級基礎設施」的挑戰:Agent libOS 回答「agent 的 runtime 底層該長什麼樣子」;Autodata(Meta FAIR)示範「agent 如何自己製造並持續優化訓練資料」;GAIE 則提出「企業在法規約束下如何分級監督 coding agent」。三者合看,描繪出 agent 平台從架構、資料到治理都需要重新設計的完整藍圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-28

今天三篇分別從不同層次切入「打造生產級 Agent 系統」:一本涵蓋 LLM 基礎到 multi-agent 架構的全棧實用指南、一個讓 Agent 在長任務中自主決定何時壓縮上下文的輕量 scaffold、以及一篇把 Agent 強化學習信用分配從「工具呼叫點」精細到「token 層級」的訓練演算法。三篇合起來,正好串起「學什麼架構」、「跑起來怎麼穩」、「怎麼訓得更好」三個打造 Agent 平台的關鍵問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-27

今天三篇從不同角度觸碰 Agent 平台的核心痛點:一篇把 Agent 記憶體拆成四個可量測的系統模組,揭示現有評估只看「答對沒」根本不夠;一篇借用軟體工程「設計審查」觀念,讓 Agentic Workflow 在上線前就能被自動驗證;另一篇用 14 組大規模平行實驗證明——你信任的那個 benchmark 排行榜,換個情境排名就洗牌,並提出更可靠的替代指標。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-20

今天三篇由三個不同角度探問「讓 Agent 更可靠」:EinsteinArena 提出讓多個 AI agents 彼此共享解題思路與失敗記錄的持久化平台,已在數學難題上集體找到 12 個人類從未發現的新最佳解;APEX 把 agent 自我演化從「只改 prompt」擴展到同時演化行為原則(principles)和工作流拓撲(topology)三層並進;AI Economist Agent 則示範如何用知識圖譜 + 正式計量模型替 LLM 的每一個定量聲明上鎖,讓報告每個數字都能追溯到具體計算。三篇合讀的訊號:Agent 系統的下一個競爭維度,是如何設計讓 agents 集體共享知識的基礎設施

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-17

今天三篇從不同角度挑戰「agent 工具使用與記憶」的基本假設:Evoflux 揭示小模型在 MCP 工具目錄前幾乎失能(執行成功率僅 3%),並用推論時演化搜尋把數字拉到 17-24%;FlowBank 指出 agent workflow 不必每次重新生成,預計算多樣化 workflow 倉庫再智慧路由,比手工設計高出近 15%;GitOfThoughts 則帶來最反直覺的發現:記憶對 agent 只在「問題幾乎一樣」時才有用,但 git 版本控制提供了一條以稽核性換取的工程之路。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-14

今天三篇論文從不同角度切入同一核心問題:**如何在真實部署條件下評估與運行 AI Agent?** Emergence World 建立持續運行數週的多 Agent 沙盒,揭露短期 benchmark 看不到的行為漂移與跨模型交叉影響;Survey 論文為 agent 執行環境設計建立完整分類學(8 屬性 × 8 領域),並提出 symbolic vs. neural 兩種自動合成範式;Martin Monperrus 的 position paper 則直接宣告:coding agent 已達門檻,人工 code review 可以退場了。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-13

今天三篇分別從「記憶架構」、「訓練效率」、「可靠度評估」三個角度切入 Agent 平台的核心挑戰。HORMA 提出階層式檔案系統記憶架構,讓 Agent 在長工作流程中不再因 context 暴漲而崩潰;TRACE 重新設計 Agent RL 訓練的 rollout 分配邏輯,同樣算力讓 Multi-Hop QA 多學 2.8 個百分點;τ-Rec 則揭露多輪對話推薦 Agent 的「可靠度斷崖」——連最強模型連跑四次的可靠度也只剩 38%,這個數字對任何計劃上線 Agent 產品的團隊都是當頭棒喝。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-07

今天三篇都在問 agent 平台的「基礎建設怎麼選」:ADK Arena 首度量化比較 LangGraph、AutoGen、CrewAI 等多個主流框架的真實任務完成率與成本差距,讓框架選型終於有量化依據;Agent Memory 提供第一個從電腦系統視角分析 10 種記憶方案的 taxonomy,幫工程師評估延遲、頻寬、可擴展性的取捨;Search-Time Contamination 則質疑 deep research agent 的 benchmark 分數可信度——agent 在評測時可以直接搜到答案,分數最多虛高 4%。三篇合看,agent 平台的三個核心決策點(框架選型、記憶架構、

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-03

今天三篇論文從 agent 記憶的「互通標準化」、「隱層效率化」、到「預算感知缺失」三個維度切入:第一篇獨立研究者提出跨框架記憶電線格式,試圖解決 mem0、Letta、Cognee 各自為政的碎片化;第二篇把過去經驗的「文字塞 context」改成在 LLM 隱層空間做向量檢索,12/13 benchmark 最佳;第三篇是多機構大型評測,揭露五大 frontier 模型全都過度樂觀、無法在中途感知「這任務預算不夠用」,任務強≠預算感知強(r=0.35)。三篇合看:記憶標準化難題 → 記憶效率新架構 → 部署成本的系統性盲點。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-02

今天三篇論文從不同角度解決 Agent 平台的核心痛點:第一篇提出把 LangGraph 那種「外掛 orchestrator」邏輯直接燒進小模型 weights,讓每對話成本降低 128–462 倍;第二篇來自 IBM Research,打造自動分析 agent 執行行為的三層評估框架,解決「agent 出了問題不知道哪個環節壞掉」的困境;第三篇來自 Microsoft,提出 agent 記憶的跨平台可攜帶協議,讓 Claude / GPT-4 / Gemini 之間可以交接記憶而不丟失狀態。三篇合看,恰好覆蓋 agent 平台的部署效率 → 行為評估 → 記憶可攜性三個關鍵面向。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-01

今天三篇論文聚焦「agent 規模化部署的成本-能力邊界」:SR²AM 重新設計規劃架構,讓 30B 模型少用九成 token 就能競爭 685B-1T 系統;GroupMemBench 揭示現有記憶系統在多人群組對話中徹底崩潰(最強系統只有 46% 準確率,1990 年代的 BM25 關鍵字搜尋反而打贏它);AgentFloor 用 16,542 次測試確認,agent pipeline 大量的短程 tool use 根本不需要大模型。共同主軸:在算力成本壓力下,精確判斷「哪個環節需要多少智慧」已成為 agent 平台設計的核心課題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-26

今天三篇分別從三個基礎設施層面深挖 Agent 平台:微軟提出仿人腦六機制的記憶管理架構,在大型 codebase 資料上讓記憶庫壓縮 58% 還保住 97.2% 精確率;Megagon Labs 的研究顛覆「逐步推理」慣例,證明先生成完整計劃再批次執行工具可省 2–4.7x token;最後一篇借用神經科學工具,讓 multi-agent 通訊拓撲(Chain / Star / Mesh)的架構選擇從猜測變成可計算的診斷。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-25

今天三篇圍繞 2026 年 agent 平台最迫切的問題:**多代理系統的安全規範,在執行過程中能維持住嗎?** 2605.10481 命名了一個新失效模式——「約束漂移」(constraint drift):系統設計時寫好的安全限制,會在代理人傳遞、記憶讀寫、工具呼叫過程中悄悄弱化,到輸出端時早已走樣。2605.07728(SARC)提出架構解法:把規範編譯成四個可執行卡關點,嵌進代理人執行迴圈,不再依賴 prompt 提醒,已開源。2605.13851 則用心理學實驗發現:當多代理系統的協調者是「隱形的」,整個系統的保護性行為會顯著下降——這對主流 orchestrator-based 架