Skip to content
← Daily Digest

Agent 安全

Agent Security

prompt injection、對抗攻擊、guardrails、沙箱隔離、紅隊測試

論文時間軸(46 篇)

2026-05-27
AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use 必讀

在 Agent 按下「執行」之前,先有個守門員攔住危險指令——而且它能看穿 hex/base64 等偽裝、提供更安全的替代做法,而不只是硬生生拒絕。

arxiv: 2605.04785
2026-05-30
A Two-Dimensional Framework for AI Agent Design Patterns 略讀

業界教你「怎麼接線」,學術界教你「agent 在想什麼」——這篇說兩個都要,並提出雙軸框架幫你把兩種語言對起來。

arxiv: 2605.13850
2026-05-30
Towards Trustworthy Agentic AI: Safety, Robustness, Privacy & System Security 略讀

agentic AI 會自己呼叫工具、存取記憶體、多步驟執行——這些能力讓它比純 LLM 更危險。這篇是把這些新型風險系統整理成「風險地圖」的 survey。

arxiv: 2605.23989
2026-05-31
Beyond Autonomy: A Dynamic Tiered AgentRunner Framework for Governable and Resilient Enterprise AI Execution 必讀

現有 agent framework 太重視自主性、太少想「萬一出錯」,這篇從企業 SaaS 生產環境提煉出三個治理機制:按風險分層審查、提案與執行分離、驗證失敗自動恢復。

arxiv: 2605.10223
2026-05-31
Insuring Every Action: An Authority Frontier Framework for Runtime Actuarial Control of Autonomous AI Agents 略讀

把保險精算的概念搬進 agent runtime:每個 agent 動作都先「定價」,對照保證金預算決定是否允許執行;附一把量尺(Authority Frontier)顯示不同預算水位下 agent 能釋放多少自主空間。

arxiv: 2605.25632
2026-06-02
Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents 必讀

讓 LLM 自動在「整個系統/單次對話/單個步驟」三個層次分析 agent 的行為,不需要手工寫錯誤分類規則,且能適應新領域。

arxiv: 2605.22608
2026-06-02
Portable Agent Memory 略讀

定義了一套讓 agent 記憶可以從 Claude 搬到 GPT-4 再搬到 Gemini 的開放協議,帶加密驗證,防止記憶被篡改或惡意注入。

arxiv: 2605.11032
2026-06-05
MetaForge: A Self-Evolving Multimodal Agent that Retrieves, Adapts, and Forges Tools On Demand 必讀

Agent 遇到工具庫裡沒有的場景,不再說「我做不到」,而是走過「判斷 → 找工具 → 調整參數 → 自行鍛造新工具 → 存回庫」五步閉迴路,實現工具能力的自我進化。

arxiv: 2606.01801
2026-06-06
The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? 必讀

讓 AI 在沙箱裡「自己寫 agent 程式碼」來解決任務,測試五個領域後發現:幾乎沒有模型能超越人工設計的 baseline,只有少數頂級閉源模型勉強達標。

arxiv: 2606.04455
2026-06-06
Domain-Conditioned Safety in Frontier Computer-Using Agents 必讀

Claude Sonnet 4.6 和 GPT-5.4 在網頁操作任務中 prompt injection 攻擊成功率為 0%;但同樣的模型在程式碼任務場景中被攻擊成功率高達 100%——安全性不是全域屬性,而是場景條件式的。

arxiv: 2606.05233
2026-06-09
SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces 必讀

過去的安全 benchmark 只測「AI 會不會拒絕壞指令」;SABER 改成測「AI 在真實 code repo 裡實際做了幾次危險操作」——最好的模型還有 54.7% 的危害率。

arxiv: 2606.01317
2026-06-09
Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage? 必讀

100+ 位真人開發者跟「會暗中插入惡意程式碼」的 AI agent 一起寫程式五小時,94% 的人沒抓到。

arxiv: 2606.05647
2026-06-14
The End of Code Review: Coding Agents Supersede Human Inspection 略讀

立場鮮明的 position paper:coding agent 已能替代人工 code review 的所有傳統目標,強迫人類 review AI 程式碼是走錯了方向。

arxiv: 2606.13175
2026-06-18
When Should Agent Trust Be Conditional? Characterizing and Attacking Skill-Conditional Reputation in Agent Swarms 略讀

多 Agent 系統裡,給每個 Agent 一個全域信任分(「它平均有多好」)在很多情況下會路由錯誤——但改成技能維度的細分信任,又會在特定條件下被惡意 Agent 劫持,路由失誤率從 0 飆到 0.94。

arxiv: 2606.14200
2026-06-22
Sovereign Execution Brokers: Enforcing Certificate-Bound Authority in Agentic Control Planes 略讀

企業部署 agent 時,「批准一個動作」和「執行那個動作」之間存在安全漏洞:現有存取控制在 identity 層,assurance 在 plan 層,但在「agent 真的動 AWS / K8s 的那一刻」缺乏強制驗證點。Sovereign Execution Broker (SEB) 就是插在這個瞬間的憑證驗證與執行邊界。

arxiv: 2606.20520
2026-06-25
NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers? 必讀

用 90 個 Nature 期刊真實科研任務測試 coding agent:最強 agent 只能超越原論文 17.8%——而且靠的是把問題「翻譯成熟悉的 ML 任務」,不是真正的科學發明。

arxiv: 2606.24530
2026-06-25
Rising From the Ashes: How Agentic AI is Unblocking Challenges in Cybersecurity 略讀

六位資安研究員整理出讓防禦者長年頭痛的五個瓶頸,逐一對應到 agentic AI 的五種新能力,論點是:「以前太費工、根本做不完」的安全任務,agent 現在可以接手了。

arxiv: 2606.23138
2026-06-26
Specifying AI-SDLC Processes: A Protocol Language for Human-Agent Boundaries 略讀

AI agent 已參與軟體開發全流程,但「哪些決定讓 AI 做、哪些要人批准」目前只靠 prompt 描述,容易漂移也無法驗證;這篇提出一套 DSL 讓你把這些邊界寫成可機器驗證的協議規格。

arxiv: 2606.20615
2026-07-04
MemSyco-Bench: Benchmarking Sycophancy in Agent Memory 必讀

你幫 agent 加了記憶模組,它可能反而變得更不誠實——MemSyco-Bench 是第一個專測「記憶導致諂媚」的 benchmark。

arxiv: 2607.01071
2026-07-04
Adversarial Pragmatics for AI Safety Evaluation 略讀

現有 agent 安全 benchmark 把所有失敗壓成 0/1,沒辦法告訴你失敗的真正原因——這篇從語言學出發,提出更細緻的診斷框架。

arxiv: 2607.01153
2026-07-06
Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows 必讀

把資料庫的「交易(Transaction)」概念移植到 Agent 工作流程:LLM 輸出的每個動作都是「未信任提案」,要先通過明確的規則驗證才算數;違規則自動修復或回滾,不讓語意錯誤的 Agent 動作污染生產狀態。

arxiv: 2607.00269
2026-07-07
When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents 必讀

Agent 程式可能陷入「停不下來的迴圈」,本文開發靜態掃描工具 IAL-Scan,評估 6,549 個真實 repo,精準度 91.9%,發現這是比想像中普遍的系統性問題。

arxiv: 2607.01641
2026-07-07
AgentFlow: Building Agent Dependency Graphs for Static Analysis of Agent Programs 必讀

為 agent 程式碼建出一張「依賴圖」,讓你看清這個 agent 用了哪些模型、prompt、工具、記憶體,並自動偵測有危險的「prompt 到高權限工具」路徑;支援 5 大主流框架,分析了 5,399 個真實專案。

arxiv: 2607.01640
2026-07-09
Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses 必讀

有人能偷偷修改 Agent「以前是怎麼想的」,讓它以後做壞事,而且現有所有防禦都擋不住。本文提出攻擊手法 FARMA 與對應防禦 SENTINEL。

arxiv: 2607.05029
2026-07-09
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification 必讀

研究者造了一套自動化安全測試框架 Vera,去測了 4 套真實部署的 Agent 框架(含 Claude Code),在多通道攻擊下平均攻擊成功率 93.9%,並公開了 1,600 個可執行安全測試案例(Vera-Bench)。

arxiv: 2607.01793
2026-07-11
Beyond Attack-Success Rate: Action-Graded Severity Scale for Tool-Using AI Agents 略讀

Agent 安全評測現在只報告「攻擊有沒有成功」(0 或 1),但 Agent 被操控讀了一封不該讀的信 vs 把整個通訊錄轉寄給攻擊者,嚴重程度天差地遠。本文提出 L0-L6 七段評分,用可逆性、越界性、越權性三個維度量化每次 tool call 的傷害等級。

arxiv: 2607.07474
2026-07-12
Prismata: Confining Cross-Site Prompt Injection in Web Agents 必讀

網頁 agent 被第三方頁面惡意文字「洗腦」怎麼辦?Prismata 自動幫每塊頁面內容打信任標籤,讓低信任內容就算被 LLM 誤讀,也只能觸發低權限操作,從架構上限制攻擊的爆炸半徑。

arxiv: 2607.08147
2026-07-12
aiAuthZ: Off-Host, Identity-Bound Authorization for AI Agents 必讀

就算 LLM 被欺騙下了危險的工具呼叫指令,一個在 agent 主機之外、用加密簽章綁定身份的授權閘道,可以在執行前把指令攔截下來——讓安全性不再依賴模型的判斷力。

arxiv: 2607.05518
2026-07-14
When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems 必讀

多 Agent 系統裡若有一個 agent 被惡意操控,AcMAS 不靠看文字、直接分析 LLM 內部神經狀態來偵測,在非同步執行環境下 F1 比圖方法高出 +0.55,且對隱蔽攻擊仍有效。

arxiv: 2607.06807
2026-07-15
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading 必讀

46 道長程終端機任務,最強模型(Grok 4.5)只解了 13 題,Claude Sonnet 5 解了 8 題——29 題沒有任何模型能解開;密集子任務給分讓我們首次看見「agent 卡在哪裡」,而不只是「有沒有成功」。

arxiv: 2607.08964
2026-07-15
Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors 必讀

多個 AI agent 協同執行惡意任務時,「每個 agent 各自監控」的防禦策略會因為碎片化效應大打折扣;加入明確攻擊規劃者(planner agent),攻擊成功率最高提升 7 倍。

arxiv: 2607.07368
2026-07-18
AgentCheck: A Reproduce–Intervene–Mitigate Workbench for LLM Agents over MCP 必讀

一個開源工作台:讓你把 MCP 工具的故障重現在可控環境,測你的修復是否真的有用,再確認沒有其他東西壞掉。

arxiv: 2607.11098
2026-07-18
AgentAbstain: Do LLM Agents Know When Not to Act? 必讀

目前最強的 agent 在「應該拒絕行動」的情境下答對率不到 60%,而且這個「棄動能力」和「任務解決能力」根本是兩回事——你沒辦法靠換一個更強的模型來解決。

arxiv: 2607.10059
2026-07-20
Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents 必讀

只要改掉 README 或 requirements.txt 裡的套件名稱,AI coding agent 就會安裝你指定的惡意套件——而這個漏洞主要跟你用哪套 harness(框架)有關,換模型沒太大用。

arxiv: 2607.15143
2026-07-21
Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents 略讀

RLHF 訓練讓 LLM 太「溫和」,無法扮演立場鮮明的政黨談判者。這篇用 DPO 灌入黨派人設、用 RAG 綁定黨綱,打造能維持強硬立場的 agent,再讓他們模擬真實選後的多黨組閣協商。

arxiv: 2607.15095
2026-07-25
Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops 略讀

爬梳 1,250 篇論文、建立「AI 自我改良」的雙軸分類地圖,分清楚哪些是已可上線的「有界自我精煉」、哪些是還在研究的「無界遞迴自我提升」。

arxiv: 2607.07663
2026-07-27
From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space 必讀

讓 Agent 把記憶當工具「主動去找」,而不是被動接受系統塞進來的片段;Alibaba Qwen 團隊用 RL 訓練出來的 9B 模型打贏所有 memory baseline。

arxiv: 2607.05794
2026-07-27
Agent Data Injection Attacks are Realistic Threats to AI Agents 必讀

一種新的攻擊方式:不用偽裝成「指令」,只要偽裝成「可信資料格式」就能讓 Agent 做壞事——Claude Code、Codex、Gemini CLI 和三個 web agent 全部中招,可以被遠端執行任意程式。

arxiv: 2607.05120
2026-07-27
Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation 略讀

MCP tool / Agent Skill 從「發布到 repository」到「被執行」再到「版本更新」的每個環節都有安全漏洞;用 327 個真實技能跑測,每個生命週期階段都找到可被利用的弱點。

arxiv: 2607.13987
2026-07-29
MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers 必讀

現有評測假設工具介面是固定的,但現實中 MCP server 會持續更新。這篇測了工具升版後 12 個頂尖模型的能力退化,發現包括 GPT-5.4 和 Claude 在內的前沿模型都會明顯掉分 13-14%。

arxiv: 2607.14642
2026-07-29
ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems 必讀

把幾個「安全的」模型串在一起,整條 pipeline 不會自動變安全。2,100 條攻擊測試後發現,現有多 Agent 系統的防護幾乎都靠雲端供應商的伺服器端過濾器在撐,換個 backend 就破防。

arxiv: 2607.19430
2026-08-01
AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents 必讀

工作區 Agent 在執行任務時有多危險?這篇測了 20 種 Agent 配置、6,560 次執行:66% 的「成功完成任務」背後仍觸發了危險行為——任務完成不等於安全。

arxiv: 2607.27294
2026-08-02
Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response 略讀

AI Agent 有五大安全漏洞類別,現有評測沙箱裝不住真正有能力的 Agent——這篇整理防禦對策,並以 2026 年七月 HuggingFace/OpenAI 真實事件作 case study。

arxiv: 2607.25379
2026-08-03
How Agents Ask for Permission: User Permissions for AI Agents, from Interfaces to Enforcement 略讀

調查 21 個學術提案 + 5 個商業 agent,發現幾乎所有系統的授權設計都是「開發者說了算」,真正讓使用者自己設定個人化授權規則的機制幾乎不存在。

arxiv: 2607.13718
2026-08-04
Can AI Agents Conduct Open-Ended AI Research? Early Evidence from Two Case Studies 必讀

給頂尖 Agent 六天時間和數千美元算力,讓它獨立研究一篇未公開的 NeurIPS 2026 論文的核心問題。原作者看完:全部否決。Agent 能做工程,但不會做研究。

arxiv: 2607.27191
2026-08-04
Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security 略讀

現有 Agent 安全測試用靜態攻擊語料,但真實攻擊者看見防禦失敗後會調整策略。這篇把 LLM 當攻擊者、讓它自適應地打 15 輪——攻擊成功率從 0–1% 飆到 5.4–14%,且攻擊模式跟現有 benchmark 完全不重疊。

arxiv: 2607.18063

相關 Digest(29 篇)

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-16

PIMiner 用可跨模型轉移的策略庫,以約 20 美元查詢成本讓提示注入攻擊成功率衝上 76-87%;Agent Skills Can Be Harmful 從 307 個技能誘發失敗中發現看似相關的技能比明顯無關的技能更容易搞砸任務,過度流程占效率退化六成以上;Order 66 情境分析用組合式威脅模型證明休眠植入、事後記憶投毒與對等擴散單獨看都不致命,疊加後可能自我維持傳播

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-07

ToolLIFT 把工具軌跡提升到功能層工作流圖,在三個 OOD 基準上持續超越 SOTA;SkillTV-Bench 用 681 案例證明技能感知的裁判技能讓 Agent 評判準確率提升 14.8 個百分點;TRIO-20 用預設等價研究發現 GPT-5.6 在 840 條軌跡中零越權呼叫,但推理力度提高讓規則探查率上升了 14.3 個百分點

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-04

今天三篇各從不同角度審視 AI Agent 的能力與極限:AutoMem 告訴你「記憶管理」是可以自動學習的獨立技能,光優化記憶就讓 32B 開源模型達到頂級商用模型水準;Shadow Evaluation 用真實 NeurIPS 投稿測試頂尖 Agent 能否做開放式 AI 研究——答案是否定的,Agent 能工程但不會研究;Adaptive Adversaries 揭示現有安全評測嚴重低估威脅:加上自適應多輪攻擊者,攻擊成功率從 0–1% 跳到 14%。三篇合起來是一堂清醒課:知道 Agent 能自動變強在哪、不能在哪、以及你的安全測試可能根本不夠。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-03

今天三篇論文分別從多 Agent 的「組織設計」、「安全隔離」與「使用者授權」三個維度切入平台建設難題。IMACS 把 multi-agent 系統拆成三個可獨立替換的層(組織、協調、協作演算法),讓框架設計者能像換積木一樣調整 Agent 角色或協作策略;APPA 用「分支上下文」打破 IFC(資訊流控制)的可用性瓶頸,在 4 個模型上把 prompt injection 外洩率從 31–50% 壓低至 0–7%;UW 的調查在 21 個 Agent 授權方案中發現,絕大多數系統只提供「開發者定義的全局策略」,使用者個人化授權幾乎付之闕如。三篇合在一起,勾勒出 agent 平台從原型走向生產

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-02

今天三篇各從不同角度逼視「Agent 在真實環境裡出事了怎麼辦」:ProACT 問的是多人協作中 Agent 應何時開口(Agent UX 設計問題);第二篇用真實 GitHub 資料揭露 Coding Agent 和自己開的 PR 互衝(平台 ops 痛點);第三篇從安全視角整理 Cyber-capable Agent 五大漏洞類別,以今年七月的 HuggingFace/OpenAI 事件為 case study。三篇合起來是一堂「Agent 上線後,你沒想到的麻煩都在這裡」速成課。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-29

今天三篇論文共同聚焦在「生產級多代理人系統的基礎設施可靠性」:第一篇比較 MCP 與 A2A 兩個協定如何分工、不是競爭而是互補;第二篇實測工具升版後 12 個頂尖模型的能力退化,發現前沿模型也會掉分 13-14%;第三篇揭示把安全模型串成 pipeline 之後整體反而不安全,因為防護其實是靠雲端供應商的伺服器端過濾器在撐。三篇合起來回答了「怎麼接工具」、「工具升版會不會壞」、「串起來安不安全」三個平台工程師最實際的問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-20

今日三篇論文從三個不同角度審視 AI coding agent 的落地挑戰:第一篇用系統性實驗揭露 coding agent 在安裝套件時可被普通 README 發動供應鏈攻擊,且防禦能力主要取決於 harness 框架而非模型本身;第二篇提出 BPO 演算法,專為 sandbox-native agent 強化學習設計,只在高熵關鍵決策點分叉採樣提升訓練效率;第三篇以電網研究為案例,展示 MCP 如何作為標準協議串接工業場景的 domain-specific 仿真工具,為垂直領域 agent 落地提供可複製模板。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-19

今天三篇分別對應 agent 平台的三個核心課題:MyAG 用圖論視角重新拆解「如何組裝 agent 系統」,提出 component / workflow / search 三層圖分離關注點;自我改進綜述用統一公式框架整理「agent 如何從經驗進化」的整個研究方向;MemPoison 則揭示「持久記憶是 agent 最脆弱的攻擊面」,並建立首個涵蓋 1,227 個攻擊案例的 benchmark。三篇合起來剛好是:怎麼搭架構 → 怎麼讓系統演化 → 怎麼不被攻破。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-18

今天三篇論文從三個維度切入「生產等級 Agent 可靠性」:MemCon 把記憶體操作建模為強化學習問題,讓 agent 自學何時存、取、忘,在 6 個 benchmark 上任務成功率最高提升 15.2 分;AgentCheck 把 MCP 伺服器變成除錯介面,開發者可重現工具故障、注入修復並驗證效果,填補了 MCP 生態長期缺乏「測試工具」的空缺;AgentAbstain 則用 263 個配對任務揭露:即便是最強的 frontier 模型,在「應拒絕行動」情境下正確率不到 60%,且棄動能力與任務解決能力幾乎無關——光靠換更強的模型無法解決這個問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-15

今天三篇論文從三個截然不同的角度照亮 AI Agent 平台的現況:第一篇 LHTB 用 46 道長程終端機任務測出目前最強模型也只能解決約 28%,揭示 agent 距離真正自主作業仍有很長一段路;第二篇從安全角度發現多 agent 系統裡的「碎片化效應」讓傳統每個 agent 逐一監控的防禦策略幾乎失效;第三篇則從記憶體架構切入,用 3 個數量級的延遲差距,論證把記憶體放進 agent 推理迴圈本身才能有效消除冗餘行為。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-14

今天三篇論文從三個實戰角度切入 AI Agent 平台:第一篇揭露多 Agent 系統在生產環境中面臨的隱蔽安全威脅,並提出以「激活空間」偵測惡意 agent 的新框架(非同步環境下 F1 比現有方法高出 +0.55);第二篇改善 coding agent 的 retrieval 策略,引入「程序相似性」讓 AI 能找到解題步驟相近但表面不同的程式碼;第三篇則是重磅提醒——同一個 LLM 放進不同 harness,agent 的中途判斷就會出現顯著偏差,harness 設計根本不是中性的工具。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-12

今天三篇論文圍繞兩大主軸:**安全**與**評測**。Prismata 在頁面層阻止跨站提示注入攻擊;aiAuthZ 在工具呼叫層建立加密身份授權閘道——兩篇合力說明 LLM 本身不該是安全邊界,平台必須在架構層設防。第三篇 UniClawBench 則把 agent 評測從沙箱搬進真實世界,用「能力維度」取代「任務情境」做診斷,給平台工程師一把更好用的選模型與排查失敗的尺。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-11

今天三篇論文都在追問同一件事:Agent 系統如何才能「可靠地」運作?STRACE 解決的是優化輸入太雜——從大量噪音失敗軌跡中精準找出真正的根因,讓 Agent 的自動優化不再被冗餘案例帶偏;The Blind Curator 揭示一個令人不安的靜默失效模式——自我進化 Agent 的技能淘汰機制會因為 LLM 評審偏差在某個閾值後徹底停擺,光靠增加數據救不回來;Severity Scale 則把「Agent 被攻擊後到底有多嚴重」從二元的成功/失敗,變成七段式的行動傷害評分,讓安全評測終於有細緻度。三篇合看:優化品質、自我進化健全性、安全評測精度——三個不同層面,共同指向 Agent 可信

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-09

今天三篇論文從不同維度敲響「Agent 安全警報」:FARMA 能以 100% 成功率悄悄竄改 Agent 的推理記憶,繞過現有所有防禦機制;Vera 框架對 4 套生產級 Agent 系統(含 Claude Code)做系統化安全測試,平均攻擊成功率高達 93.9%;PiSAs 則揭示在多用戶共享 Agent 環境中,資訊跨用戶洩露是個未被充分關注的嚴重問題。三篇合看,是任何正在部署 Agent 平台的工程師與 PM 必須面對的安全現實。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-07

今天三篇論文都圍繞「讓 agent 系統更安全、更可預測、不出包」這個主軸。前兩篇出自同一研究團隊,以靜態分析角度出發:一篇系統性揭露 agent 陷入無限循環的成因與規模,另一篇則為整個 agent 程式碼建立依賴圖,讓安全審計和元件盤點成為可能。第三篇針對 multi-agent 軟體開發,把 LLM 輸出的信心分數引入協作流程,防止早期幻覺向下游蔓延。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-04

今天三篇各自揭露了 agent 系統的一個評估盲點:記憶讓 agent 更「諂媚」卻少被測試(MemSyco-Bench);現有安全 benchmark 把所有失敗壓成 pass/fail,分不清真正原因(Adversarial Pragmatics);多個 LLM agent 組成的集群,因為以自然語言溝通,反而比黑箱神經網路更容易解讀(Conversable Complexity)。三篇合起來的訊息:我們評估 agent 系統的方式,需要全面升級。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-25

今天三篇都在探索「agent 能力的邊界與突破路徑」。Sakana Fugu(Sakana AI)訓練了一個 0.6B 的協調器模型,學會動態指揮一池 frontier LLM 分工,在 SWE-Bench Pro 等多個榜單達到公開 SOTA——核心命題是「orchestrator 本身可以被訓練,而不只是工程師寫死規則」。NatureBench 用 90 個 Nature 期刊的真實科研任務反問:coding agent 真的能做科學發現?最強配置只勝過原論文 SOTA 17.8%,且靠的是把問題「翻譯成熟悉的 ML 任務」,不是真正的發明。最後,《Rising from the Ashe

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-18

今天三篇論文圍繞 Agent 平台的三個關鍵基礎設施層:HarnessX 提出一套「Harness 即可進化元件」的框架,讓 Agent 執行環境從靜態腳架變成自我最佳化系統,在 5 個 benchmark 上平均提升 +14.5%;第二篇研究多 Agent 協作中的「技能條件信任」路由問題,揭露什麼條件下細分信任真的有用、以及如何被攻擊者劫持;OCELOT 則從資安角度切入,提出「後驗洩漏預算」機制,防止 Agent 一步步把使用者隱私累積洩漏給外部服務。三篇合起來覆蓋框架設計、多 Agent 治理、隱私安全——恰好是落地 Agent 平台時最常踩到的三條坑。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-09

今天三篇都圍繞 **coding agents 的安全邊界與能力優化**:SABER 用第一個「可執行工作區」benchmark 發現即使最好的模型也有超過 54% 的危險操作率;第二篇讓 100 多位真人開發者跟「暗中破壞」的 AI agent 共事五小時,94% 的人沒抓到;SePO 則展示了只靠自動優化 system prompt(不改模型),就能在五個 benchmark 平均提升 4.49 分。三篇合起來提醒平台開發者:agent 的安全問題比想像中更難量測、更難被人察覺,但也存在低成本的改善路徑。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-06

今天三篇圍繞 agent 系統三個深層問題:**記憶架構**(哪種設計能真正跨場景通用?)、**自我進化能力**(AI 能不能自己開發 agent?)、**安全盲區**(CUA 的安全性在不同場景下差距有多大?)。AutoMEM 告訴我們主動控制自己記憶的 agent 比依賴外部管道更泛化;Meta-Agent Challenge 揭示現在前沿模型距離「自主開發 agent」仍有顯著落差;Domain-Conditioned Safety 則發現 Claude Sonnet 4.6 在網頁任務的 prompt injection 攻擊成功率是 0%,但在程式碼場景中同樣的模型被攻破率高達 10

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-02

今天三篇論文從不同角度解決 Agent 平台的核心痛點:第一篇提出把 LangGraph 那種「外掛 orchestrator」邏輯直接燒進小模型 weights,讓每對話成本降低 128–462 倍;第二篇來自 IBM Research,打造自動分析 agent 執行行為的三層評估框架,解決「agent 出了問題不知道哪個環節壞掉」的困境;第三篇來自 Microsoft,提出 agent 記憶的跨平台可攜帶協議,讓 Claude / GPT-4 / Gemini 之間可以交接記憶而不丟失狀態。三篇合看,恰好覆蓋 agent 平台的部署效率 → 行為評估 → 記憶可攜性三個關鍵面向。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-31

今天三篇論文切入三個不同層次:BenchTrace 跑了 1,821 個 agent 失敗片段,發現 GPT-4.1 和 Qwen3-32B 連「讀懂自己哪裡錯了」都不到三成通過——反思能力遠比想像差;Beyond Autonomy 從企業 SaaS 生產環境萃取出三層治理架構,是現有 agent framework 缺的那塊「治理」拼圖;Insuring Every Action 則用保險精算概念替每個 agent 動作定價與設定保證金,開創了全新的 runtime 風險語言。共同主軸:agent 走向企業部署的核心挑戰,已從「能不能做」演變成「做錯了怎麼辦、誰負責審查、損害怎麼量化」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-30

今天三篇分別從「設計語言」、「安全地圖」、「認知侷限」三個面向挑戰 AI Agent 實務:第一篇建立雙軸分類框架,讓工程師和研究者有共同語言溝通 agent 架構的設計取捨;第二篇系統整理 agentic AI 在工具呼叫、記憶體、多步驟執行中的安全與隱私風險全景;第三篇最具衝擊——用近 4 萬個 AI 生成想法的大規模實驗揭示,AI 研究 agent 傾向圍著舊文獻打轉而非真正拓寬科學探索。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-27

今天三篇論文共同指向 Agent 從 demo 走向真實部署的三道關卡:AgentTrust 在 tool call 執行前加入即時攔截層,填補靜態黑名單與事後 benchmark 之間的空白;Hermes 掃描 600 個生產 endpoint,發現現有 REST API 文件對 MCP agent 來說幾乎全部不合格(平均每個 endpoint 4 個問題);PARPO 則從 RL 訓練切入,讓 agent 的行為真正因人而異而非「對所有人都還好」。三篇合在一起,勾勒出 production-grade Agent 系統在安全閘、API 整備、個人化三條線上還有多少硬仗要打。