Skip to content
所有標籤

#agent-safety

6 篇文章
daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-20

D2ACCI 用雙迴圈診斷協議把記憶失敗定位到管線的哪一階段,診斷成功率從 0% 提升到 98–100%;Salesforce 重新評測記憶型自我進化 Agent,任務順序一打亂,表現從預期的進步 1.5% 反而退步 4.5%;GraphWake 證明只要污染 10% Agent 的記憶,就能讓群體意見極化程度大幅上升

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-18

ActBench 用執行軌跡紅隊測試協作 agent,固定 harness 下攻擊成功率仍達 73.7%–94.4%;Agent Behavioral Contracts II 證明同模型兩階段 pipeline 共同失敗率高達 90%,「條件獨立」假設不成立;Graph-Based RL Drift Diagnosis 用小模型外掛復原圖,在不重訓主力 agent 下偵測漂移並自動回滾

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-14

Harness-IF 揭示 Coding Agent 的指令遵從度被高估 3.6-7.4 個百分點,因為模型本來就會做的事被算成了遵從;SHE 把 harness 拆成四個安全元件並從軌跡失敗自動演化,ASR 降低 3.1 倍且正確率提升;SBCO 用分解式驗證器銀行搭配文本梯度做 harness 自我改進,在規劃任務上以 4-5.5 倍更少的算力追平 Gödel Machine

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-12

工具介面設計讓 coding agent 一致性提升 4.7 倍且 token 用量砍半;記憶蒸餾讓 4B 小模型在 AppWorld 準確率跳升 27.2 個百分點直逼大模型;制度設計實驗發現同樣的安全規則搭配不同權限機制,違規率從 0% 到 23% 天差地別

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-10

Evo-Bench 評測九款模型自主改進鷹架的能力,GPT-5.6 Sol 拿下 +16.6 分但 Office 任務幾乎不動;MEGA 用三層 Wisdom Graph 讓 Agent 優化基礎設施自我進化,知識積累與優化合為同一過程;SHE 把鷹架拆成四個可演化元件,從失敗軌跡學習安全邊界,ASR 降低 3.1 倍且跨模型可遷移

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-06

VerMem 用七個原子記憶操作加雙驗證器在五個基準上平均領先最強基線 5-8 分;SafeCommit 把不安全行動率從 41.2% 壓到 2.6% 且維持 97.4% 任務完成率;ToolLIFT 把工具軌跡抽象成函數級工作流圖,OOD 基準上比最強基線高 3-5 分