Skip to content
所有標籤

#agent-evaluation

52 篇文章

Stanford CS224V 第 4 講:任務型 Agent 評估不能只看回答像不像人

CS224V 把任務型 agent 評估拆成狀態更新與完整互動:先測 semantic parser,再讓真人檢查任務完成、知識查詢與動作是否可靠。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-15

SkillEvo 用多輪互動回饋取代單輪 QA 評估,讓技能進化不會在第一輪就停滯,比自我反思進化高 23 分;SkillShapley 把 Shapley 值搬進技能步驟歸因,用 99 次評估就能逼近精確排序,並發現「決策橋接步驟」才是高價值步驟;MindMemOS 用實體-屬性-時間結構統一記憶管理,LOCOMO 準確率 94%,技能進化讓 SpreadsheetBench 成功率提升 9.2 個百分點

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-14

Harness-IF 揭示 Coding Agent 的指令遵從度被高估 3.6-7.4 個百分點,因為模型本來就會做的事被算成了遵從;SHE 把 harness 拆成四個安全元件並從軌跡失敗自動演化,ASR 降低 3.1 倍且正確率提升;SBCO 用分解式驗證器銀行搭配文本梯度做 harness 自我改進,在規劃任務上以 4-5.5 倍更少的算力追平 Gödel Machine

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-11

Muscle Memory 提出「編譯式記憶」取代檢索式記憶,在 90 個場景中贏下 88.9% 的個人化對決;MoRSE 用 role-subtask 條件化 LoRA 專家讓多 Agent 在程式碼生成上顯著超越純 prompt 分工;ASCon 建立統一故障歸因模型,在三種歸因目標上分別提升 5.83%、10.63%、14.73%

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-09

OneDayAgent 用任務分解+執行記憶+全域驗修三步鷹架在 AgentIF-OneDay 拿下 0.821 新 SOTA,同一鷹架跨五個後端穩定運作;The Horizon Gap 綜述 1,547 篇論文發現長程 Agent 六大失敗類別共享同一結構模式——純結果訊號隨步數增長而失效,領域正在製造更密的過程訊號來補;Evo-Bench 首次測量 Agent 自動進化鷹架的能力,GPT-5.6 Sol 最高拿 +16.6 分,但 Office 任務仍需人工流程

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-07

ToolLIFT 把工具軌跡提升到功能層工作流圖,在三個 OOD 基準上持續超越 SOTA;SkillTV-Bench 用 681 案例證明技能感知的裁判技能讓 Agent 評判準確率提升 14.8 個百分點;TRIO-20 用預設等價研究發現 GPT-5.6 在 840 條軌跡中零越權呼叫,但推理力度提高讓規則探查率上升了 14.3 個百分點

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-04

今天三篇各從不同角度審視 AI Agent 的能力與極限:AutoMem 告訴你「記憶管理」是可以自動學習的獨立技能,光優化記憶就讓 32B 開源模型達到頂級商用模型水準;Shadow Evaluation 用真實 NeurIPS 投稿測試頂尖 Agent 能否做開放式 AI 研究——答案是否定的,Agent 能工程但不會研究;Adaptive Adversaries 揭示現有安全評測嚴重低估威脅:加上自適應多輪攻擊者,攻擊成功率從 0–1% 跳到 14%。三篇合起來是一堂清醒課:知道 Agent 能自動變強在哪、不能在哪、以及你的安全測試可能根本不夠。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-02

今天三篇各從不同角度逼視「Agent 在真實環境裡出事了怎麼辦」:ProACT 問的是多人協作中 Agent 應何時開口(Agent UX 設計問題);第二篇用真實 GitHub 資料揭露 Coding Agent 和自己開的 PR 互衝(平台 ops 痛點);第三篇從安全視角整理 Cyber-capable Agent 五大漏洞類別,以今年七月的 HuggingFace/OpenAI 事件為 case study。三篇合起來是一堂「Agent 上線後,你沒想到的麻煩都在這裡」速成課。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-01

今天三篇論文從不同角度逼問「AI Agent 在現實任務中的真實極限」:ORCA-bench 把 LLM Agent 丟進 SRE on-call 的生產環境做根因分析,最強模型也只答對 40%;AgentS4D 揭露工作區 Agent 的安全黑箱——66% 的「成功執行」背後仍觸發了危險行為,任務完成不等於安全;Context Files 研究則以 288 次對照實驗發現,開發者普遍維護的 [AGENTS.md](http://AGENTS.md) / [CLAUDE.md](http://CLAUDE.md) 對 coding agent 的正確率幾乎沒有可量測的提升。三篇合讀,讓你對「A

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-31

今天三篇論文都在問同一個核心問題:**現在的 AI Agent 真的能用嗎?** 答案出奇地一致——還差得遠。[HANDBOOK.md](http://HANDBOOK.md) 揭露把最強前沿模型丟進虛擬公司後,企業政策合規通過率最高只有 **36.2%**;LangGraph 論文給出三份可落地的有狀態工作流食譜,並附上「什麼時候不要用 LangGraph」的決策指南;MM-ToolSandBox 則首次量化了「看圖+叫工具」這個多模態組合技的困難程度——12 個主流模型中最強的成功率也不到一半。三個維度:合規評估、框架設計、視覺工具,串起一張「Agent 離真正落地還有多遠」的完整地圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-30

今天三篇圍繞「讓 Agent 更可靠、更好部署、更客觀評估」三個核心問題:TRACE-ROUTER 指出多步驟 Agent 流程不能套用「每次呼叫都重新選模型」的路由策略,改用任務級別路由搭配強化學習持續優化;OmniaBench 建立橫跨消費者、企業、工程三大場景的 1,431 題評測集,頂尖模型(Claude Sonnet-5)得分仍不到六成;自我校準 Agent 框架則示範如何用 ARIMA 時序預測幫 Agent 在無人監督下偵測並修正預測漂移。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-28

今天三篇論文從三個角度直擊 Agent 平台核心挑戰:**AgentCompass** 提出可組合的開源評測基礎設施,終結 agent 評測各自為政的碎片化亂象;**Agents in the Wild** 是少見的生產落地報告,從藥物研發與金融系統的真實部署歸納出可複用的設計模式;**Nanbeige4.2-3B** 則証明 3B 小模型配上 Looped Transformer 與大規模 agentic RL,在 agent 任務上可以壓過 9B 甚至 12B 的競爭對手——對邊端部署或成本敏感場景有直接啟示。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-27

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-26

今天三篇論文從三個角度精準刺中 AI coding agent 的能力邊界:**ICAE-Bench** 挑戰「模糊需求下的互動式開發」場景,揭示當前 benchmark 跟不上 vibe-coding 時代;**EvoAgentBench** 揭露 agent 自我進化能力轉移的陷阱,主流方法竟造成 −12.3 分的負遷移;**PERFOPT-Bench** 則開闢「效能優化作為 agentic task」新賽道,並發現 framework 選擇往往比模型選擇更關鍵。三篇合讀的重點:生產環境的 agent 評估遠比現有工具複雜,業界亟需更貼近真實場景的評估體系。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-24

今天三篇分別從生態、失敗、記憶三個角度切入:哪些開源 Agent 框架真正值得長期下注(不只看 star 數)、Agent 在哪六類問題上反覆翻車、以及如何讓 Agent 的長期記憶跨越多個人物做串聯推理。三篇合在一起,像是給 Agent 平台開發者的「框架選型依據 + 失敗防護清單 + 記憶系統升級方向」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-23

今天三篇的共同主題是:**我們測 agent 的方式,本身就有問題**。第一篇直接審計主流工具呼叫 benchmark,發現近兩成的分數是評錯的;第二篇用重播分析告訴你哪些 benchmark 不用跑完就能得出可靠結論(SWE-bench 是反例);第三篇推出首個將「執行任務」與「生成操作教學」合二為一的多模態 web agent benchmark,截圖輸入、雙目標評測,最強模型也只完成不到四成。三篇合讀能讓你對 agent 評測的現況有完整的危機感與應對方向。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-22

三篇論文從基礎設施、可觀測性、評估三個角度切入同一個核心問題:「如何打造真正可靠的 agent 系統?」Dyserve 用數學最佳化在 60ms 內決定 agent workflow 每個節點要用哪個 LLM,在精準度和延遲上同步超越所有 baseline;AgentLocate 解決 multi-agent pipeline 出錯時「不知道哪個 agent 搞的鬼」這個 ops 噩夢,自動定位責任 agent 和出錯時間點(COLM 2026 accepted);PolyWorkBench 則給出一記警告:現有頂尖 LLM agent 在多語言工作流中表現大幅劣化,全球化產品場景還有很長的路

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-20

今日三篇論文從三個不同角度審視 AI coding agent 的落地挑戰:第一篇用系統性實驗揭露 coding agent 在安裝套件時可被普通 README 發動供應鏈攻擊,且防禦能力主要取決於 harness 框架而非模型本身;第二篇提出 BPO 演算法,專為 sandbox-native agent 強化學習設計,只在高熵關鍵決策點分叉採樣提升訓練效率;第三篇以電網研究為案例,展示 MCP 如何作為標準協議串接工業場景的 domain-specific 仿真工具,為垂直領域 agent 落地提供可複製模板。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-17

今天三篇各從不同角度解決 agent 平台的核心痛點:第一篇從「前端 UX 設計」切入,提出讓電商網站對 AI 瀏覽器 agent 友善的框架,成功率從 49% 提升至 89%;第二篇攻的是「搜尋型 agent 亂猜答案」問題,用動態棄答 RL 訓練讓 agent 知道何時該說「我不確定」;第三篇則帶來具身機器人的 agent OS 架構,其多模態圖記憶與技能隔離設計對通用 agent 平台有直接啟發性。三篇合起來覆蓋了 agent 的「前端 UI 介面設計」→「推理可靠性訓練」→「執行層記憶架構」完整鏈路。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-15

今天三篇論文從三個截然不同的角度照亮 AI Agent 平台的現況:第一篇 LHTB 用 46 道長程終端機任務測出目前最強模型也只能解決約 28%,揭示 agent 距離真正自主作業仍有很長一段路;第二篇從安全角度發現多 agent 系統裡的「碎片化效應」讓傳統每個 agent 逐一監控的防禦策略幾乎失效;第三篇則從記憶體架構切入,用 3 個數量級的延遲差距,論證把記憶體放進 agent 推理迴圈本身才能有效消除冗餘行為。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-14

今天三篇論文從三個實戰角度切入 AI Agent 平台:第一篇揭露多 Agent 系統在生產環境中面臨的隱蔽安全威脅,並提出以「激活空間」偵測惡意 agent 的新框架(非同步環境下 F1 比現有方法高出 +0.55);第二篇改善 coding agent 的 retrieval 策略,引入「程序相似性」讓 AI 能找到解題步驟相近但表面不同的程式碼;第三篇則是重磅提醒——同一個 LLM 放進不同 harness,agent 的中途判斷就會出現顯著偏差,harness 設計根本不是中性的工具。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-13

今天三篇論文共同呼應一個趨勢:生產環境 agent 的瓶頸已不在模型能力,而在「狀態管理」。第一篇(Amazon)展示把重複步驟預先編譯成工具,可讓 p50 延遲降 42%、錯誤率降 53%;第二篇提出讓獨立記憶 agent 主動把關鍵狀態「推送」給行動 agent,解決長程任務中資訊遺失(behavioral state decay)的問題;第三篇以遞迴多 agent 架構克服單一 agent 無法同時廣又深的 web 研究限制。三篇合看:**工具化(tool compilation)、主動記憶(proactive memory)、遞迴分工(recursive orchestration)*

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-11

今天三篇論文都在追問同一件事:Agent 系統如何才能「可靠地」運作?STRACE 解決的是優化輸入太雜——從大量噪音失敗軌跡中精準找出真正的根因,讓 Agent 的自動優化不再被冗餘案例帶偏;The Blind Curator 揭示一個令人不安的靜默失效模式——自我進化 Agent 的技能淘汰機制會因為 LLM 評審偏差在某個閾值後徹底停擺,光靠增加數據救不回來;Severity Scale 則把「Agent 被攻擊後到底有多嚴重」從二元的成功/失敗,變成七段式的行動傷害評分,讓安全評測終於有細緻度。三篇合看:優化品質、自我進化健全性、安全評測精度——三個不同層面,共同指向 Agent 可信

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-10

今天三篇論文共同描繪 Agent 平台的「進化前線」:EvoSOP 讓 Agent 不再每次從零重組工具,而是從過去執行歷程中自動萃取可重用的 SOP,讓工作效率顯著提升;AgenticSTS 對長任務記憶提出嚴格的「有界合約」設計,用五層結構化提取取代無止盡的 context 堆疊;Spider 2.0-AIFunc 則揭示 AI 函式已被直接嵌入雲端 SQL 語法,但最強模型準確率僅約 67%,是資料 Agent 必須面對的新挑戰。三篇合看:從工具效率、記憶架構到資料能力,勾勒出 2026 年 Agent 平台亟需補強的三個關鍵短板。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-08

今天三篇論文聚焦同一個核心問題:現有 AI Agent 系統在「理想實驗室」與「真實部署」之間存在巨大落差。AgentGym2(ACL 2026)用新 benchmark 量化了評測的失真;Agentic RL 系統提出讓 agent 在生產環境持續自我進化的工程架構;ComfyClaw 則展示在圖像生成工作流中落地「技能自我進化」的完整範例。三篇合看,正是一張從「評測 → 部署 → 運行中進化」的完整地圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-06

今天三篇論文從不同角度同攻一個核心問題:**如何讓 Agent 工作流程在生產環境中真正可靠**。Mnemosyne 把資料庫的「交易(Transaction)」概念搬進 Agent 工作流程,讓 LLM 每個輸出都要先通過准入審核才能生效;PaperPilot 展示如何訓練 9B 小模型學會以 DAG(有向無環圖)規劃多輪搜尋工作流程,並根據用戶回饋動態修正整個流程;SEA 讓 Agent 邊跑邊改善自己,同時發出可被稽核的安全憑證。三篇合在一起幾乎覆蓋了 Agent 系統可靠性的完整棧:執行層保護、訓練層工作流程學習、更新層安全演化。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-05

今天三篇從不同角度觸碰 agent 平台的核心痛點:ReContext 提出免訓練的 inference-time 解法,讓 LLM 在 128K 長文中不再「視而不見」關鍵證據;第二篇揭示 multi-agent 辯論系統中,agent 因社會階層情境出現系統性「表裡不一」(divergence 3% → 40%);第三篇則對三個業界最常引用的 coding agent benchmark 發出警報——SWE-Perf 僅 8% 任務可靠重現,排行榜分數的可信度值得嚴肅質疑。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-03

今日三篇共同揭示一個核心張力:現有 agent 系統在封閉環境下表現亮眼,但只要環境稍有偏移就會出現嚴重退化。ICML 2026 論文從工具使用角度系統化量化了這個問題;第二篇展示如何用 6 個專精 agent 的流水線完成跨域複雜任務;第三篇則從 UX 角度提醒:agent 的「個性表達強度」不是越強越好,中等才是甜蜜點。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-02

今日三篇分別瞄準 Agent 平台的三大核心難題:**記憶如何從「撈資料」升級成「推理狀態」**(User as Code)、**多 Agent 如何去掉中央協調者卻更省成本**(DeLM),以及**Web Agent 執行後如何讓人快速驗證結果**(HANSEL)。三篇合在一起,幾乎就是一張高信任 Agent 平台的技術地圖——記憶層、協調層、可解釋層各攻一塊。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-01

今天三篇涵蓋 AI Agent 生態的不同維度:Qwen 團隊推出首個跨七大 agent 領域的「語言世界模型」,讓 agent 能在模擬環境中訓練而非倚賴真實 API;快手 AgentX 展示多 Agent 系統在工業規模下的生產部署成果,把推薦算法迭代效率提升至人工的 13.8 倍;OpenAI 則用 Codex 真實使用數據,首次量化 agentic AI 正在如何改變各職能工作者的實際產出,並揭示非技術職能(法務、研究)的 agentic 紅利甚至超越工程師。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-30

今天三篇論文共同聚焦在一個核心問題:**我們到底怎麼評估 agent 夠不夠好?** SWE-Explore 把 coding agent 最被忽視的中間步驟——讀懂程式庫——單獨拿出來測;Claw-SWE-Bench 揭示框架設計(harness adapter)才是讓 coding agent 分數暴漲的真正槓桿,同一模型換個 adapter 就能從 19% 跳到 73%;Red Queen Gödel Machine(Cambridge × NVIDIA)則走得更遠,讓評測者本身也跟著 agent 一起進化,打破靜態 benchmark 的天花板。三篇合看:**evaluation in

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-27

今天三篇從不同角度觸碰 Agent 平台的核心痛點:一篇把 Agent 記憶體拆成四個可量測的系統模組,揭示現有評估只看「答對沒」根本不夠;一篇借用軟體工程「設計審查」觀念,讓 Agentic Workflow 在上線前就能被自動驗證;另一篇用 14 組大規模平行實驗證明——你信任的那個 benchmark 排行榜,換個情境排名就洗牌,並提出更可靠的替代指標。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-26

今天三篇各攻一個角度:第一篇 **RigorBench** 問的是「AI coding agent 怎麼解題」而非只看答對率,提出五維流程紀律指標;第二篇來自產業實踐,教你如何把大型 LLM multi-agent 系統客製化、加速,讓企業真的用得起(實測 4.48 倍吞吐量提升);第三篇則從治理角度出發,為 AI 融入軟體開發生命週期提出一套正式協議語言,讓「哪些決定讓 AI 做、哪些要人工審核」從 prompt 裡的一句話,變成可機器驗證的規格。三篇合起來覆蓋「怎麼評估、怎麼部署、怎麼治理」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-25

今天三篇都在探索「agent 能力的邊界與突破路徑」。Sakana Fugu(Sakana AI)訓練了一個 0.6B 的協調器模型,學會動態指揮一池 frontier LLM 分工,在 SWE-Bench Pro 等多個榜單達到公開 SOTA——核心命題是「orchestrator 本身可以被訓練,而不只是工程師寫死規則」。NatureBench 用 90 個 Nature 期刊的真實科研任務反問:coding agent 真的能做科學發現?最強配置只勝過原論文 SOTA 17.8%,且靠的是把問題「翻譯成熟悉的 ML 任務」,不是真正的發明。最後,《Rising from the Ashe

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-24

今天三篇從工具可靠性、協定選型、多 Agent 協作三個角度切入 Agent 平台的痛點:PlanBench-XL 揭露頂尖 LLM 在真實大型工具環境下一遇到工具失效就崩潰(GPT-5.4 從 52% 跌至 11%);TU Munich 給出第一份 MCP/A2A/ACP/ANP 等 9 個協定的技術分類法,讓選型有系統依據;AMD 的 Arbor 提出以樹狀搜尋作為多 Agent 的共享認知空間,讓失敗也成為有用的探索訊號。三篇合在一起,恰好描繪出 2026 年 Agent 平台的三塊基礎設施缺口。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-22

今天三篇從「agent 在生產環境的可靠性與安全性」出發,覆蓋推論期、訓練期、基礎設施三個層次。LedgerAgent 用推論期的輕量「帳本」結構,讓工具呼叫 agent 不再把所有狀態塞進 prompt 靠 LLM 重建——直接降低政策違反與狀態錯誤;Alibaba 的 Connect the Dots (CoD) 則往更遠看,以強化學習訓練 agent 在長期部署中邊執行任務邊更新對環境的認識,跨任務越跑越準;Sovereign Execution Brokers 從安全基礎設施切入,在 agent 每次「動生產系統」的那一刻插入憑證驗證,把「授權的動作」和「實際執行的動作」嚴格綁定。三篇

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-21

今天三篇從不同切面拼出「agent 在真實世界怎麼落地」的全貌:Perplexity + 哈佛商學院用生產數據首次量化 agent 對比對話助理的差距——完成時間縮短 87%,而且 agent 吸引了認知複雜度更高的工作類型;Self-Harness 示範 agent scaffolding 如何不靠人工自動挖弱點、自動修,三個主流模型各獲 33-60% 相對提升;The Consistency Illusion 拆穿多 agent 辯論的核心陷阱——輸出層共識可能掩蓋底層推理根本不一致。三篇合讀的訊號:agent 真正的競爭力不在於模型更強,而在於「生產數據驅動的 scaffolding 自

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-19

今天三篇都在動搖 Agent 領域的「常識」:ACCORD 實驗揭示 agent 普遍犯的「自以為了解指令」問題(靠假設而非觀察行動),提出主動接地框架讓 AppWorld 成功率從 42% 跳到 62.6%;《多智能體的幻覺》以嚴格評測證明,自動生成的多智能體架構在計算成本高出 10 倍的情況下反而比不過單 agent + CoT-SC;《非常非常 Agentic》則用 GitHub 大規模實證資料揭示,AI 程式碼 Agent 在新建專案的採用率已是一年前的兩倍多。三個訊號合起來:Agent 工具快速普及,但「多 agent 必然更強」和「agent 理解你的指令」這兩個核心假設,正在被資

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-18

今天三篇論文圍繞 Agent 平台的三個關鍵基礎設施層:HarnessX 提出一套「Harness 即可進化元件」的框架,讓 Agent 執行環境從靜態腳架變成自我最佳化系統,在 5 個 benchmark 上平均提升 +14.5%;第二篇研究多 Agent 協作中的「技能條件信任」路由問題,揭露什麼條件下細分信任真的有用、以及如何被攻擊者劫持;OCELOT 則從資安角度切入,提出「後驗洩漏預算」機制,防止 Agent 一步步把使用者隱私累積洩漏給外部服務。三篇合起來覆蓋框架設計、多 Agent 治理、隱私安全——恰好是落地 Agent 平台時最常踩到的三條坑。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-16

今天三篇論文從「訓練 → 架構 → 環境」三個層次,一起回答同一個問題:怎麼讓 Agent 在真實系統裡更可靠?RefGRPO 找出 Agent RL 訓練中被忽略的反思校準問題,讓 Agent 成為自己的驗證器;「Agents All the Way Down」給出從 LLM substrate 到上線部署的完整 custom agent 方法論,強調地基穩固比框架選擇更重要;EurekAgent 則以自主科研任務為場景,證明「環境工程」比「流程工程」更決定 agent 的可靠性上限。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-15

今天三篇從不同角度描繪「2026 年的 agent 現實」:UC Berkeley 用 1,000+ 個真實職場任務做成的 benchmark 顯示,當前最強 agent 在最難任務上平均只通過 2.6%;Microsoft 研究者訪談 17 位開發者後發現,他們都在無意識地發展出 4 種即興「監督工作」,但現有工具幾乎沒有支援;Reins AI 的工坊論文則指出,在 agent 系統還不夠成熟的部署期,傳統任務層監控根本看不到最嚴重的結構性故障。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-14

今天三篇論文從不同角度切入同一核心問題:**如何在真實部署條件下評估與運行 AI Agent?** Emergence World 建立持續運行數週的多 Agent 沙盒,揭露短期 benchmark 看不到的行為漂移與跨模型交叉影響;Survey 論文為 agent 執行環境設計建立完整分類學(8 屬性 × 8 領域),並提出 symbolic vs. neural 兩種自動合成範式;Martin Monperrus 的 position paper 則直接宣告:coding agent 已達門檻,人工 code review 可以退場了。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-12

今天三篇論文從「如何評量 agent」和「agent 究竟是什麼」兩個角度出發:T1-Bench 建出橫跨 25 個真實業務領域的高仿真 benchmark,讓多領域跨域推理能力首次有系統性量化基準;VISTA 解決「用 LLM 模擬使用者測 agent」的可信度難題,提供 6 個指標量化你的測試有沒有真的覆蓋 agent 的能力邊界;Agentic Software 則從第一原理釐清:當 LLM 成為主推理引擎時,軟體的本質已變——這直接影響 agent 平台的除錯工具和測試策略設計。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-10

今天三篇論文呼應同一主題——讓 Agent 從實驗走向可靠的生產環境:一篇是超大規模雲端部署的多 Agent 故障排除架構實戰,自主解決率達 90%+;一篇提出讓 Agent 記住過去工具呼叫成功失敗的記憶機制,不用重訓模型就能持續進步;一篇則首次系統比較六款 AI 輔助開發流程框架,提供六個維度的選型參考。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-09

今天三篇都圍繞 **coding agents 的安全邊界與能力優化**:SABER 用第一個「可執行工作區」benchmark 發現即使最好的模型也有超過 54% 的危險操作率;第二篇讓 100 多位真人開發者跟「暗中破壞」的 AI agent 共事五小時,94% 的人沒抓到;SePO 則展示了只靠自動優化 system prompt(不改模型),就能在五個 benchmark 平均提升 4.49 分。三篇合起來提醒平台開發者:agent 的安全問題比想像中更難量測、更難被人察覺,但也存在低成本的改善路徑。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-08

今天三篇分別對應 agent 平台堆疊的三個層次:AgentJet(訓練層)提出讓多個異質 LLM 同步做強化學習訓練的分散式框架,解決現有工具只能單模型訓練的根本痛點;AdaPlanBench(評測層)用 67.75% 的成績上限揭示 LLM agent 在「規則邊走邊揭露」的現實場景中遠未成熟,是第一個系統量化這種適應性規劃能力的 benchmark;Beyond Tokens(通訊層)整理了 multi-agent 系統改用「傳 embedding 而非傳文字」的研究現狀,提供分類框架評估這條新通訊路徑的工程取捨。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-07

今天三篇都在問 agent 平台的「基礎建設怎麼選」:ADK Arena 首度量化比較 LangGraph、AutoGen、CrewAI 等多個主流框架的真實任務完成率與成本差距,讓框架選型終於有量化依據;Agent Memory 提供第一個從電腦系統視角分析 10 種記憶方案的 taxonomy,幫工程師評估延遲、頻寬、可擴展性的取捨;Search-Time Contamination 則質疑 deep research agent 的 benchmark 分數可信度——agent 在評測時可以直接搜到答案,分數最多虛高 4%。三篇合看,agent 平台的三個核心決策點(框架選型、記憶架構、

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-06

今天三篇圍繞 agent 系統三個深層問題:**記憶架構**(哪種設計能真正跨場景通用?)、**自我進化能力**(AI 能不能自己開發 agent?)、**安全盲區**(CUA 的安全性在不同場景下差距有多大?)。AutoMEM 告訴我們主動控制自己記憶的 agent 比依賴外部管道更泛化;Meta-Agent Challenge 揭示現在前沿模型距離「自主開發 agent」仍有顯著落差;Domain-Conditioned Safety 則發現 Claude Sonnet 4.6 在網頁任務的 prompt injection 攻擊成功率是 0%,但在程式碼場景中同樣的模型被攻破率高達 10

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-05

今天三篇分別從「評測診斷」、「工具進化」、「安全對齊」三個角度補強 Agent 平台的核心短板:APB 提出一套 4,209 道題的診斷型 benchmark,首次能把「規劃失敗」和「執行失敗」分開來看;MetaForge 讓 agent 能在運行時「自行鍛造」沒有的工具,打破靜態工具庫的天花板;RUBAS 把 agent 安全問題細分成四個評分維度,用強化學習讓模型學會在實用性和安全性間找到平衡。三篇合看:你的 agent 系統能不能被診斷、能不能自我擴展、能不能安全上線——這三道關卡今天同時被研究者正面回應。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-04

今天三篇從不同層次切入「如何建造更可靠、更可進化的 Agent 系統」:第一篇用真實執行軌跡首次揭示多模型 Agent 系統的 LLM 呼叫成本,讓平台工程師能用數字說話;第二篇提出把整個記憶流水線當成可自我演化的程式碼,解決長期任務中記憶架構對齊失效的痛點;第三篇補上評測盲點,指出現有 Agent 持續學習 benchmark 無法真正辨別「學到了什麼」,並給出更嚴謹的 controlled stream 框架。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-31

今天三篇論文切入三個不同層次:BenchTrace 跑了 1,821 個 agent 失敗片段,發現 GPT-4.1 和 Qwen3-32B 連「讀懂自己哪裡錯了」都不到三成通過——反思能力遠比想像差;Beyond Autonomy 從企業 SaaS 生產環境萃取出三層治理架構,是現有 agent framework 缺的那塊「治理」拼圖;Insuring Every Action 則用保險精算概念替每個 agent 動作定價與設定保證金,開創了全新的 runtime 風險語言。共同主軸:agent 走向企業部署的核心挑戰,已從「能不能做」演變成「做錯了怎麼辦、誰負責審查、損害怎麼量化」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-28

今天三篇論文從三個角度補齊 agent 平台知識:AgentFugue 展示多個 peer agent 共享「推理暫存筆記」可突破長任務協作瓶頸;Can Agent Benchmarks Support Their Scores? 揭露當前 agent benchmark 的評分機制存在系統性漏洞,排行榜數字需重新審視;VibeServe 則讓 agent 自動生成整套 LLM serving stack,在特殊部署場景下超越手工優化的 vLLM。三篇合起來分別回答了「agent 怎麼協作更強」、「我們信任的評測數字是否可靠」以及「agent 能幫工程師做基礎設施嗎」。