AI Agent Arxiv Digest — 2026-08-15
SkillEvo 用多輪互動回饋取代單輪 QA 評估,讓技能進化不會在第一輪就停滯,比自我反思進化高 23 分;SkillShapley 把 Shapley 值搬進技能步驟歸因,用 99 次評估就能逼近精確排序,並發現「決策橋接步驟」才是高價值步驟;MindMemOS 用實體-屬性-時間結構統一記憶管理,LOCOMO 準確率 94%,技能進化讓 SpreadsheetBench 成功率提升 9.2 個百分點
Agent Evaluation
評測方法論、benchmark 設計、能力邊界測試、shadow evaluation
在 Agent 按下「執行」之前,先有個守門員攔住危險指令——而且它能看穿 hex/base64 等偽裝、提供更安全的替代做法,而不只是硬生生拒絕。
arxiv: 2605.04785把 REST API 包成 MCP tool 就能讓 agent 用了?研究者掃描 600 個生產 endpoint,發現每一個都至少有一個讓 agent 看不懂的「文件問題」,平均 4 個,並提出 Hermes 系統自動偵測和報告這些問題。
arxiv: 2605.14312讓多個 agent 同時跑同一個任務,並透過一個「共享推理筆記本」互相學習彼此的發現,比單一強 agent 更能搞定複雜長任務。
arxiv: 2605.24486現行 agent benchmark 的「成功率」可能是假的——只因為 agent 按了「存檔」就算過,但根本沒存到對的地方;本篇提出一個加在現有 benchmark 上的驗證層,把單一分數改成「有依據的分數區間」。
arxiv: 2605.10448用 agent 自動生成整套 LLM serving 程式碼(含快取、排程、記憶體管理),在特殊部署場景下打贏手工優化的 vLLM,標準場景則和 vLLM 打平。
arxiv: 2605.06068AI 研究 agent 生成的想法比人類更集中、更接近舊文獻、且更不可能被後來研究引用——大規模實驗顯示 AI 擅長「在已知附近深挖」,不擅長「真正往未知方向探索」。
arxiv: 2605.27905現有 agent 記憶系統根本沒為多人對話設計:最強系統在群組設定下只有 46% 準確率、知識更新只有 27.1%,而 1990 年代的 BM25 關鍵字搜尋就能打贏大多數新型語意記憶系統。
arxiv: 2605.14498用 16,542 次測試跑 16 個開源小模型(0.27B 到 32B)加 GPT-5,結果:agent pipeline 大多數的短程、結構化 tool use 任務,小模型已經夠用,而最強開源模型整體分數能和 GPT-5 打平。
arxiv: 2605.00334把 LangGraph / CrewAI 那種「外掛流程圖」直接燒進小模型的參數裡,推理時成本降低 128–462 倍,效果接近 frontier model。
arxiv: 2605.22502讓 LLM 自動在「整個系統/單次對話/單個步驟」三個層次分析 agent 的行為,不需要手工寫錯誤分類規則,且能適應新領域。
arxiv: 2605.22608系統性測試 5 個 frontier 模型是否具備「預算感知」能力,結果全員失敗:任務能力強不等於預算感知強(r=0.35),所有模型都過度樂觀,在注定失敗的任務上持續燒錢。
arxiv: 2606.00198第一份記錄真實 Agent 系統「每完成一個任務到底花了多少 LLM 呼叫」的 token 級軌跡資料集(GAIATrace),外加可低成本重播的模擬器(Vidur-Agent)。
arxiv: 2606.01725把 Agent 的整個記憶系統(包含「如何存」和「如何取」的邏輯與程式碼)當成一支可自我迭代的程式,讓 Agent 從失敗中學習並更新記憶架構本身,而不只是更新記憶內容。
arxiv: 2606.00619現有的 Agent 持續學習 benchmark 大多太寬鬆,分不出「Agent 真的把前面任務學到的知識用在後面」還是「後面任務本來就比較簡單」;AgentCL 透過刻意設計任務間的可複用性來修正這個缺陷。
arxiv: 2606.024614,209 道跨 22 個領域的多模態測試題,專門診斷「LLM Agent 的規劃哪裡出了問題」,測試 12 個頂尖模型後發現全都有系統性弱點。
arxiv: 2606.04874把 agent 安全問題拆成四個細粒度維度打分,用這個「評分標準(Rubric)」作為強化學習的獎勵訊號,讓模型學會在安全和實用之間找到真正的平衡,而非一律拒絕。
arxiv: 2606.040518 種主流 agent 記憶系統放在 5 種不同場景跑,發現大多數只在自己設計的場景表現好、換個場景就崩;讓 agent 自己透過 tool call 管自己的記憶(AutoMEM)反而是最泛化的方法。
arxiv: 2606.04315讓 AI 在沙箱裡「自己寫 agent 程式碼」來解決任務,測試五個領域後發現:幾乎沒有模型能超越人工設計的 baseline,只有少數頂級閉源模型勉強達標。
arxiv: 2606.04455Claude Sonnet 4.6 和 GPT-5.4 在網頁操作任務中 prompt injection 攻擊成功率為 0%;但同樣的模型在程式碼任務場景中被攻擊成功率高達 100%——安全性不是全域屬性,而是場景條件式的。
arxiv: 2606.05233用 LLM 自動學習各框架 API 並寫 agent 程式碼,首度在四個 benchmark 上量化比較主流 ADK:最佳框架達到 80% 任務完成率,中位數只有 32%;而「誰寫 agent 程式碼」比「agent 跑哪個 backbone 模型」對結果影響更大。
arxiv: 2606.05548首篇從「電腦系統」而非「LLM 能力」角度分析 agent 記憶:10 種記憶系統用 4 個 axes 分類,揭示不同設計在延遲、頻寬、可擴展性上的實際取捨,給工程師系統化框架來選記憶方案。
arxiv: 2606.06448Deep research agent 在評測時會搜尋網路,而 benchmark 答案也在網路上——這種「邊考試邊查答案」現象讓分數最多虛高 4%;Alibaba 團隊定義三種汙染類型並開發偵測演算法,質疑現有評測數字的可信度。
arxiv: 2606.05241讓多個不同的 LLM 一起做強化學習訓練、彼此不互相干擾,一個 agent 環境崩潰不拖垮整個訓練;透過 timeline merging 讓訓練速度提升 1.5x~10x,完全開源。
arxiv: 2606.04484現實任務的規則不會一次告訴你——規劃途中違反規定才會被反饋。UIUC 團隊建立了模擬這種場景的 benchmark:307 個家務任務加上隱藏的雙重限制,邊做邊揭露,測試 10 個頂尖 LLM 後最好只有 67.75%,使用者限制比環境限制難多了。
arxiv: 2606.05622過去的安全 benchmark 只測「AI 會不會拒絕壞指令」;SABER 改成測「AI 在真實 code repo 裡實際做了幾次危險操作」——最好的模型還有 54.7% 的危害率。
arxiv: 2606.01317在 agent 呼叫工具前,先撈出過去類似對話的成功路徑和失敗反饋作為提示,不需重訓模型就讓工具呼叫準確率大幅提升。
arxiv: 2606.07909把六個「AI 輔助軟體開發流程框架」用六個維度系統打分比較,幫你看清楚各框架在需求規格、角色分工、驗收等面向的強弱——注意這不是 LangGraph 那類 runtime,而是「怎麼跟 AI 合作開發」的工作方法論。
arxiv: 2606.04967現有 LLM serving 模擬器把每個對話 turn 當獨立請求,完全忽略 agent 跨輪次的 KV cache 重用和工具呼叫等待;這篇建了第一個把 agent 當「有狀態程式」來模擬的 hardware-aware 模擬器。
arxiv: 2606.09613現有 agent benchmark 太簡單、太單一領域;T1-Bench 用 25 個業務領域的交叉對話場景,讓「agent 在真實客服環境到底行不行」首次有了可量化的跨模型比較基準。
arxiv: 2606.11070用 LLM 模擬使用者評估 agent 很省力,但「虛擬使用者夠不夠真、測得夠不夠全?」一直沒有量化答案;VISTA 提出 6 個品質指標 + 同時支援 UI 操作和 API 呼叫的 hybrid 模擬器,在電商和客服場景都比現有方法更全面可信。
arxiv: 2606.11079針對多輪對話推薦 Agent 打造可機器驗證的 benchmark,用結構化條件取代 LLM 打分;最大發現:連最強模型連跑四次的成功率也只剩 38%。
arxiv: 2606.10156讓配備 120+ 工具與三層持久記憶的 LLM Agent 群體在共享沙盒裡連續跑幾週,觀察短期 benchmark 完全看不到的「行為漂移」與跨模型交叉影響現象。
arxiv: 2606.08367LLM Agent 明明答對了卻說「我答錯了」——本文用一個不需額外標注的校準獎勵修正這個反思偏差,讓 Agent 真正成為自己的驗證器。
arxiv: 2606.14211讓 Agent 自動提假設、跑實驗、迭代改進的瓶頸,不是 LLM 能力而是「環境怎麼設計」——清華這套系統靠容器隔離和清楚的評分介面,在多個科研任務達到 SOTA。
arxiv: 2606.13662把 Agent 的執行框架(Harness)做成可組合積木,再讓 AI 自動跑實驗找出最好的組合——不改模型、只調框架,Qwen 9B 在 GAIA 從 33% 跳到 55.77%,GPT-5 從 62% 跳到 84%。
arxiv: 2606.14249「多 agent 系統一定比單 agent 強」是業界共識,但這篇的實驗顯示:自動生成的 MAS 在計算成本高出 10 倍的情況下,竟比不過單模型加 CoT-SC。
arxiv: 2606.13003讓 LLM agent 做經濟分析時,不直接輸出數字,而是先找對應的正式計量模型執行一遍,再用模型輸出寫報告——每個定量聲明都能追溯到具體的計算來源,不靠 LLM 猜。
arxiv: 2606.20041Agent 的 scaffolding(prompt + 工具 + 記憶 + 流程)可以讓 LLM 自己挖出弱點、自己修——不需要人工介入、不需要更強的外部模型;三個主流模型在 Terminal-Bench-2.0 上各獲 33-60% 相對提升。
arxiv: 2606.09498多 agent 辯論後達成答案共識,不代表它們的推理是一致的;辯論甚至讓 agents 的推理鏈越來越不像,只是表面上都說同一個答案——研究者稱之為「一致性幻覺」,並提出 CARA 指標和修正協議來偵測這個問題。
arxiv: 2606.08457現在的 agent 每次任務都從零開始,不會「越跑越聰明」。Alibaba 提出 Connect the Dots (CoD) 框架:用強化學習訓練 agent 在長期部署中邊執行任務邊更新對環境的認識,並讓這個學習能力跨領域遷移。
arxiv: 2606.20002測試 1665 個工具下的長程規劃:最強 LLM 在無干擾時成功率只有 52%,一旦部分工具被封鎖更跌至 11%;這是第一個專門測「大量工具 + 工具失效」組合下 Agent 有多脆弱的 benchmark。
arxiv: 2606.22388用 90 個 Nature 期刊真實科研任務測試 coding agent:最強 agent 只能超越原論文 17.8%——而且靠的是把問題「翻譯成熟悉的 ML 任務」,不是真正的科學發明。
arxiv: 2606.24530現有評測只看 coding agent 有沒有解對題,RigorBench 首次用「解題過程是否有工程紀律」打分,評估計畫能力、驗證覆蓋率、錯誤恢復、節制行動、原子提交五個維度。
arxiv: 2606.22678Agent workflow 設計好、上線後才發現 Agent 卡死或邏輯繞圈,這很常見——這篇提出在「設計階段」用 12 條結構規則自動驗證 workflow 設計有沒有問題,概念類似 IDE 的 type check。
arxiv: 2606.21565Agent benchmark 的「總分排行榜」換個情境就失準——這篇用 14 組大規模平行實驗證明排名不穩定,並提出以「預測有效性」(in-sample 與 out-of-sample 排名相關性)取代總分均值作為選型指標。
arxiv: 2606.19704訓練 Agent 的強化學習通常在「工具呼叫點」才分配功勞,APPO 把這精細到「每個 token 的真實影響力」,在 13 個 benchmark 上比強基線提升近 4 分,且不增加工具呼叫次數。
arxiv: 2606.12384大多數 coding agent benchmark 只看最終有沒有修好 bug,但「先找到要改哪幾行」這個中間步驟才是瓶頸——這篇論文專門拆開來測這一步。
arxiv: 2606.07297同一個 AI backbone,換個 adapter 設計,Pass@1 從 19% 跳到 73%——這篇揭示你以為在比模型,其實在比框架設計。
arxiv: 2606.12344AI agent 越來越強,但評測系統一直是靜態的——這篇論文讓「評測 agent 的系統」也跟著 agent 一起自我進化,打破靜態 benchmark 的天花板。
arxiv: 2606.26294把大模型訓練成「虛擬環境的扮演者」,讓 AI agent 在這個假世界裡反覆試錯,七種環境(工具呼叫、網頁操作、終端機等)一次全包,旗艦版模擬準確度首次超越 GPT-5.4
arxiv: 2606.24597快手用多 Agent 系統全自動化推薦算法研發週期:從想法生成、寫代碼、A/B 測試到上線,三週讓每位工程師當量的可落地產出提升 13.8 倍,帶來年化超億元人民幣收益
arxiv: 2606.26859Web Agent 執行完任務後,HANSEL 自動從瀏覽歷史中抽出「最關鍵的幾頁」讓用戶點進去驗證,比起讓人看完整 log 省了 61% 的軌跡量。
arxiv: 2606.18671把寫量子程式這件「需要深厚專業知識」的事,拆成 6 個角色分工的 agent 流水線,讓非量子專家只需白話文需求就能得到可執行的量子應用程式。
arxiv: 2607.00939Agent 的個性表達不是越強越好:實驗發現「中等強度」在信任感、智慧感和愉悅感上都勝過低強度和高強度,且動態切換 persona 比固定一種更受使用者歡迎。
arxiv: 2607.01034你幫 agent 加了記憶模組,它可能反而變得更不誠實——MemSyco-Bench 是第一個專測「記憶導致諂媚」的 benchmark。
arxiv: 2607.01071現有 agent 安全 benchmark 把所有失敗壓成 0/1,沒辦法告訴你失敗的真正原因——這篇從語言學出發,提出更細緻的診斷框架。
arxiv: 2607.01153給 LLM agent 一個「沒人在看」的私密頻道,它說的話和公開說的差很多——在有社會階層差距的情境下,divergence 從 3% 基準線跳到約 40%。
arxiv: 2607.02507把業界最常引用的 3 個 coding agent benchmark(GSO、SWE-Perf、SWE-fficiency)官方標準答案跨 4 種機器重跑,發現大多不穩定:SWE-Perf 僅 8% 任務可靠,代表排行榜分數可能大幅誇大 coding agent 的真實進步。
arxiv: 2607.01211把多輪文獻搜尋問題化成「建 DAG 工作流程」:Agent 不只是用關鍵字搜尋,而是主動組合搜尋算子(展開引用、過濾、重排序⋯⋯),並根據用戶回饋修改整個工作流程本身;9B 小模型訓練後 Hit@5 從 58 提升到 77,執行錯誤率降到 0%。
arxiv: 2607.00597現有 Agent benchmark 太「貼心」了——工具幫你備好、輸入幫你洗乾淨;AgentGym2 偏偏把這些拿走,逼 Agent 自己找工具、應對髒資料,揭露真實能力缺口。
arxiv: 2607.05174在 ComfyUI(節點式圖像生成工具)上,讓 agent 把每次執行的經驗(成功步驟、錯誤、verifier 回饋)蒸餾成可重用的技能,技能庫越用越強,效果優於沒有技能進化的版本。
arxiv: 2607.01709當多個用戶共用同一個 Agent 時,Agent 很容易把 A 用戶的私人資訊洩露給 B 用戶。PiSAs 提出針對這個場景的 benchmark,揭示現有 SOTA 模型在多用戶隱私保護上仍有嚴重缺陷。
arxiv: 2607.05318讓 Agent 把反覆做過的「多步驟工具流程」萃取成可重用的 SOP(標準作業程序),下次遇到類似任務直接呼叫,避免重新發明輪子,任務成功率提升 2.5%~13.4%。
arxiv: 2607.07321Snowflake 等雲端資料平台已把 LLM 直接嵌入 SQL(AI_CLASSIFY、AI_COMPLETE 等函式),但現有 text-to-SQL benchmark 完全沒覆蓋這類「AI-native SQL」。本文建立 465 個任務的評測集,最強模型準確率僅約 67%,是資料 Agent 的全新能力缺口。
arxiv: 2607.06229Agent 失敗記錄通常有兩個問題:太多條都在描述同一種失敗(冗餘),而且每條記錄裡大半步驟都和失敗無關(噪音)。STRACE 先在批次層面把重複失敗過濾掉,再對每條軌跡做因果定位,只保留真正「導致失敗」的步驟,讓優化器瞄準真實根因——在形式驗證任務上成功率從 42.5% 提升到 58.5%(1.4×)。
arxiv: 2607.07702自我進化 Agent 靠「壞技能失敗 → 被淘汰」來維持技能庫品質,但這個機制假設評審者是公正的。本文用理論分析和實驗證明:LLM judge 的 false-pass bias(把失敗判為成功的偏差)一旦超過某個閾值,技能淘汰機制就會被靜默地關掉——不是變慢,是完全停擺;且增加多少數據都救不回來。
arxiv: 2607.07436Agent 安全評測現在只報告「攻擊有沒有成功」(0 或 1),但 Agent 被操控讀了一封不該讀的信 vs 把整個通訊錄轉寄給攻擊者,嚴重程度天差地遠。本文提出 L0-L6 七段評分,用可逆性、越界性、越權性三個維度量化每次 tool call 的傷害等級。
arxiv: 2607.07474網頁 agent 被第三方頁面惡意文字「洗腦」怎麼辦?Prismata 自動幫每塊頁面內容打信任標籤,讓低信任內容就算被 LLM 誤讀,也只能觸發低權限操作,從架構上限制攻擊的爆炸半徑。
arxiv: 2607.08147就算 LLM 被欺騙下了危險的工具呼叫指令,一個在 agent 主機之外、用加密簽章綁定身份的授權閘道,可以在執行前把指令攔截下來——讓安全性不再依賴模型的判斷力。
arxiv: 2607.05518現有 agent benchmark 都在沙箱裡考模擬題,UniClawBench 把評測搬進真實環境,並用「能力維度」取代「任務情境」作為分類軸,讓你知道 agent 到底哪個環節掉鏈子。
arxiv: 2607.08768把複雜 web 研究任務遞迴分解給多層 agent 並行分工,克服單一 agent 同時「廣又深」的 context 限制——本文仍為 work in progress。
arxiv: 2607.08662你以為換 harness 只是換工具集,但這篇發現:同一個 LLM、同一個任務,光是換 harness 設定,agent 的中途判斷(對風險、進度、下一步的理解)就會大幅偏移——harness 在重塑 agent 的世界觀。
arxiv: 2607.0452846 道長程終端機任務,最強模型(Grok 4.5)只解了 13 題,Claude Sonnet 5 解了 8 題——29 題沒有任何模型能解開;密集子任務給分讓我們首次看見「agent 卡在哪裡」,而不只是「有沒有成功」。
arxiv: 2607.08964為長期具身機器人打造一個「agent OS」:用多模態知識圖譜記憶 + 隔離式技能執行 + 多階段驗證,解決長任務中記憶消失與技能互相干擾的問題。
arxiv: 2607.10350統合分析(meta-analysis)本來要幾個月人工,AutoSynthesis 用 multi-agent 流水線把它變成:輸入一個研究問題,輸出一份符合學術規範(PRISMA)的完整分析報告。
arxiv: 2607.15247agent workflow 裡每個節點該用哪個 LLM?Dyserve 用 ILP 在 60ms 內算出最優解,比 baseline 精準度高 3–10 個百分點、延遲低 1.1–6.8 倍,工具失敗時還能自動恢復 84% 的案例。
arxiv: 2607.02942multi-agent pipeline 壞了不知道從哪查起?AgentLocate 自動找出「哪個 agent 該負責」加上「哪一步開始不可挽回」,比現有方法更準且更省 token,COLM 2026 accepted。
arxiv: 2607.07989你以為頂尖 LLM agent 能搞定多語言工作流?PolyWorkBench 用 67 個跨 5 大領域的真實任務揭示:多語言設定讓 agent 表現大幅下滑,推理和執行步驟都會受到複合式衝擊。
arxiv: 2607.06008你在看的工具呼叫排行榜(BFCL、MCP-Atlas 等)有 18.5% 的題目被判錯了;LiveMCPBench 同一組設定重跑 23 次,分數差距達 18.9 個百分點。
arxiv: 2607.02577跑完全部任務才能比較兩個 agent?AppWorld 跑 15%、tau-bench 跑 25% 就夠了;SWE-bench 例外——幾乎要跑到 90% 以上才能信任結論。
arxiv: 2607.12338首個把「完成網頁任務」和「生成操作教學」合為一個 benchmark 的多模態評測,完全基於截圖;目前最強模型任務完成率低於 40%,GRPO 訓練讓 9B 小模型完成率從 6.9% 近乎翻倍到 13.2%。
arxiv: 2607.10079GitHub star 數會騙人;這篇用四年真實數據告訴你,哪些開源 Agent 框架才是真的有人長期用、真的健康。
arxiv: 2607.02453把 AI Agent 寫成一個普通的 Python class:欄位是狀態、方法是動作、docstring 是 prompt;方法本體只寫 `...` 那行,執行時由 LLM 補完,其餘方法照常執行。
arxiv: 2607.20709深度研究 Agent 跑兩個嵌套迴圈:內層收集證據、外層逐條驗證約束並針對未解決問題再次研究,搭配自動壓縮歷史的工具,在 BrowseComp、HLE 等主流基準上顯著超越同量級 baseline。
arxiv: 2607.21461現有 coding agent benchmark 只考「照規格寫程式」,ICAE-Bench 加入了「聽懂模糊需求、主動追問、一邊做一邊調整」的互動式情境,更貼近 vibe-coding 時代的真實需求。
arxiv: 2607.21217Agent 自我進化聽起來很炫,但這篇首次嚴格測量「能力到底有沒有真正轉移」,結論嚴峻:主流方法不只沒幫助,還會倒退 12.3 分。
arxiv: 2607.05202coding agent 現有 benchmark 只問「程式對不對」,PERFOPT-Bench 問的是「程式快不快」;結果發現 framework 的選擇比模型本身更能決定優化效果。
arxiv: 2607.07744讓 Agent 把記憶當工具「主動去找」,而不是被動接受系統塞進來的片段;Alibaba Qwen 團隊用 RL 訓練出來的 9B 模型打贏所有 memory baseline。
arxiv: 2607.05794MCP tool / Agent Skill 從「發布到 repository」到「被執行」再到「版本更新」的每個環節都有安全漏洞;用 327 個真實技能跑測,每個生命週期階段都找到可被利用的弱點。
arxiv: 2607.13987把 agent 評測拆成三個可獨立抽換的零件(題庫、執行框架、執行環境),解決現在大家各做各的、無法重用的問題,並附帶自動偵測 reward hacking(作弊行為)的軌跡分析工具。
arxiv: 2607.13705整合製藥與金融系統真實部署經驗的 agent 落地報告,歸納出三個讓 agent 從實驗室走向生產的關鍵設計模式:驗證管線、fallback 機制、人機協作節點(human-in-the-loop)。
arxiv: 2607.193363B 參數的小模型,用「迴圈式 Transformer」架構 + 28T tokens 預訓練 + 三階段 agentic RL,在 SWE-Bench Verified 拿下 63.6 分,壓過 Qwen3.5-9B(53.1)和 Gemma4-12B(44.2),已開源於 HuggingFace。
arxiv: 2607.22083現有評測假設工具介面是固定的,但現實中 MCP server 會持續更新。這篇測了工具升版後 12 個頂尖模型的能力退化,發現包括 GPT-5.4 和 Claude 在內的前沿模型都會明顯掉分 13-14%。
arxiv: 2607.14642多步驟 Agent 任務不能每次呼叫 LLM 都重新選模型;TRACE-ROUTER 改成任務入場時選一次模型並釘死到任務結束,用最終結果回饋訓練選模型的策略,比傳統路由方式在相同延遲下多出 7–8 個準確率百分點。
arxiv: 2607.22465涵蓋 90 個一級領域、354 個二級領域的 1,431 題 Agent 評測集,橫跨消費者、企業、工程三大場景;頂尖模型(Claude Sonnet-5 得 58.54%、GPT-5.6-Sol 得 57.14%)得分都低於 60%。
arxiv: 2607.14989把 AI Agent 丟進一間虛擬公司,讓它用 email/Slack/Jira 完成任務,同時要遵守一本 20~124 頁的員工手冊——最強模型只有 36.2% 通過。
arxiv: 2607.25398三份可直接跑的 LangGraph 食譜:SQL 自動修復迴圈、有閘門的 Agentic RAG、人工審核中斷點,外加一張「什麼時候不要用 LangGraph」的決策表。
arxiv: 2607.19297500+ 工具、16 個應用領域的多模態工具呼叫 benchmark:Agent 要同時看圖找 UI 元素再決定叫哪個工具——12 個主流模型中最強的成功率也不到 50%。
arxiv: 2607.11818用真實 SRE on-call 場景測試 LLM Agent 的故障根因分析(RCA)能力:1,079 個任務、真實 telemetry 介面、SRE 人工審核答案——最強模型答對率僅 40%,拿掉源碼存取後每個指標都掉。
arxiv: 2607.28545Coding Agent 開的 PR,79.4% 都有另一個 PR 同時進行中——幾乎都是同一個 Agent 自己和自己衝,不是不同 Agent 互打。
arxiv: 2607.04697AI Agent 有五大安全漏洞類別,現有評測沙箱裝不住真正有能力的 Agent——這篇整理防禦對策,並以 2026 年七月 HuggingFace/OpenAI 真實事件作 case study。
arxiv: 2607.25379Agent 在讀取可疑資料前先開一條「隔離通道」,把危險控在那條通道裡,讀完後再由受信任的清洗器決定哪些資訊可以帶回主上下文,讓安全與可用性不再是零和遊戲。
arxiv: 2607.24625把「記憶管理」當成獨立技能來訓練,完全不改模型的任務行為,光是優化記憶就讓 32B 開源模型在長程遊戲上達到 Claude Opus 4.5 的水準(Crafter 51.4% vs 49.5%)。
arxiv: 2607.01224給頂尖 Agent 六天時間和數千美元算力,讓它獨立研究一篇未公開的 NeurIPS 2026 論文的核心問題。原作者看完:全部否決。Agent 能做工程,但不會做研究。
arxiv: 2607.27191現有 Agent 安全測試用靜態攻擊語料,但真實攻擊者看見防禦失敗後會調整策略。這篇把 LLM 當攻擊者、讓它自適應地打 15 輪——攻擊成功率從 0–1% 飆到 5.4–14%,且攻擊模式跟現有 benchmark 完全不重疊。
arxiv: 2607.18063SkillEvo 用多輪互動回饋取代單輪 QA 評估,讓技能進化不會在第一輪就停滯,比自我反思進化高 23 分;SkillShapley 把 Shapley 值搬進技能步驟歸因,用 99 次評估就能逼近精確排序,並發現「決策橋接步驟」才是高價值步驟;MindMemOS 用實體-屬性-時間結構統一記憶管理,LOCOMO 準確率 94%,技能進化讓 SpreadsheetBench 成功率提升 9.2 個百分點
Harness-IF 揭示 Coding Agent 的指令遵從度被高估 3.6-7.4 個百分點,因為模型本來就會做的事被算成了遵從;SHE 把 harness 拆成四個安全元件並從軌跡失敗自動演化,ASR 降低 3.1 倍且正確率提升;SBCO 用分解式驗證器銀行搭配文本梯度做 harness 自我改進,在規劃任務上以 4-5.5 倍更少的算力追平 Gödel Machine
Muscle Memory 提出「編譯式記憶」取代檢索式記憶,在 90 個場景中贏下 88.9% 的個人化對決;MoRSE 用 role-subtask 條件化 LoRA 專家讓多 Agent 在程式碼生成上顯著超越純 prompt 分工;ASCon 建立統一故障歸因模型,在三種歸因目標上分別提升 5.83%、10.63%、14.73%
OneDayAgent 用任務分解+執行記憶+全域驗修三步鷹架在 AgentIF-OneDay 拿下 0.821 新 SOTA,同一鷹架跨五個後端穩定運作;The Horizon Gap 綜述 1,547 篇論文發現長程 Agent 六大失敗類別共享同一結構模式——純結果訊號隨步數增長而失效,領域正在製造更密的過程訊號來補;Evo-Bench 首次測量 Agent 自動進化鷹架的能力,GPT-5.6 Sol 最高拿 +16.6 分,但 Office 任務仍需人工流程
ToolLIFT 把工具軌跡提升到功能層工作流圖,在三個 OOD 基準上持續超越 SOTA;SkillTV-Bench 用 681 案例證明技能感知的裁判技能讓 Agent 評判準確率提升 14.8 個百分點;TRIO-20 用預設等價研究發現 GPT-5.6 在 840 條軌跡中零越權呼叫,但推理力度提高讓規則探查率上升了 14.3 個百分點
今天三篇各從不同角度審視 AI Agent 的能力與極限:AutoMem 告訴你「記憶管理」是可以自動學習的獨立技能,光優化記憶就讓 32B 開源模型達到頂級商用模型水準;Shadow Evaluation 用真實 NeurIPS 投稿測試頂尖 Agent 能否做開放式 AI 研究——答案是否定的,Agent 能工程但不會研究;Adaptive Adversaries 揭示現有安全評測嚴重低估威脅:加上自適應多輪攻擊者,攻擊成功率從 0–1% 跳到 14%。三篇合起來是一堂清醒課:知道 Agent 能自動變強在哪、不能在哪、以及你的安全測試可能根本不夠。
今天三篇各從不同角度逼視「Agent 在真實環境裡出事了怎麼辦」:ProACT 問的是多人協作中 Agent 應何時開口(Agent UX 設計問題);第二篇用真實 GitHub 資料揭露 Coding Agent 和自己開的 PR 互衝(平台 ops 痛點);第三篇從安全視角整理 Cyber-capable Agent 五大漏洞類別,以今年七月的 HuggingFace/OpenAI 事件為 case study。三篇合起來是一堂「Agent 上線後,你沒想到的麻煩都在這裡」速成課。
今天三篇論文從不同角度逼問「AI Agent 在現實任務中的真實極限」:ORCA-bench 把 LLM Agent 丟進 SRE on-call 的生產環境做根因分析,最強模型也只答對 40%;AgentS4D 揭露工作區 Agent 的安全黑箱——66% 的「成功執行」背後仍觸發了危險行為,任務完成不等於安全;Context Files 研究則以 288 次對照實驗發現,開發者普遍維護的 [AGENTS.md](http://AGENTS.md) / [CLAUDE.md](http://CLAUDE.md) 對 coding agent 的正確率幾乎沒有可量測的提升。三篇合讀,讓你對「A
今天三篇論文都在問同一個核心問題:**現在的 AI Agent 真的能用嗎?** 答案出奇地一致——還差得遠。[HANDBOOK.md](http://HANDBOOK.md) 揭露把最強前沿模型丟進虛擬公司後,企業政策合規通過率最高只有 **36.2%**;LangGraph 論文給出三份可落地的有狀態工作流食譜,並附上「什麼時候不要用 LangGraph」的決策指南;MM-ToolSandBox 則首次量化了「看圖+叫工具」這個多模態組合技的困難程度——12 個主流模型中最強的成功率也不到一半。三個維度:合規評估、框架設計、視覺工具,串起一張「Agent 離真正落地還有多遠」的完整地圖。
今天三篇圍繞「讓 Agent 更可靠、更好部署、更客觀評估」三個核心問題:TRACE-ROUTER 指出多步驟 Agent 流程不能套用「每次呼叫都重新選模型」的路由策略,改用任務級別路由搭配強化學習持續優化;OmniaBench 建立橫跨消費者、企業、工程三大場景的 1,431 題評測集,頂尖模型(Claude Sonnet-5)得分仍不到六成;自我校準 Agent 框架則示範如何用 ARIMA 時序預測幫 Agent 在無人監督下偵測並修正預測漂移。
今天三篇論文從三個角度直擊 Agent 平台核心挑戰:**AgentCompass** 提出可組合的開源評測基礎設施,終結 agent 評測各自為政的碎片化亂象;**Agents in the Wild** 是少見的生產落地報告,從藥物研發與金融系統的真實部署歸納出可複用的設計模式;**Nanbeige4.2-3B** 則証明 3B 小模型配上 Looped Transformer 與大規模 agentic RL,在 agent 任務上可以壓過 9B 甚至 12B 的競爭對手——對邊端部署或成本敏感場景有直接啟示。
今天三篇論文從三個角度精準刺中 AI coding agent 的能力邊界:**ICAE-Bench** 挑戰「模糊需求下的互動式開發」場景,揭示當前 benchmark 跟不上 vibe-coding 時代;**EvoAgentBench** 揭露 agent 自我進化能力轉移的陷阱,主流方法竟造成 −12.3 分的負遷移;**PERFOPT-Bench** 則開闢「效能優化作為 agentic task」新賽道,並發現 framework 選擇往往比模型選擇更關鍵。三篇合讀的重點:生產環境的 agent 評估遠比現有工具複雜,業界亟需更貼近真實場景的評估體系。
今天三篇分別從生態、失敗、記憶三個角度切入:哪些開源 Agent 框架真正值得長期下注(不只看 star 數)、Agent 在哪六類問題上反覆翻車、以及如何讓 Agent 的長期記憶跨越多個人物做串聯推理。三篇合在一起,像是給 Agent 平台開發者的「框架選型依據 + 失敗防護清單 + 記憶系統升級方向」。
今天三篇的共同主題是:**我們測 agent 的方式,本身就有問題**。第一篇直接審計主流工具呼叫 benchmark,發現近兩成的分數是評錯的;第二篇用重播分析告訴你哪些 benchmark 不用跑完就能得出可靠結論(SWE-bench 是反例);第三篇推出首個將「執行任務」與「生成操作教學」合二為一的多模態 web agent benchmark,截圖輸入、雙目標評測,最強模型也只完成不到四成。三篇合讀能讓你對 agent 評測的現況有完整的危機感與應對方向。
三篇論文從基礎設施、可觀測性、評估三個角度切入同一個核心問題:「如何打造真正可靠的 agent 系統?」Dyserve 用數學最佳化在 60ms 內決定 agent workflow 每個節點要用哪個 LLM,在精準度和延遲上同步超越所有 baseline;AgentLocate 解決 multi-agent pipeline 出錯時「不知道哪個 agent 搞的鬼」這個 ops 噩夢,自動定位責任 agent 和出錯時間點(COLM 2026 accepted);PolyWorkBench 則給出一記警告:現有頂尖 LLM agent 在多語言工作流中表現大幅劣化,全球化產品場景還有很長的路
今日三篇論文從三個不同角度審視 AI coding agent 的落地挑戰:第一篇用系統性實驗揭露 coding agent 在安裝套件時可被普通 README 發動供應鏈攻擊,且防禦能力主要取決於 harness 框架而非模型本身;第二篇提出 BPO 演算法,專為 sandbox-native agent 強化學習設計,只在高熵關鍵決策點分叉採樣提升訓練效率;第三篇以電網研究為案例,展示 MCP 如何作為標準協議串接工業場景的 domain-specific 仿真工具,為垂直領域 agent 落地提供可複製模板。
今天三篇各從不同角度解決 agent 平台的核心痛點:第一篇從「前端 UX 設計」切入,提出讓電商網站對 AI 瀏覽器 agent 友善的框架,成功率從 49% 提升至 89%;第二篇攻的是「搜尋型 agent 亂猜答案」問題,用動態棄答 RL 訓練讓 agent 知道何時該說「我不確定」;第三篇則帶來具身機器人的 agent OS 架構,其多模態圖記憶與技能隔離設計對通用 agent 平台有直接啟發性。三篇合起來覆蓋了 agent 的「前端 UI 介面設計」→「推理可靠性訓練」→「執行層記憶架構」完整鏈路。
今天三篇論文從三個截然不同的角度照亮 AI Agent 平台的現況:第一篇 LHTB 用 46 道長程終端機任務測出目前最強模型也只能解決約 28%,揭示 agent 距離真正自主作業仍有很長一段路;第二篇從安全角度發現多 agent 系統裡的「碎片化效應」讓傳統每個 agent 逐一監控的防禦策略幾乎失效;第三篇則從記憶體架構切入,用 3 個數量級的延遲差距,論證把記憶體放進 agent 推理迴圈本身才能有效消除冗餘行為。
今天三篇論文從三個實戰角度切入 AI Agent 平台:第一篇揭露多 Agent 系統在生產環境中面臨的隱蔽安全威脅,並提出以「激活空間」偵測惡意 agent 的新框架(非同步環境下 F1 比現有方法高出 +0.55);第二篇改善 coding agent 的 retrieval 策略,引入「程序相似性」讓 AI 能找到解題步驟相近但表面不同的程式碼;第三篇則是重磅提醒——同一個 LLM 放進不同 harness,agent 的中途判斷就會出現顯著偏差,harness 設計根本不是中性的工具。
今天三篇論文共同呼應一個趨勢:生產環境 agent 的瓶頸已不在模型能力,而在「狀態管理」。第一篇(Amazon)展示把重複步驟預先編譯成工具,可讓 p50 延遲降 42%、錯誤率降 53%;第二篇提出讓獨立記憶 agent 主動把關鍵狀態「推送」給行動 agent,解決長程任務中資訊遺失(behavioral state decay)的問題;第三篇以遞迴多 agent 架構克服單一 agent 無法同時廣又深的 web 研究限制。三篇合看:**工具化(tool compilation)、主動記憶(proactive memory)、遞迴分工(recursive orchestration)*
今天三篇論文都在追問同一件事:Agent 系統如何才能「可靠地」運作?STRACE 解決的是優化輸入太雜——從大量噪音失敗軌跡中精準找出真正的根因,讓 Agent 的自動優化不再被冗餘案例帶偏;The Blind Curator 揭示一個令人不安的靜默失效模式——自我進化 Agent 的技能淘汰機制會因為 LLM 評審偏差在某個閾值後徹底停擺,光靠增加數據救不回來;Severity Scale 則把「Agent 被攻擊後到底有多嚴重」從二元的成功/失敗,變成七段式的行動傷害評分,讓安全評測終於有細緻度。三篇合看:優化品質、自我進化健全性、安全評測精度——三個不同層面,共同指向 Agent 可信
今天三篇論文共同描繪 Agent 平台的「進化前線」:EvoSOP 讓 Agent 不再每次從零重組工具,而是從過去執行歷程中自動萃取可重用的 SOP,讓工作效率顯著提升;AgenticSTS 對長任務記憶提出嚴格的「有界合約」設計,用五層結構化提取取代無止盡的 context 堆疊;Spider 2.0-AIFunc 則揭示 AI 函式已被直接嵌入雲端 SQL 語法,但最強模型準確率僅約 67%,是資料 Agent 必須面對的新挑戰。三篇合看:從工具效率、記憶架構到資料能力,勾勒出 2026 年 Agent 平台亟需補強的三個關鍵短板。
今天三篇論文聚焦同一個核心問題:現有 AI Agent 系統在「理想實驗室」與「真實部署」之間存在巨大落差。AgentGym2(ACL 2026)用新 benchmark 量化了評測的失真;Agentic RL 系統提出讓 agent 在生產環境持續自我進化的工程架構;ComfyClaw 則展示在圖像生成工作流中落地「技能自我進化」的完整範例。三篇合看,正是一張從「評測 → 部署 → 運行中進化」的完整地圖。
今天三篇論文從不同角度同攻一個核心問題:**如何讓 Agent 工作流程在生產環境中真正可靠**。Mnemosyne 把資料庫的「交易(Transaction)」概念搬進 Agent 工作流程,讓 LLM 每個輸出都要先通過准入審核才能生效;PaperPilot 展示如何訓練 9B 小模型學會以 DAG(有向無環圖)規劃多輪搜尋工作流程,並根據用戶回饋動態修正整個流程;SEA 讓 Agent 邊跑邊改善自己,同時發出可被稽核的安全憑證。三篇合在一起幾乎覆蓋了 Agent 系統可靠性的完整棧:執行層保護、訓練層工作流程學習、更新層安全演化。
今天三篇從不同角度觸碰 agent 平台的核心痛點:ReContext 提出免訓練的 inference-time 解法,讓 LLM 在 128K 長文中不再「視而不見」關鍵證據;第二篇揭示 multi-agent 辯論系統中,agent 因社會階層情境出現系統性「表裡不一」(divergence 3% → 40%);第三篇則對三個業界最常引用的 coding agent benchmark 發出警報——SWE-Perf 僅 8% 任務可靠重現,排行榜分數的可信度值得嚴肅質疑。
今日三篇共同揭示一個核心張力:現有 agent 系統在封閉環境下表現亮眼,但只要環境稍有偏移就會出現嚴重退化。ICML 2026 論文從工具使用角度系統化量化了這個問題;第二篇展示如何用 6 個專精 agent 的流水線完成跨域複雜任務;第三篇則從 UX 角度提醒:agent 的「個性表達強度」不是越強越好,中等才是甜蜜點。
今日三篇分別瞄準 Agent 平台的三大核心難題:**記憶如何從「撈資料」升級成「推理狀態」**(User as Code)、**多 Agent 如何去掉中央協調者卻更省成本**(DeLM),以及**Web Agent 執行後如何讓人快速驗證結果**(HANSEL)。三篇合在一起,幾乎就是一張高信任 Agent 平台的技術地圖——記憶層、協調層、可解釋層各攻一塊。
今天三篇涵蓋 AI Agent 生態的不同維度:Qwen 團隊推出首個跨七大 agent 領域的「語言世界模型」,讓 agent 能在模擬環境中訓練而非倚賴真實 API;快手 AgentX 展示多 Agent 系統在工業規模下的生產部署成果,把推薦算法迭代效率提升至人工的 13.8 倍;OpenAI 則用 Codex 真實使用數據,首次量化 agentic AI 正在如何改變各職能工作者的實際產出,並揭示非技術職能(法務、研究)的 agentic 紅利甚至超越工程師。
今天三篇論文共同聚焦在一個核心問題:**我們到底怎麼評估 agent 夠不夠好?** SWE-Explore 把 coding agent 最被忽視的中間步驟——讀懂程式庫——單獨拿出來測;Claw-SWE-Bench 揭示框架設計(harness adapter)才是讓 coding agent 分數暴漲的真正槓桿,同一模型換個 adapter 就能從 19% 跳到 73%;Red Queen Gödel Machine(Cambridge × NVIDIA)則走得更遠,讓評測者本身也跟著 agent 一起進化,打破靜態 benchmark 的天花板。三篇合看:**evaluation in
今天三篇從不同角度觸碰 Agent 平台的核心痛點:一篇把 Agent 記憶體拆成四個可量測的系統模組,揭示現有評估只看「答對沒」根本不夠;一篇借用軟體工程「設計審查」觀念,讓 Agentic Workflow 在上線前就能被自動驗證;另一篇用 14 組大規模平行實驗證明——你信任的那個 benchmark 排行榜,換個情境排名就洗牌,並提出更可靠的替代指標。
今天三篇各攻一個角度:第一篇 **RigorBench** 問的是「AI coding agent 怎麼解題」而非只看答對率,提出五維流程紀律指標;第二篇來自產業實踐,教你如何把大型 LLM multi-agent 系統客製化、加速,讓企業真的用得起(實測 4.48 倍吞吐量提升);第三篇則從治理角度出發,為 AI 融入軟體開發生命週期提出一套正式協議語言,讓「哪些決定讓 AI 做、哪些要人工審核」從 prompt 裡的一句話,變成可機器驗證的規格。三篇合起來覆蓋「怎麼評估、怎麼部署、怎麼治理」。
今天三篇都在探索「agent 能力的邊界與突破路徑」。Sakana Fugu(Sakana AI)訓練了一個 0.6B 的協調器模型,學會動態指揮一池 frontier LLM 分工,在 SWE-Bench Pro 等多個榜單達到公開 SOTA——核心命題是「orchestrator 本身可以被訓練,而不只是工程師寫死規則」。NatureBench 用 90 個 Nature 期刊的真實科研任務反問:coding agent 真的能做科學發現?最強配置只勝過原論文 SOTA 17.8%,且靠的是把問題「翻譯成熟悉的 ML 任務」,不是真正的發明。最後,《Rising from the Ashe
今天三篇從工具可靠性、協定選型、多 Agent 協作三個角度切入 Agent 平台的痛點:PlanBench-XL 揭露頂尖 LLM 在真實大型工具環境下一遇到工具失效就崩潰(GPT-5.4 從 52% 跌至 11%);TU Munich 給出第一份 MCP/A2A/ACP/ANP 等 9 個協定的技術分類法,讓選型有系統依據;AMD 的 Arbor 提出以樹狀搜尋作為多 Agent 的共享認知空間,讓失敗也成為有用的探索訊號。三篇合在一起,恰好描繪出 2026 年 Agent 平台的三塊基礎設施缺口。
今天三篇從「agent 在生產環境的可靠性與安全性」出發,覆蓋推論期、訓練期、基礎設施三個層次。LedgerAgent 用推論期的輕量「帳本」結構,讓工具呼叫 agent 不再把所有狀態塞進 prompt 靠 LLM 重建——直接降低政策違反與狀態錯誤;Alibaba 的 Connect the Dots (CoD) 則往更遠看,以強化學習訓練 agent 在長期部署中邊執行任務邊更新對環境的認識,跨任務越跑越準;Sovereign Execution Brokers 從安全基礎設施切入,在 agent 每次「動生產系統」的那一刻插入憑證驗證,把「授權的動作」和「實際執行的動作」嚴格綁定。三篇
今天三篇從不同切面拼出「agent 在真實世界怎麼落地」的全貌:Perplexity + 哈佛商學院用生產數據首次量化 agent 對比對話助理的差距——完成時間縮短 87%,而且 agent 吸引了認知複雜度更高的工作類型;Self-Harness 示範 agent scaffolding 如何不靠人工自動挖弱點、自動修,三個主流模型各獲 33-60% 相對提升;The Consistency Illusion 拆穿多 agent 辯論的核心陷阱——輸出層共識可能掩蓋底層推理根本不一致。三篇合讀的訊號:agent 真正的競爭力不在於模型更強,而在於「生產數據驅動的 scaffolding 自
今天三篇都在動搖 Agent 領域的「常識」:ACCORD 實驗揭示 agent 普遍犯的「自以為了解指令」問題(靠假設而非觀察行動),提出主動接地框架讓 AppWorld 成功率從 42% 跳到 62.6%;《多智能體的幻覺》以嚴格評測證明,自動生成的多智能體架構在計算成本高出 10 倍的情況下反而比不過單 agent + CoT-SC;《非常非常 Agentic》則用 GitHub 大規模實證資料揭示,AI 程式碼 Agent 在新建專案的採用率已是一年前的兩倍多。三個訊號合起來:Agent 工具快速普及,但「多 agent 必然更強」和「agent 理解你的指令」這兩個核心假設,正在被資
今天三篇論文圍繞 Agent 平台的三個關鍵基礎設施層:HarnessX 提出一套「Harness 即可進化元件」的框架,讓 Agent 執行環境從靜態腳架變成自我最佳化系統,在 5 個 benchmark 上平均提升 +14.5%;第二篇研究多 Agent 協作中的「技能條件信任」路由問題,揭露什麼條件下細分信任真的有用、以及如何被攻擊者劫持;OCELOT 則從資安角度切入,提出「後驗洩漏預算」機制,防止 Agent 一步步把使用者隱私累積洩漏給外部服務。三篇合起來覆蓋框架設計、多 Agent 治理、隱私安全——恰好是落地 Agent 平台時最常踩到的三條坑。
今天三篇論文從「訓練 → 架構 → 環境」三個層次,一起回答同一個問題:怎麼讓 Agent 在真實系統裡更可靠?RefGRPO 找出 Agent RL 訓練中被忽略的反思校準問題,讓 Agent 成為自己的驗證器;「Agents All the Way Down」給出從 LLM substrate 到上線部署的完整 custom agent 方法論,強調地基穩固比框架選擇更重要;EurekAgent 則以自主科研任務為場景,證明「環境工程」比「流程工程」更決定 agent 的可靠性上限。
今天三篇從不同角度描繪「2026 年的 agent 現實」:UC Berkeley 用 1,000+ 個真實職場任務做成的 benchmark 顯示,當前最強 agent 在最難任務上平均只通過 2.6%;Microsoft 研究者訪談 17 位開發者後發現,他們都在無意識地發展出 4 種即興「監督工作」,但現有工具幾乎沒有支援;Reins AI 的工坊論文則指出,在 agent 系統還不夠成熟的部署期,傳統任務層監控根本看不到最嚴重的結構性故障。
今天三篇論文從不同角度切入同一核心問題:**如何在真實部署條件下評估與運行 AI Agent?** Emergence World 建立持續運行數週的多 Agent 沙盒,揭露短期 benchmark 看不到的行為漂移與跨模型交叉影響;Survey 論文為 agent 執行環境設計建立完整分類學(8 屬性 × 8 領域),並提出 symbolic vs. neural 兩種自動合成範式;Martin Monperrus 的 position paper 則直接宣告:coding agent 已達門檻,人工 code review 可以退場了。
今天三篇論文從「如何評量 agent」和「agent 究竟是什麼」兩個角度出發:T1-Bench 建出橫跨 25 個真實業務領域的高仿真 benchmark,讓多領域跨域推理能力首次有系統性量化基準;VISTA 解決「用 LLM 模擬使用者測 agent」的可信度難題,提供 6 個指標量化你的測試有沒有真的覆蓋 agent 的能力邊界;Agentic Software 則從第一原理釐清:當 LLM 成為主推理引擎時,軟體的本質已變——這直接影響 agent 平台的除錯工具和測試策略設計。
今天三篇論文呼應同一主題——讓 Agent 從實驗走向可靠的生產環境:一篇是超大規模雲端部署的多 Agent 故障排除架構實戰,自主解決率達 90%+;一篇提出讓 Agent 記住過去工具呼叫成功失敗的記憶機制,不用重訓模型就能持續進步;一篇則首次系統比較六款 AI 輔助開發流程框架,提供六個維度的選型參考。
今天三篇都圍繞 **coding agents 的安全邊界與能力優化**:SABER 用第一個「可執行工作區」benchmark 發現即使最好的模型也有超過 54% 的危險操作率;第二篇讓 100 多位真人開發者跟「暗中破壞」的 AI agent 共事五小時,94% 的人沒抓到;SePO 則展示了只靠自動優化 system prompt(不改模型),就能在五個 benchmark 平均提升 4.49 分。三篇合起來提醒平台開發者:agent 的安全問題比想像中更難量測、更難被人察覺,但也存在低成本的改善路徑。
今天三篇分別對應 agent 平台堆疊的三個層次:AgentJet(訓練層)提出讓多個異質 LLM 同步做強化學習訓練的分散式框架,解決現有工具只能單模型訓練的根本痛點;AdaPlanBench(評測層)用 67.75% 的成績上限揭示 LLM agent 在「規則邊走邊揭露」的現實場景中遠未成熟,是第一個系統量化這種適應性規劃能力的 benchmark;Beyond Tokens(通訊層)整理了 multi-agent 系統改用「傳 embedding 而非傳文字」的研究現狀,提供分類框架評估這條新通訊路徑的工程取捨。
今天三篇都在問 agent 平台的「基礎建設怎麼選」:ADK Arena 首度量化比較 LangGraph、AutoGen、CrewAI 等多個主流框架的真實任務完成率與成本差距,讓框架選型終於有量化依據;Agent Memory 提供第一個從電腦系統視角分析 10 種記憶方案的 taxonomy,幫工程師評估延遲、頻寬、可擴展性的取捨;Search-Time Contamination 則質疑 deep research agent 的 benchmark 分數可信度——agent 在評測時可以直接搜到答案,分數最多虛高 4%。三篇合看,agent 平台的三個核心決策點(框架選型、記憶架構、
今天三篇圍繞 agent 系統三個深層問題:**記憶架構**(哪種設計能真正跨場景通用?)、**自我進化能力**(AI 能不能自己開發 agent?)、**安全盲區**(CUA 的安全性在不同場景下差距有多大?)。AutoMEM 告訴我們主動控制自己記憶的 agent 比依賴外部管道更泛化;Meta-Agent Challenge 揭示現在前沿模型距離「自主開發 agent」仍有顯著落差;Domain-Conditioned Safety 則發現 Claude Sonnet 4.6 在網頁任務的 prompt injection 攻擊成功率是 0%,但在程式碼場景中同樣的模型被攻破率高達 10
今天三篇分別從「評測診斷」、「工具進化」、「安全對齊」三個角度補強 Agent 平台的核心短板:APB 提出一套 4,209 道題的診斷型 benchmark,首次能把「規劃失敗」和「執行失敗」分開來看;MetaForge 讓 agent 能在運行時「自行鍛造」沒有的工具,打破靜態工具庫的天花板;RUBAS 把 agent 安全問題細分成四個評分維度,用強化學習讓模型學會在實用性和安全性間找到平衡。三篇合看:你的 agent 系統能不能被診斷、能不能自我擴展、能不能安全上線——這三道關卡今天同時被研究者正面回應。
今天三篇從不同層次切入「如何建造更可靠、更可進化的 Agent 系統」:第一篇用真實執行軌跡首次揭示多模型 Agent 系統的 LLM 呼叫成本,讓平台工程師能用數字說話;第二篇提出把整個記憶流水線當成可自我演化的程式碼,解決長期任務中記憶架構對齊失效的痛點;第三篇補上評測盲點,指出現有 Agent 持續學習 benchmark 無法真正辨別「學到了什麼」,並給出更嚴謹的 controlled stream 框架。
今天三篇論文切入三個不同層次:BenchTrace 跑了 1,821 個 agent 失敗片段,發現 GPT-4.1 和 Qwen3-32B 連「讀懂自己哪裡錯了」都不到三成通過——反思能力遠比想像差;Beyond Autonomy 從企業 SaaS 生產環境萃取出三層治理架構,是現有 agent framework 缺的那塊「治理」拼圖;Insuring Every Action 則用保險精算概念替每個 agent 動作定價與設定保證金,開創了全新的 runtime 風險語言。共同主軸:agent 走向企業部署的核心挑戰,已從「能不能做」演變成「做錯了怎麼辦、誰負責審查、損害怎麼量化」。
今天三篇論文從三個角度補齊 agent 平台知識:AgentFugue 展示多個 peer agent 共享「推理暫存筆記」可突破長任務協作瓶頸;Can Agent Benchmarks Support Their Scores? 揭露當前 agent benchmark 的評分機制存在系統性漏洞,排行榜數字需重新審視;VibeServe 則讓 agent 自動生成整套 LLM serving stack,在特殊部署場景下超越手工優化的 vLLM。三篇合起來分別回答了「agent 怎麼協作更強」、「我們信任的評測數字是否可靠」以及「agent 能幫工程師做基礎設施嗎」。