Skip to content
← Daily Digest

部署與生產化

Deployment & Production

推理成本、延遲最佳化、可觀測性、企業落地、規模化

論文時間軸(25 篇)

2026-06-03
BAGEN: Are LLM Agents Budget-Aware? 必讀

系統性測試 5 個 frontier 模型是否具備「預算感知」能力,結果全員失敗:任務能力強不等於預算感知強(r=0.35),所有模型都過度樂觀,在注定失敗的任務上持續燒錢。

arxiv: 2606.00198
2026-06-05
RUBAS: Rubric-Based Reinforcement Learning for Agent Safety 必讀

把 agent 安全問題拆成四個細粒度維度打分,用這個「評分標準(Rubric)」作為強化學習的獎勵訊號,讓模型學會在安全和實用之間找到真正的平衡,而非一律拒絕。

arxiv: 2606.04051
2026-06-07
Search-Time Contamination in Deep Research Agents: Measuring Performance Inflation in Public Benchmark Evaluation 略讀

Deep research agent 在評測時會搜尋網路,而 benchmark 答案也在網路上——這種「邊考試邊查答案」現象讓分數最多虛高 4%;Alibaba 團隊定義三種汙染類型並開發偵測演算法,質疑現有評測數字的可信度。

arxiv: 2606.05241
2026-06-09
SePO: Self-Evolving Prompt Agent for System Prompt Optimization 略讀

一個 AI「優化 agent」不只幫你寫更好的 system prompt,也同時把自己的 system prompt 一起優化——不改模型,在五個 benchmark 上平均提升 4.49 分。

arxiv: 2606.04465
2026-06-11
AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving 略讀

現有 LLM serving 模擬器把每個對話 turn 當獨立請求,完全忽略 agent 跨輪次的 KV cache 重用和工具呼叫等待;這篇建了第一個把 agent 當「有狀態程式」來模擬的 hardware-aware 模擬器。

arxiv: 2606.09613
2026-06-13
TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning 略讀

訓練 Agent 時大部分的「跑樣本」都在浪費算力;TRACE 用樹狀結構把 rollout budget 導到最有學習價值的岔路口,同樣算力讓 Multi-Hop QA 多學 2.8 分。

arxiv: 2606.11119
2026-06-15
Monitoring Agentic Systems Before They're Reliable 略讀

agent 系統還不穩定就上線時,傳統任務層監控會失靈;這篇提出 3×3 監控框架,幫你找出「哪根線沒接好」。

arxiv: 2606.02494
2026-06-16
Closing the Reflection Gap: A Free Calibration Bonus for Agentic RL 必讀

LLM Agent 明明答對了卻說「我答錯了」——本文用一個不需額外標注的校準獎勵修正這個反思偏差,讓 Agent 真正成為自己的驗證器。

arxiv: 2606.14211
2026-06-17
Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents 必讀

小模型面對 250 個工具的 MCP 目錄幾乎癱瘓(執行成功率 3%),Evoflux 用推論時的演化搜尋反覆修復失敗的工具 graph,把成功率拉到 17–24%——不需要 fine-tuning。

arxiv: 2606.12674
2026-06-19
ACCORD: Action-Conditioned Contextual Grounding for Language Agents 必讀

Agent 常常「以為自己知道」使用者的意思,其實只是靠假設在行動;ACCORD 讓 agent 在每個行動前主動去環境裡確認「我真的有這個資訊嗎?」,AppWorld 成功率從 42% 跳到 62.6%。

arxiv: 2606.16432
2026-06-21
How AI Agents Reshape Knowledge Work: Autonomy, Efficiency, and Scope 必讀

Perplexity 的真實生產數據:把功能從「對話搜尋」升級為「自主 agent」之後,每次任務自主執行時間從 33 秒跳到 26 分鐘、完成時間縮短 87%、用戶滿意度更高——而且 agent 吸引了認知複雜度更高的工作類型。

arxiv: 2606.07489
2026-06-22
LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents 必讀

工具呼叫 agent 常常「知道事實卻用錯」:資訊都在 prompt 裡,但每次決策時 LLM 需要自己從文字中重建狀態,一旦重建出錯就違反政策或拿陳舊資料做決定。LedgerAgent 在 agent 迴圈中插入一個明確的型別帳本,把狀態從 prompt 文字裡分離出來,不需要任何微調。

arxiv: 2606.20529
2026-06-22
Sovereign Execution Brokers: Enforcing Certificate-Bound Authority in Agentic Control Planes 略讀

企業部署 agent 時,「批准一個動作」和「執行那個動作」之間存在安全漏洞:現有存取控制在 identity 層,assurance 在 plan 層,但在「agent 真的動 AWS / K8s 的那一刻」缺乏強制驗證點。Sovereign Execution Broker (SEB) 就是插在這個瞬間的憑證驗證與執行邊界。

arxiv: 2606.20520
2026-06-26
Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications 必讀

把 LLM multi-agent 系統推向企業生產的兩大卡點是「Domain 適配」和「推理成本」,這篇提出兩階段框架:先客製化(持續預訓練 + SFT + 偏好最佳化),再加速推理(推測解碼 + FP8 量化),實測吞吐量提升 4.48 倍。

arxiv: 2606.18502
2026-06-28
Self-Compacting Language Model Agents 必讀

Agent 跑長任務時 trace 越積越長最終爆 context,SelfCompact 讓 LLM 自己判斷何時壓縮記憶,比固定間隔方案更準確,且節省 30-70% token 成本。

arxiv: 2606.23525
2026-07-02
HANSEL: Extracting Breadcrumbs from Web Agent Trajectories for Interactive Verification 略讀

Web Agent 執行完任務後,HANSEL 自動從瀏覽歷史中抽出「最關鍵的幾頁」讓用戶點進去驗證,比起讓人看完整 log 省了 61% 的軌跡量。

arxiv: 2606.18671
2026-07-03
Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use 必讀

精心訓練的 agent(不論 SFT 還是 RL)放到和訓練時不一樣的環境,表現就會明顯下降——這不是個別模型問題,而是系統性問題。

arxiv: 2607.01084
2026-07-05
ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning 必讀

不改模型、零訓練,推理時用「模型自己的注意力分數」遞迴挑出相關片段重播給模型,顯著改善 LLM 在 128K 長文中找不到答案的問題。

arxiv: 2607.02509
2026-07-08
Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents 必讀

問題不是 RL 演算法不夠好,而是缺乏讓 agent 在生產中「邊跑邊進化」的系統基礎設施;這篇提出三大工程支柱讓企業規模的 agent 能持續自我更新。

arxiv: 2607.01120
2026-07-13
Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems 必讀

Amazon 把 agent 每次都要「重新生成」的固定操作程式碼,預先離線編譯成版本化工具——生產環境 p50 延遲降 42%、錯誤率降 53%。

arxiv: 2607.08010
2026-07-13
Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents 必讀

另開一個「記憶 agent」並行跑在行動 agent 旁邊,在關鍵時刻主動把重要資訊推送給它——Terminal-Bench 2.0 提升 +8.3pp,τ²-Bench 提升 +6.8pp。

arxiv: 2607.08716
2026-07-25
Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops 略讀

爬梳 1,250 篇論文、建立「AI 自我改良」的雙軸分類地圖,分清楚哪些是已可上線的「有界自我精煉」、哪些是還在研究的「無界遞迴自我提升」。

arxiv: 2607.07663
2026-07-28
AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities 必讀

把 agent 評測拆成三個可獨立抽換的零件(題庫、執行框架、執行環境),解決現在大家各做各的、無法重用的問題,並附帶自動偵測 reward hacking(作弊行為)的軌跡分析工具。

arxiv: 2607.13705
2026-07-28
Agents in the Wild: Where Research Meets Deployment 必讀

整合製藥與金融系統真實部署經驗的 agent 落地報告,歸納出三個讓 agent 從實驗室走向生產的關鍵設計模式:驗證管線、fallback 機制、人機協作節點(human-in-the-loop)。

arxiv: 2607.19336
2026-07-30
A Self-Calibrating Agentic AI Framework for Autonomous Edge Resource Allocation 略讀

LLM Agent 在開放環境中會隨時間漂移(預測越來越不準);這篇把 ARIMA 時序預測器嵌進 Agent 作為「自我校準器」,讓 Agent 在無人監督下自動偵測並修正漂移,準確率比基準 LLM Agent 高 91.7%。

arxiv: 2607.22400

相關 Digest(18 篇)

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-01

今天三篇論文從不同角度逼問「AI Agent 在現實任務中的真實極限」:ORCA-bench 把 LLM Agent 丟進 SRE on-call 的生產環境做根因分析,最強模型也只答對 40%;AgentS4D 揭露工作區 Agent 的安全黑箱——66% 的「成功執行」背後仍觸發了危險行為,任務完成不等於安全;Context Files 研究則以 288 次對照實驗發現,開發者普遍維護的 [AGENTS.md](http://AGENTS.md) / [CLAUDE.md](http://CLAUDE.md) 對 coding agent 的正確率幾乎沒有可量測的提升。三篇合讀,讓你對「A

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-30

今天三篇圍繞「讓 Agent 更可靠、更好部署、更客觀評估」三個核心問題:TRACE-ROUTER 指出多步驟 Agent 流程不能套用「每次呼叫都重新選模型」的路由策略,改用任務級別路由搭配強化學習持續優化;OmniaBench 建立橫跨消費者、企業、工程三大場景的 1,431 題評測集,頂尖模型(Claude Sonnet-5)得分仍不到六成;自我校準 Agent 框架則示範如何用 ARIMA 時序預測幫 Agent 在無人監督下偵測並修正預測漂移。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-28

今天三篇論文從三個角度直擊 Agent 平台核心挑戰:**AgentCompass** 提出可組合的開源評測基礎設施,終結 agent 評測各自為政的碎片化亂象;**Agents in the Wild** 是少見的生產落地報告,從藥物研發與金融系統的真實部署歸納出可複用的設計模式;**Nanbeige4.2-3B** 則証明 3B 小模型配上 Looped Transformer 與大規模 agentic RL,在 agent 任務上可以壓過 9B 甚至 12B 的競爭對手——對邊端部署或成本敏感場景有直接啟示。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-25

今天三篇從三個互補角度探索「讓 Agent 更可靠地解決複雜任務」。NVIDIA 提出把 Agent 寫成普通的 Python class,讓開發、測試、追蹤都像一般軟體一樣進行;BAAI 的 AREX 展示了能遞迴驗證並改良自身研究結論的深度研究 Agent,在 BrowseComp、HLE 等基準上超越同量級模型;第三篇爬梳 1,250 篇論文,為「AI 自我改良」這個混亂詞彙建立清楚的分類地圖,幫你分辨哪些技術已可落地、哪些還在研究階段。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-22

三篇論文從基礎設施、可觀測性、評估三個角度切入同一個核心問題:「如何打造真正可靠的 agent 系統?」Dyserve 用數學最佳化在 60ms 內決定 agent workflow 每個節點要用哪個 LLM,在精準度和延遲上同步超越所有 baseline;AgentLocate 解決 multi-agent pipeline 出錯時「不知道哪個 agent 搞的鬼」這個 ops 噩夢,自動定位責任 agent 和出錯時間點(COLM 2026 accepted);PolyWorkBench 則給出一記警告:現有頂尖 LLM agent 在多語言工作流中表現大幅劣化,全球化產品場景還有很長的路

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-13

今天三篇論文共同呼應一個趨勢:生產環境 agent 的瓶頸已不在模型能力,而在「狀態管理」。第一篇(Amazon)展示把重複步驟預先編譯成工具,可讓 p50 延遲降 42%、錯誤率降 53%;第二篇提出讓獨立記憶 agent 主動把關鍵狀態「推送」給行動 agent,解決長程任務中資訊遺失(behavioral state decay)的問題;第三篇以遞迴多 agent 架構克服單一 agent 無法同時廣又深的 web 研究限制。三篇合看:**工具化(tool compilation)、主動記憶(proactive memory)、遞迴分工(recursive orchestration)*

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-03

今日三篇共同揭示一個核心張力:現有 agent 系統在封閉環境下表現亮眼,但只要環境稍有偏移就會出現嚴重退化。ICML 2026 論文從工具使用角度系統化量化了這個問題;第二篇展示如何用 6 個專精 agent 的流水線完成跨域複雜任務;第三篇則從 UX 角度提醒:agent 的「個性表達強度」不是越強越好,中等才是甜蜜點。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-28

今天三篇分別從不同層次切入「打造生產級 Agent 系統」:一本涵蓋 LLM 基礎到 multi-agent 架構的全棧實用指南、一個讓 Agent 在長任務中自主決定何時壓縮上下文的輕量 scaffold、以及一篇把 Agent 強化學習信用分配從「工具呼叫點」精細到「token 層級」的訓練演算法。三篇合起來,正好串起「學什麼架構」、「跑起來怎麼穩」、「怎麼訓得更好」三個打造 Agent 平台的關鍵問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-22

今天三篇從「agent 在生產環境的可靠性與安全性」出發,覆蓋推論期、訓練期、基礎設施三個層次。LedgerAgent 用推論期的輕量「帳本」結構,讓工具呼叫 agent 不再把所有狀態塞進 prompt 靠 LLM 重建——直接降低政策違反與狀態錯誤;Alibaba 的 Connect the Dots (CoD) 則往更遠看,以強化學習訓練 agent 在長期部署中邊執行任務邊更新對環境的認識,跨任務越跑越準;Sovereign Execution Brokers 從安全基礎設施切入,在 agent 每次「動生產系統」的那一刻插入憑證驗證,把「授權的動作」和「實際執行的動作」嚴格綁定。三篇

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-17

今天三篇從不同角度挑戰「agent 工具使用與記憶」的基本假設:Evoflux 揭示小模型在 MCP 工具目錄前幾乎失能(執行成功率僅 3%),並用推論時演化搜尋把數字拉到 17-24%;FlowBank 指出 agent workflow 不必每次重新生成,預計算多樣化 workflow 倉庫再智慧路由,比手工設計高出近 15%;GitOfThoughts 則帶來最反直覺的發現:記憶對 agent 只在「問題幾乎一樣」時才有用,但 git 版本控制提供了一條以稽核性換取的工程之路。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-16

今天三篇論文從「訓練 → 架構 → 環境」三個層次,一起回答同一個問題:怎麼讓 Agent 在真實系統裡更可靠?RefGRPO 找出 Agent RL 訓練中被忽略的反思校準問題,讓 Agent 成為自己的驗證器;「Agents All the Way Down」給出從 LLM substrate 到上線部署的完整 custom agent 方法論,強調地基穩固比框架選擇更重要;EurekAgent 則以自主科研任務為場景,證明「環境工程」比「流程工程」更決定 agent 的可靠性上限。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-13

今天三篇分別從「記憶架構」、「訓練效率」、「可靠度評估」三個角度切入 Agent 平台的核心挑戰。HORMA 提出階層式檔案系統記憶架構,讓 Agent 在長工作流程中不再因 context 暴漲而崩潰;TRACE 重新設計 Agent RL 訓練的 rollout 分配邏輯,同樣算力讓 Multi-Hop QA 多學 2.8 個百分點;τ-Rec 則揭露多輪對話推薦 Agent 的「可靠度斷崖」——連最強模型連跑四次的可靠度也只剩 38%,這個數字對任何計劃上線 Agent 產品的團隊都是當頭棒喝。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-12

今天三篇論文從「如何評量 agent」和「agent 究竟是什麼」兩個角度出發:T1-Bench 建出橫跨 25 個真實業務領域的高仿真 benchmark,讓多領域跨域推理能力首次有系統性量化基準;VISTA 解決「用 LLM 模擬使用者測 agent」的可信度難題,提供 6 個指標量化你的測試有沒有真的覆蓋 agent 的能力邊界;Agentic Software 則從第一原理釐清:當 LLM 成為主推理引擎時,軟體的本質已變——這直接影響 agent 平台的除錯工具和測試策略設計。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-11

今天三篇論文從不同層次探索「agent-native 基礎設施」的設計:第一篇從 API 界面出發,提出讓 API 在出錯時主動給 agent 結構化修復建議,大幅提升工具呼叫成功率;第二篇拉高到系統架構層,主張 Agent OS 才是讓 agent 長期穩定運行的正確抽象;第三篇直擊推理服務底層,建出針對多輪 agent 的 hardware-aware 模擬器,讓 KV cache 排程優化得以量化驗證。從 API 到 OS 到硬體,agent 運行的每一層都需要重新設計。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-05

今天三篇分別從「評測診斷」、「工具進化」、「安全對齊」三個角度補強 Agent 平台的核心短板:APB 提出一套 4,209 道題的診斷型 benchmark,首次能把「規劃失敗」和「執行失敗」分開來看;MetaForge 讓 agent 能在運行時「自行鍛造」沒有的工具,打破靜態工具庫的天花板;RUBAS 把 agent 安全問題細分成四個評分維度,用強化學習讓模型學會在實用性和安全性間找到平衡。三篇合看:你的 agent 系統能不能被診斷、能不能自我擴展、能不能安全上線——這三道關卡今天同時被研究者正面回應。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-29

今天三篇論文從三個切面同時問「如何讓 agentic AI 跑得更好」:第一篇(UIUC × Intel)量測 agent 真實工作負載,發現瓶頸在 KV-cache 管理而非長 prompt;第二篇(PwC)用對照實驗打臉 RAG-first 預設,指出 grep 在 agent loop 裡常勝過向量搜尋;第三篇(Microsoft Research)開源完整 agent 訓練框架,讓社群不靠閉源 API 也能訓練出同量級 SOTA 的 agent。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-28

今天三篇論文從三個角度補齊 agent 平台知識:AgentFugue 展示多個 peer agent 共享「推理暫存筆記」可突破長任務協作瓶頸;Can Agent Benchmarks Support Their Scores? 揭露當前 agent benchmark 的評分機制存在系統性漏洞,排行榜數字需重新審視;VibeServe 則讓 agent 自動生成整套 LLM serving stack,在特殊部署場景下超越手工優化的 vLLM。三篇合起來分別回答了「agent 怎麼協作更強」、「我們信任的評測數字是否可靠」以及「agent 能幫工程師做基礎設施嗎」。