Skip to content
← Daily Digest

工具呼叫

Tool Use

function calling、API 呼叫最佳化、工具選擇、工具組合

論文時間軸(5 篇)

2026-06-06
Exploring Cross-Scenario Generality of Agentic Memory Systems: Diagnostics and a Strong Baseline 必讀

8 種主流 agent 記憶系統放在 5 種不同場景跑,發現大多數只在自己設計的場景表現好、換個場景就崩;讓 agent 自己透過 tool call 管自己的記憶(AutoMEM)反而是最泛化的方法。

arxiv: 2606.04315
2026-06-17
Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents 必讀

小模型面對 250 個工具的 MCP 目錄幾乎癱瘓(執行成功率 3%),Evoflux 用推論時的演化搜尋反覆修復失敗的工具 graph,把成功率拉到 17–24%——不需要 fine-tuning。

arxiv: 2606.12674
2026-06-28
APPO: Agentic Procedural Policy Optimization 略讀

訓練 Agent 的強化學習通常在「工具呼叫點」才分配功勞,APPO 把這精細到「每個 token 的真實影響力」,在 13 個 benchmark 上比強基線提升近 4 分,且不增加工具呼叫次數。

arxiv: 2606.12384
2026-07-18
AgentCheck: A Reproduce–Intervene–Mitigate Workbench for LLM Agents over MCP 必讀

一個開源工作台:讓你把 MCP 工具的故障重現在可控環境,測你的修復是否真的有用,再確認沒有其他東西壞掉。

arxiv: 2607.11098
2026-08-01
ORCA-bench: How Ready Are Language Model Agents for Oncall? 必讀

用真實 SRE on-call 場景測試 LLM Agent 的故障根因分析(RCA)能力:1,079 個任務、真實 telemetry 介面、SRE 人工審核答案——最強模型答對率僅 40%,拿掉源碼存取後每個指標都掉。

arxiv: 2607.28545

相關 Digest(6 篇)

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-21

Cursor 開源官方外掛市集 cursor/plugins,用 plugin.json + skills + MCP 定義把生態標準化,一天 +470 星;apache/maka 進 Apache 孵化器,用 append-only 事件日誌記錄 agent 的每次工具呼叫與權限決策,主打可稽核的 local-first 工作台;magnitudedev/magnitude 幫你自動偵測硬體、下載並在本機跑模型,開箱即用的離線 agent;vercel/eve 把 agent 能力放進 tools/、skills/、schedules/ 等慣例目錄,檔案系統就是介面。框架端 pydantic-ai 補了 v2.32.1 patch。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-08-07

ToolLIFT 把工具軌跡提升到功能層工作流圖,在三個 OOD 基準上持續超越 SOTA;SkillTV-Bench 用 681 案例證明技能感知的裁判技能讓 Agent 評判準確率提升 14.8 個百分點;TRIO-20 用預設等價研究發現 GPT-5.6 在 840 條軌跡中零越權呼叫,但推理力度提高讓規則探查率上升了 14.3 個百分點

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-31

今天三篇論文都在問同一個核心問題:**現在的 AI Agent 真的能用嗎?** 答案出奇地一致——還差得遠。[HANDBOOK.md](http://HANDBOOK.md) 揭露把最強前沿模型丟進虛擬公司後,企業政策合規通過率最高只有 **36.2%**;LangGraph 論文給出三份可落地的有狀態工作流食譜,並附上「什麼時候不要用 LangGraph」的決策指南;MM-ToolSandBox 則首次量化了「看圖+叫工具」這個多模態組合技的困難程度——12 個主流模型中最強的成功率也不到一半。三個維度:合規評估、框架設計、視覺工具,串起一張「Agent 離真正落地還有多遠」的完整地圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-23

今天三篇的共同主題是:**我們測 agent 的方式,本身就有問題**。第一篇直接審計主流工具呼叫 benchmark,發現近兩成的分數是評錯的;第二篇用重播分析告訴你哪些 benchmark 不用跑完就能得出可靠結論(SWE-bench 是反例);第三篇推出首個將「執行任務」與「生成操作教學」合二為一的多模態 web agent benchmark,截圖輸入、雙目標評測,最強模型也只完成不到四成。三篇合讀能讓你對 agent 評測的現況有完整的危機感與應對方向。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-18

今天三篇論文從三個維度切入「生產等級 Agent 可靠性」:MemCon 把記憶體操作建模為強化學習問題,讓 agent 自學何時存、取、忘,在 6 個 benchmark 上任務成功率最高提升 15.2 分;AgentCheck 把 MCP 伺服器變成除錯介面,開發者可重現工具故障、注入修復並驗證效果,填補了 MCP 生態長期缺乏「測試工具」的空缺;AgentAbstain 則用 263 個配對任務揭露:即便是最強的 frontier 模型,在「應拒絕行動」情境下正確率不到 60%,且棄動能力與任務解決能力幾乎無關——光靠換更強的模型無法解決這個問題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-10

今天三篇論文呼應同一主題——讓 Agent 從實驗走向可靠的生產環境:一篇是超大規模雲端部署的多 Agent 故障排除架構實戰,自主解決率達 90%+;一篇提出讓 Agent 記住過去工具呼叫成功失敗的記憶機制,不用重訓模型就能持續進步;一篇則首次系統比較六款 AI 輔助開發流程框架,提供六個維度的選型參考。