Skip to content
← Daily Digest

推理與規劃

Reasoning & Planning

chain-of-thought、planning、決策、搜尋策略、self-reflection

論文時間軸(23 篇)

2026-05-26
Do Agents Need to Plan Step-by-Step? Rethinking Planning Horizon in Data-Centric Tool Calling 必讀

對資料查詢型任務(text-to-SQL、知識庫問答),先一次生成完整計劃再批次執行,比每步都重新推理可省 2–4.7x token,且準確率相當——顛覆 ReAct 逐步推理的預設。

arxiv: 2605.08477
2026-06-01
Efficient Agentic Reasoning Through Self-Regulated Simulative Planning 必讀

給 agent 加上「先想清楚再行動」的智慧開關:複雜任務啟動 world model 在腦中預演,簡單任務直接反應,30B 模型因此少用高達 95% 的 token 仍能競爭過 1T 參數系統。

arxiv: 2605.22138
2026-06-01
AgentFloor: How Far Up the Tool Use Ladder Can Small Open-Weight Models Go? 必讀

用 16,542 次測試跑 16 個開源小模型(0.27B 到 32B)加 GPT-5,結果:agent pipeline 大多數的短程、結構化 tool use 任務,小模型已經夠用,而最強開源模型整體分數能和 GPT-5 打平。

arxiv: 2605.00334
2026-06-05
Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents 必讀

4,209 道跨 22 個領域的多模態測試題,專門診斷「LLM Agent 的規劃哪裡出了問題」,測試 12 個頂尖模型後發現全都有系統性弱點。

arxiv: 2606.04874
2026-06-11
Self-Reflective APIs: Structure Beats Verbosity for AI Agent Recovery 必讀

API 出錯時,給 agent「結構化修復建議清單」比「自然語言錯誤說明」更有效:任務完成率提升 37–40 個百分點,token 效率也高出近 2 倍。

arxiv: 2606.05037
2026-06-11
Agent Operating Systems (AOS): Integrating Agentic Control Planes into, and Beyond, Traditional Operating Systems 略讀

傳統 OS(進程、執行緒、系統呼叫)是為確定性程式設計的,但 agent 是長期存活、目標驅動、會隨機應變的生物——這篇主張我們需要一個「Agent OS」來接管排程、記憶體、安全和治理。

arxiv: 2606.01508
2026-06-12
T1-Bench: Benchmarking Multi-Scenario Agents in Real-World Domains 必讀

現有 agent benchmark 太簡單、太單一領域;T1-Bench 用 25 個業務領域的交叉對話場景,讓「agent 在真實客服環境到底行不行」首次有了可量化的跨模型比較基準。

arxiv: 2606.11070
2026-06-12
Agentic Software: How AI Agents Are Restructuring the Software Paradigm 略讀

傳統軟體把決策邏輯寫在程式碼裡;Agentic Software 的決策邏輯在執行時由 LLM 動態生成,程式碼只是工具——這是軟體本質的轉變,不是工具升級,對 agent 平台的設計和除錯方式有直接影響。

arxiv: 2606.05608
2026-06-15
Human oversight of agentic systems in practice 必讀

17 位開發者訪談揭示 4 種「自發監督行為」,但現有 agent 框架的 UI 幾乎沒有支援其中 2 種。

arxiv: 2606.05391
2026-06-17
GitOfThoughts: Version-Controlled Reasoning and Agent Memory You Can Replay, Diff, and Merge 必讀

大家都在說要給 Agent 加記憶,但這篇系統實驗後的答案是:除非新問題跟記憶中的案例幾乎一模一樣(相似度 > 0.8),加任何記憶基底都沒有統計顯著幫助——但 git 提供了一條以稽核性、可重播性為價值的工程路徑。

arxiv: 2606.14470
2026-06-18
OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents 略讀

LLM Agent 在完成任務的過程中,會一點一點把使用者隱私洩漏給外部服務;OCELOT 在 Agent 和外部世界之間加了一個「洩漏預算員」,讓攻擊者從整條 trajectory 中能推斷出的秘密量不超過上限 ε。

arxiv: 2606.12341
2026-06-21
The Consistency Illusion: How Multi-Agent Debate Hides Reasoning Misalignment 必讀

多 agent 辯論後達成答案共識,不代表它們的推理是一致的;辯論甚至讓 agents 的推理鏈越來越不像,只是表面上都說同一個答案——研究者稱之為「一致性幻覺」,並提出 CARA 指標和修正協議來偵測這個問題。

arxiv: 2606.08457
2026-06-23
Hierarchical Control in Multi-Agent Games: LLM-based Planning and RL Execution 略讀

用 LLM 當多 agent 團隊的指揮官決定策略方向,再讓 RL 訓練的底層 agent 負責真正的動作執行——兩者各司其職,比純 RL 或純手工規則都更彈性。

arxiv: 2606.20014
2026-06-25
Rising From the Ashes: How Agentic AI is Unblocking Challenges in Cybersecurity 略讀

六位資安研究員整理出讓防禦者長年頭痛的五個瓶頸,逐一對應到 agentic AI 的五種新能力,論點是:「以前太費工、根本做不完」的安全任務,agent 現在可以接手了。

arxiv: 2606.23138
2026-07-01
The Shift to Agentic AI: Evidence from Codex 必讀

OpenAI 用 Codex 真實使用數據,首次大規模量化「agentic AI 如何改變工作」:2026 年上半年用戶增 5 倍、任務規模膨脹 10 倍,且最重要的是,改變已從工程師擴散到法務、研究等非技術職能

arxiv: 2606.26959
2026-07-04
Conversable Complexity: Agentic LLM Collectives as Interpretable Substrates 跳過

大家擔心 multi-agent 系統愈來愈黑箱,這篇反過來論證:LLM agent 集群因為用自然語言溝通,天生就比傳統複雜系統更透明可解讀。

arxiv: 2607.01047
2026-07-08
ComfyClaw: Self-Evolving Skill Harnesses for Image Generation Workflows 略讀

在 ComfyUI(節點式圖像生成工具)上,讓 agent 把每次執行的經驗(成功步驟、錯誤、verifier 回饋)蒸餾成可重用的技能,技能庫越用越強,效果優於沒有技能進化的版本。

arxiv: 2607.01709
2026-07-10
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents 必讀

長任務 Agent 不應把所有對話歷史塞進 context,而應用「有界合約」:每個決策的輸入由五個有型別的記憶層結構化提取而來,prompt 大小始終有限。用《Slay the Spire 2》幾百回合的連續決策當 testbed,並公開 298 條軌跡供比較研究。

arxiv: 2607.02255
2026-07-12
UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks 略讀

現有 agent benchmark 都在沙箱裡考模擬題,UniClawBench 把評測搬進真實環境,並用「能力維度」取代「任務情境」作為分類軸,讓你知道 agent 到底哪個環節掉鏈子。

arxiv: 2607.08768
2026-07-16
Atomic Task Graph: A Unified Framework for Agentic Planning and Execution 必讀

把 agent 的多步任務畫成「依賴關係圖」,讓沒有相依的步驟並行跑、失敗時只重算受影響的部分——不需要更大的模型就能大幅提升成功率。

arxiv: 2607.01942
2026-07-16
Internet of Agentic Things: Networked AI Agents for Closed-Loop IoT Orchestration 略讀

提出 IoAT(物聯智能體網路)架構:把 AI agent 擴展到 IoT 設備層,讓 agent 不只在雲端對話,還能協調感測器、邊緣運算、數位孿生——從「語言 agent」走向「物理世界 agent」。

arxiv: 2607.12662
2026-07-24
Adoption and Ecosystem Health: A Longitudinal Analysis of Open-Source Multi-Agent Frameworks 必讀

GitHub star 數會騙人;這篇用四年真實數據告訴你,哪些開源 Agent 框架才是真的有人長期用、真的健康。

arxiv: 2607.02453
2026-07-24
Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents 必讀

整合 27 篇 Agent 評測論文,歸納出六大失敗類別,讓你知道你的 Agent 最可能在哪裡翻車。

arxiv: 2607.05775

相關 Digest(14 篇)

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-28

今天三篇論文從三個角度直擊 Agent 平台核心挑戰:**AgentCompass** 提出可組合的開源評測基礎設施,終結 agent 評測各自為政的碎片化亂象;**Agents in the Wild** 是少見的生產落地報告,從藥物研發與金融系統的真實部署歸納出可複用的設計模式;**Nanbeige4.2-3B** 則証明 3B 小模型配上 Looped Transformer 與大規模 agentic RL,在 agent 任務上可以壓過 9B 甚至 12B 的競爭對手——對邊端部署或成本敏感場景有直接啟示。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-24

今天三篇分別從生態、失敗、記憶三個角度切入:哪些開源 Agent 框架真正值得長期下注(不只看 star 數)、Agent 在哪六類問題上反覆翻車、以及如何讓 Agent 的長期記憶跨越多個人物做串聯推理。三篇合在一起,像是給 Agent 平台開發者的「框架選型依據 + 失敗防護清單 + 記憶系統升級方向」。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-16

三篇論文不約而同都在問同一個問題:agent 的每一步執行單元,到底應該怎麼設計才能讓它可稽核、可重用、出了錯能最小範圍修復?ATG 把任務分解成有向無環圖(DAG)讓子任務並行、中間結果可複用;PalmClaw 把手機原生 API 直接包成結構化工具,甩掉難以追蹤的 GUI 點擊序列;IoAT 則把 agent 網路延伸到 IoT 物理世界,從智慧建築到邊緣設備,畫出跨雲端、邊緣、感測器層的協調藍圖。共同主軸:執行邊界要清楚、動作要可稽核、失敗要能局部恢復。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-25

今天三篇都在探索「agent 能力的邊界與突破路徑」。Sakana Fugu(Sakana AI)訓練了一個 0.6B 的協調器模型,學會動態指揮一池 frontier LLM 分工,在 SWE-Bench Pro 等多個榜單達到公開 SOTA——核心命題是「orchestrator 本身可以被訓練,而不只是工程師寫死規則」。NatureBench 用 90 個 Nature 期刊的真實科研任務反問:coding agent 真的能做科學發現?最強配置只勝過原論文 SOTA 17.8%,且靠的是把問題「翻譯成熟悉的 ML 任務」,不是真正的發明。最後,《Rising from the Ashe

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-24

今天三篇從工具可靠性、協定選型、多 Agent 協作三個角度切入 Agent 平台的痛點:PlanBench-XL 揭露頂尖 LLM 在真實大型工具環境下一遇到工具失效就崩潰(GPT-5.4 從 52% 跌至 11%);TU Munich 給出第一份 MCP/A2A/ACP/ANP 等 9 個協定的技術分類法,讓選型有系統依據;AMD 的 Arbor 提出以樹狀搜尋作為多 Agent 的共享認知空間,讓失敗也成為有用的探索訊號。三篇合在一起,恰好描繪出 2026 年 Agent 平台的三塊基礎設施缺口。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-22

今天三篇從「agent 在生產環境的可靠性與安全性」出發,覆蓋推論期、訓練期、基礎設施三個層次。LedgerAgent 用推論期的輕量「帳本」結構,讓工具呼叫 agent 不再把所有狀態塞進 prompt 靠 LLM 重建——直接降低政策違反與狀態錯誤;Alibaba 的 Connect the Dots (CoD) 則往更遠看,以強化學習訓練 agent 在長期部署中邊執行任務邊更新對環境的認識,跨任務越跑越準;Sovereign Execution Brokers 從安全基礎設施切入,在 agent 每次「動生產系統」的那一刻插入憑證驗證,把「授權的動作」和「實際執行的動作」嚴格綁定。三篇

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-21

今天三篇從不同切面拼出「agent 在真實世界怎麼落地」的全貌:Perplexity + 哈佛商學院用生產數據首次量化 agent 對比對話助理的差距——完成時間縮短 87%,而且 agent 吸引了認知複雜度更高的工作類型;Self-Harness 示範 agent scaffolding 如何不靠人工自動挖弱點、自動修,三個主流模型各獲 33-60% 相對提升;The Consistency Illusion 拆穿多 agent 辯論的核心陷阱——輸出層共識可能掩蓋底層推理根本不一致。三篇合讀的訊號:agent 真正的競爭力不在於模型更強,而在於「生產數據驅動的 scaffolding 自

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-19

今天三篇都在動搖 Agent 領域的「常識」:ACCORD 實驗揭示 agent 普遍犯的「自以為了解指令」問題(靠假設而非觀察行動),提出主動接地框架讓 AppWorld 成功率從 42% 跳到 62.6%;《多智能體的幻覺》以嚴格評測證明,自動生成的多智能體架構在計算成本高出 10 倍的情況下反而比不過單 agent + CoT-SC;《非常非常 Agentic》則用 GitHub 大規模實證資料揭示,AI 程式碼 Agent 在新建專案的採用率已是一年前的兩倍多。三個訊號合起來:Agent 工具快速普及,但「多 agent 必然更強」和「agent 理解你的指令」這兩個核心假設,正在被資

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-15

今天三篇從不同角度描繪「2026 年的 agent 現實」:UC Berkeley 用 1,000+ 個真實職場任務做成的 benchmark 顯示,當前最強 agent 在最難任務上平均只通過 2.6%;Microsoft 研究者訪談 17 位開發者後發現,他們都在無意識地發展出 4 種即興「監督工作」,但現有工具幾乎沒有支援;Reins AI 的工坊論文則指出,在 agent 系統還不夠成熟的部署期,傳統任務層監控根本看不到最嚴重的結構性故障。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-12

今天三篇論文從「如何評量 agent」和「agent 究竟是什麼」兩個角度出發:T1-Bench 建出橫跨 25 個真實業務領域的高仿真 benchmark,讓多領域跨域推理能力首次有系統性量化基準;VISTA 解決「用 LLM 模擬使用者測 agent」的可信度難題,提供 6 個指標量化你的測試有沒有真的覆蓋 agent 的能力邊界;Agentic Software 則從第一原理釐清:當 LLM 成為主推理引擎時,軟體的本質已變——這直接影響 agent 平台的除錯工具和測試策略設計。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-11

今天三篇論文從不同層次探索「agent-native 基礎設施」的設計:第一篇從 API 界面出發,提出讓 API 在出錯時主動給 agent 結構化修復建議,大幅提升工具呼叫成功率;第二篇拉高到系統架構層,主張 Agent OS 才是讓 agent 長期穩定運行的正確抽象;第三篇直擊推理服務底層,建出針對多輪 agent 的 hardware-aware 模擬器,讓 KV cache 排程優化得以量化驗證。從 API 到 OS 到硬體,agent 運行的每一層都需要重新設計。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-04

今天三篇從不同層次切入「如何建造更可靠、更可進化的 Agent 系統」:第一篇用真實執行軌跡首次揭示多模型 Agent 系統的 LLM 呼叫成本,讓平台工程師能用數字說話;第二篇提出把整個記憶流水線當成可自我演化的程式碼,解決長期任務中記憶架構對齊失效的痛點;第三篇補上評測盲點,指出現有 Agent 持續學習 benchmark 無法真正辨別「學到了什麼」,並給出更嚴謹的 controlled stream 框架。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-01

今天三篇論文聚焦「agent 規模化部署的成本-能力邊界」:SR²AM 重新設計規劃架構,讓 30B 模型少用九成 token 就能競爭 685B-1T 系統;GroupMemBench 揭示現有記憶系統在多人群組對話中徹底崩潰(最強系統只有 46% 準確率,1990 年代的 BM25 關鍵字搜尋反而打贏它);AgentFloor 用 16,542 次測試確認,agent pipeline 大量的短程 tool use 根本不需要大模型。共同主軸:在算力成本壓力下,精確判斷「哪個環節需要多少智慧」已成為 agent 平台設計的核心課題。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-26

今天三篇分別從三個基礎設施層面深挖 Agent 平台:微軟提出仿人腦六機制的記憶管理架構,在大型 codebase 資料上讓記憶庫壓縮 58% 還保住 97.2% 精確率;Megagon Labs 的研究顛覆「逐步推理」慣例,證明先生成完整計劃再批次執行工具可省 2–4.7x token;最後一篇借用神經科學工具,讓 multi-agent 通訊拓撲(Chain / Star / Mesh)的架構選擇從猜測變成可計算的診斷。