Skip to content
← Daily Digest

Coding Agent

Coding Agent

AI 程式碼生成、SWE-bench、自主修 bug、code review、IDE 整合

論文時間軸(18 篇)

2026-05-29
Orchard: An Open-Source Agentic Modeling Framework 必讀

Microsoft 開源完整的 agent 模型訓練框架,讓小模型靠資料蒸餾 + 特製 RL 在 SWE / GUI / 助理任務上達到同量級開源 SOTA,不需要依賴 GPT-4o API。

arxiv: 2605.15040
2026-06-14
Agentic Environment Engineering for Large Language Models: A Survey 必讀

把「怎麼設計 AI Agent 執行環境」系統化:8 個屬性 × 8 個應用領域分類框架,加上 symbolic vs. neural 兩種自動合成範式,是 agent environment 設計的入門地圖。

arxiv: 2606.12191
2026-06-14
The End of Code Review: Coding Agents Supersede Human Inspection 略讀

立場鮮明的 position paper:coding agent 已能替代人工 code review 的所有傳統目標,強迫人類 review AI 程式碼是走錯了方向。

arxiv: 2606.13175
2026-06-18
HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry 必讀

把 Agent 的執行框架(Harness)做成可組合積木,再讓 AI 自動跑實驗找出最好的組合——不改模型、只調框架,Qwen 9B 在 GAIA 從 33% 跳到 55.77%,GPT-5 從 62% 跳到 84%。

arxiv: 2606.14249
2026-06-19
Agentic Very Much! Adoption of Coding Agent in New GitHub Projects 略讀

在新建的 GitHub 專案裡,AI coding agent 的採用率是一年前同類研究的兩倍以上,而且每個採用者用得更深,AI 輔助的 commit 比例更高。

arxiv: 2606.07448
2026-06-25
Sakana Fugu Technical Report 必讀

Sakana AI 訓練了一個「學會指揮其他模型」的 0.6B 小型協調器,把 Claude/GPT 等現有 frontier 模型的能力組合出超越任何單模型的表現,在 SWE-Bench Pro 達到 73.7%(公開最強)。

arxiv: 2606.21228
2026-06-29
Autodata: An Agentic Data Scientist to Create High Quality Synthetic Data 必讀

Meta FAIR 把「建資料集」這件事做成 agent:agent 自己設計資料配方、評估品質、修改配方,並透過 meta-optimization 讓這個 data scientist agent 越來越會產高品質資料。

arxiv: 2606.25996
2026-06-29
Governed AI-Assisted Engineering: Graduated Human Oversight for Agentic Code Generation in Regulated Domains 略讀

在銀行等受法規限制的環境,不是每個 agent 動作都要人類審批;GAIE 提供一個決策框架,依風險分三層監督,讓企業在合規前提下保留約 91% 的 coding agent 效率。

arxiv: 2606.22484
2026-07-05
Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents? 必讀

把業界最常引用的 3 個 coding agent benchmark(GSO、SWE-Perf、SWE-fficiency)官方標準答案跨 4 種機器重跑,發現大多不穩定:SWE-Perf 僅 8% 任務可靠,代表排行榜分數可能大幅誇大 coding agent 的真實進步。

arxiv: 2607.01211
2026-07-06
Self-Evolving Agents with Anytime-Valid Certificates 略讀

SEA:讓 Agent 在邊跑邊自我改良的同時,每次改良都需通過「可驗證安全門(anytime-valid gate)」並發出可稽核憑證,確保每次自我更新都有明確的錯誤預算上限,不會默默變差。

arxiv: 2607.00871
2026-07-07
UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development 略讀

讓 multi-agent 軟體開發框架學會「自我懷疑」:用 token 的信心分數決定哪個 agent 的輸出需要驗證再轉交,防止早期錯誤在 pipeline 中滾雪球。

arxiv: 2607.02186
2026-07-14
ProjAgent: Procedural Similarity Retrieval for Repository-Level Code Generation 必讀

Coding agent 在大型 repo 找參考程式碼時,傳統方法靠「長得像」或「名字像」——ProjAgent 新增「解題步驟像」這個維度,在 REPOCOD 測試集上達到 41.14% Pass@1,超越所有 retrieval 型 baseline。

arxiv: 2607.08691
2026-07-20
Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning 略讀

現有 RL 訓練算法(PPO / GRPO)對 agent 來說很浪費:每次都從頭跑 N 條路徑比較。BPO 只在「真正需要比較」的高熵決策點快照並分叉,用兄弟軌跡(sibling trajectory)的 return 差異計算 advantage,讓訓練更有效率。

arxiv: 2607.14171
2026-07-23
Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation 必讀

你在看的工具呼叫排行榜(BFCL、MCP-Atlas 等)有 18.5% 的題目被判錯了;LiveMCPBench 同一組設定重跑 23 次,分數差距達 18.9 個百分點。

arxiv: 2607.02577
2026-07-23
How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks 略讀

跑完全部任務才能比較兩個 agent?AppWorld 跑 15%、tau-bench 跑 25% 就夠了;SWE-bench 例外——幾乎要跑到 90% 以上才能信任結論。

arxiv: 2607.12338
2026-07-26
PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization 略讀

coding agent 現有 benchmark 只問「程式對不對」,PERFOPT-Bench 問的是「程式快不快」;結果發現 framework 的選擇比模型本身更能決定優化效果。

arxiv: 2607.07744
2026-08-01
Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories 略讀

你花時間寫的 [AGENTS.md](http://AGENTS.md) / [CLAUDE.md](http://CLAUDE.md) 到底有沒有用?288 次對照實驗的答案:對 coding agent 的正確率幾乎沒有可量測的差異(等效上限 ≤10–15pp),出錯的根本是實作技能不足,不是缺少 repo 知識。

arxiv: 2607.27250
2026-08-02
AI Agent Pull Requests on GitHub: Frequency, Structure, and Merge Conflict Rates 必讀

Coding Agent 開的 PR,79.4% 都有另一個 PR 同時進行中——幾乎都是同一個 Agent 自己和自己衝,不是不同 Agent 互打。

arxiv: 2607.04697

相關 Digest(8 篇)

daily AI Agent GitHub Digest

AI Agent GitHub Digest — 2026-08-30

Google 官方的 ChromeDevTools/chrome-devtools-mcp(5 萬星)讓 coding agent 直接操控真實 Chrome 做效能分析與除錯;abhigyanpatwari/GitNexus 用純瀏覽器端知識圖譜取代「讀程式碼靠猜」;mksglu/context-mode 專攻 coding agent 的 context window 浪費問題;google/skills 是 Google 自家的官方 Agent Skills 套件庫;livekit/agents 語音 agent 框架持續活躍。框架端 pydantic-ai v2.36.0 加入 `@durable_operation`,讓第三方 durable execution 引擎可插拔進來。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-26

今天三篇論文從三個角度精準刺中 AI coding agent 的能力邊界:**ICAE-Bench** 挑戰「模糊需求下的互動式開發」場景,揭示當前 benchmark 跟不上 vibe-coding 時代;**EvoAgentBench** 揭露 agent 自我進化能力轉移的陷阱,主流方法竟造成 −12.3 分的負遷移;**PERFOPT-Bench** 則開闢「效能優化作為 agentic task」新賽道,並發現 framework 選擇往往比模型選擇更關鍵。三篇合讀的重點:生產環境的 agent 評估遠比現有工具複雜,業界亟需更貼近真實場景的評估體系。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-23

今天三篇的共同主題是:**我們測 agent 的方式,本身就有問題**。第一篇直接審計主流工具呼叫 benchmark,發現近兩成的分數是評錯的;第二篇用重播分析告訴你哪些 benchmark 不用跑完就能得出可靠結論(SWE-bench 是反例);第三篇推出首個將「執行任務」與「生成操作教學」合二為一的多模態 web agent benchmark,截圖輸入、雙目標評測,最強模型也只完成不到四成。三篇合讀能讓你對 agent 評測的現況有完整的危機感與應對方向。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-14

今天三篇論文從三個實戰角度切入 AI Agent 平台:第一篇揭露多 Agent 系統在生產環境中面臨的隱蔽安全威脅,並提出以「激活空間」偵測惡意 agent 的新框架(非同步環境下 F1 比現有方法高出 +0.55);第二篇改善 coding agent 的 retrieval 策略,引入「程序相似性」讓 AI 能找到解題步驟相近但表面不同的程式碼;第三篇則是重磅提醒——同一個 LLM 放進不同 harness,agent 的中途判斷就會出現顯著偏差,harness 設計根本不是中性的工具。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-07-06

今天三篇論文從不同角度同攻一個核心問題:**如何讓 Agent 工作流程在生產環境中真正可靠**。Mnemosyne 把資料庫的「交易(Transaction)」概念搬進 Agent 工作流程,讓 LLM 每個輸出都要先通過准入審核才能生效;PaperPilot 展示如何訓練 9B 小模型學會以 DAG(有向無環圖)規劃多輪搜尋工作流程,並根據用戶回饋動態修正整個流程;SEA 讓 Agent 邊跑邊改善自己,同時發出可被稽核的安全憑證。三篇合在一起幾乎覆蓋了 Agent 系統可靠性的完整棧:執行層保護、訓練層工作流程學習、更新層安全演化。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-30

今天三篇論文共同聚焦在一個核心問題:**我們到底怎麼評估 agent 夠不夠好?** SWE-Explore 把 coding agent 最被忽視的中間步驟——讀懂程式庫——單獨拿出來測;Claw-SWE-Bench 揭示框架設計(harness adapter)才是讓 coding agent 分數暴漲的真正槓桿,同一模型換個 adapter 就能從 19% 跳到 73%;Red Queen Gödel Machine(Cambridge × NVIDIA)則走得更遠,讓評測者本身也跟著 agent 一起進化,打破靜態 benchmark 的天花板。三篇合看:**evaluation in

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-06-29

今天三篇從不同角度剖析「Agent 走向生產級基礎設施」的挑戰:Agent libOS 回答「agent 的 runtime 底層該長什麼樣子」;Autodata(Meta FAIR)示範「agent 如何自己製造並持續優化訓練資料」;GAIE 則提出「企業在法規約束下如何分級監督 coding agent」。三者合看,描繪出 agent 平台從架構、資料到治理都需要重新設計的完整藍圖。

daily AI Agent Arxiv Digest

AI Agent Arxiv Digest — 2026-05-28

今天三篇論文從三個角度補齊 agent 平台知識:AgentFugue 展示多個 peer agent 共享「推理暫存筆記」可突破長任務協作瓶頸;Can Agent Benchmarks Support Their Scores? 揭露當前 agent benchmark 的評分機制存在系統性漏洞,排行榜數字需重新審視;VibeServe 則讓 agent 自動生成整套 LLM serving stack,在特殊部署場景下超越手工優化的 vLLM。三篇合起來分別回答了「agent 怎麼協作更強」、「我們信任的評測數字是否可靠」以及「agent 能幫工程師做基礎設施嗎」。