IterResearch 與 AREX:長時程研究的記憶與自我進化
長時間研究時,agent 面臨「上下文窒息」:資訊堆積、噪音增加、注意力被稀釋。IterResearch 用馬可夫狀態重建解決這個問題,AREX 用內外雙循環實現遞迴自我改進。兩者回答同一個問題:agent 怎麼在數百輪搜尋後依然保持清晰?
長時間研究時,agent 面臨「上下文窒息」:資訊堆積、噪音增加、注意力被稀釋。IterResearch 用馬可夫狀態重建解決這個問題,AREX 用內外雙循環實現遞迴自我改進。兩者回答同一個問題:agent 怎麼在數百輪搜尋後依然保持清晰?
蚂蚁集團百靈大模型家族完整介紹:2025→2026 演化時間線、Ling/Ring/Ming 三大系列雙軌策略、從 Ling 1.0 到 Ling 3.0 的架構躍遷、Ling-3.0-flash-Fin 金融增強模型,以及 Agent 開發者的選型指南
Agent 間通訊分三種模式:handoff(移交控制權)、delegate(委派後等結果)、mailbox(即時點對點訊息)。各家實作差異大,但 MCP 和 A2A 正在推動協定標準化。
子 agent 要不要看到父對話?Fork 帶完整歷史但 token 指數膨脹,Fresh 省錢但缺背景。業界共識:預設 Fresh,需要時才 Fork,且一定要搭歷史截斷和結果壓縮。
Multi-Agent 並行 + 巢狀 spawn 可以在單輪對話燒掉 200K+ tokens。業界從 Anthropic 到 Microsoft 都走向三級分級反應:壓縮 → 降級 → 停止,而非一刀切硬擋。
2026 年幾乎所有主流 coding agent 都支援 subagent。設計哲學分三派:腳本確定性編排(Claude Code Workflow)、model-driven 自主(Codex、Devin)、IDE 指揮台(Windsurf 2.0、VS Code)。這篇是系列總篇,整理產品定位、能力矩陣與架構光譜。
Multi-Agent 系統最常見的 debug 困境是「知道結果錯了,但不知道是哪個 agent 搞的」。三層可觀測性是必要的:per-agent token 計量、execution trace 記錄、即時成本儀表板。
Multi-Agent 編排分三派:腳本確定性(LangGraph、Claude Code Workflow)可預測但僵硬,model-driven(Codex、Devin)靈活但不可控,混合派(Windsurf 2.0)當指揮台整合多家。選擇取決於你需要多少可預測性。
Multi-Agent 的安全風險不只是單 agent 的放大版——agent 間的通訊本身就是攻擊面。一個被注入的子 agent 可以透過回傳結果把惡意指令傳給父 agent。防禦核心:treat agent output as untrusted data。
2026 年 AI Native Agent 時代的核心變化:從 Harness Engineering 到 Skill Engineering,工程師角色從執行者轉向評判者,三個階段演進與五大關鍵技能。
screenshot-to-code 不是一步到位的截圖轉碼工具。核心是一個最多 30 步的 Agent Loop,搭配 7 個工具——從截圖裁切真實素材、用 Playwright 自我驗證、到同時跑 4 個模型讓使用者選最好的版本。GitHub 74,500+ stars,MIT License。
2023 年是 LLM 全面重寫 AI 研究議程的第一年:DPO 拿下 NeurIPS Outstanding Runner-Up、ReAct 成為 ICLR Oral、hallucination 從邊緣詞彙變成每場會議的熱門 track——同時 3D Gaussian Splatting 在 SIGGRAPH 發表後橫掃 CV 社群,Mamba 年底出現挑戰 Transformer 的注意力壟斷,而傳統 NLP pipeline 的論文量開始明確萎縮。
Anthropic 訪談 15 間新創,歸納出 Claude Code 操作五原則:人人出貨、自動化瑣事、信任但驗證、為重建而建、原型到產品化。ClickHouse 多出 30% 功能、Clay 100% 自動化 bug triage、Artemis Security 一週 6,000+ PR。
微軟把 Semantic Kernel 與自家 AutoGen 合併成 Microsoft Agent Framework,2026-04-02 發 1.0 GA(.NET 與 Python,Go 仍是 public preview)。被收編的 autogen-agentchat 停在 2025-09-30 沒再發版;但原作者那側的社群分支 AG2 沒有合併,六天前還在發 1.0.2,而且 `pip install autogen` 裝到的是 AG2 不是微軟。這篇拆解 MAF 的抽象、遷移時程,以及這團名字到底該怎麼讀。
LLM Application Design 是 2025-2026 面試最熱的新題型。核心考點:RAG pipeline 的 chunking/retrieval/reranking 設計、agent 架構的 tool-use 與 planning loop、context window 管理策略、guardrails 與 safety 設計、以及 LLM 應用的評估方法。面試官特別看重你有沒有踩過坑。
字節跳動開源(MIT)的 UI 自動化框架。UI 動作只靠截圖餵給視覺語言模型,不解析 DOM;一套 JS API 跨 Web / Android / iOS / 桌面。代價是每步較慢、token 較貴,而且高度綁在模型的 grounding 能力上。注意它已在 1.9.8 之後停掉 MCP,改走 Skills + CLI。
別再把所有 tool description 在 session 開頭一次塞進 context。讓 model 寫 code、runtime 執行,tool 定義只在 import 那行才進 context — Anthropic 的 GDrive→Salesforce 範例從 ~150K tokens 降到 2K,Cloudflare 的 2,500 endpoints schema 從 1.17M 降到 1K。
Skill 是一個資料夾、一份 SKILL.md。三層 progressive disclosure 讓 Claude 在需要時才載入細節,避免每次對話重新解釋偏好。
Local Deep Research 是個本地優先、隱私導向的深度研究 Agent,用 LangChain + LangGraph 串起 20+ 搜尋引擎和 30+ 種研究策略,旗艦的 langgraph_agent_strategy 走 LLM 自主 tool-calling 路線,跟固定流程的 RAG graph 是兩種思路。
用 Claude Code、Cursor 等 AI agent 時,內建 WebFetch / WebSearch 常被 Cloudflare、地理限制或 rate limit 擋住。接一個 search MCP server 是最直接的解法,這篇比較 2026 年實際能用的選項。
Warp 從一個用 Rust 打造的現代終端機,演化成整合 AI Agent 的開發環境(ADE),2026 年 4 月開源,目前擁有 70 萬開發者使用者。
OpenAI 2026/4/22 推出 Workspace Agents,以 Codex 為底、可長時間在雲端執行、能串 Slack/Salesforce/Google Drive,是 Custom GPT 的企業版後繼者。
DeerFlow 是字節跳動開源的 Super Agent Harness,基於 Python 3.12 + LangGraph,透過沙箱、長期記憶、子代理、技能與訊息閘道協調長時任務。2026 年 2 月登上 GitHub 趨勢榜第一,目前超過 63,000 星,支援 Telegram/Slack/飛書等 IM、Claude Code 整合與多種搜尋後端。
MCP 不會退場,但有效範圍比想像中窄。本機開發場景 CLI 和 raw API 幾乎都贏過 MCP;MCP 真正不可替代的,是「跨 agent 共享的本機工具層」這條窄縫。
Better Agent Terminal (BAT) 是一個 Electron 桌面 app,把多個專案的 workspace、terminal、以及 Claude Code Agent 整合到同一個視窗,解決開一堆 iTerm 分頁、Agent 沒有好 GUI 容器的日常痛點。MIT License,macOS / Windows / Linux 都能裝。
按 GitHub Stars 排序,盤點 2026 年 15 個主流 AI Agent 框架的定位、特色與適用場景。不是排名,是地圖。
Harness 不只是呼叫 LLM 的 wrapper。Tool Registry 管理工具的動態載入與選擇、Guard System 建立四層防護網、Checkpoint-Resume 讓長時間任務可以中斷恢復。這三個模式是生產級 Agent 系統的關鍵基礎設施。
LangGraph 把 LLM 工作流程建模成有向圖,解決多輪迭代、條件分支、平行執行這些用線性 pipeline 做很痛的問題。
每個 AI 工具都有自己的呼叫格式,整合成本高。MCP(Model Context Protocol)是 Anthropic 提出的開放標準,統一 AI Agent 與外部工具、資料源的通訊協定,讓工具可以跨 Agent 重用。
RAG 是唯讀的。Agent Memory 讓 AI 不只能讀,還能寫入和持久化資訊。三種記憶類型:Procedural(行為模式)、Episodic(時間事件)、Semantic(事實知識),構成完整的認知記憶系統。
AI Agent 不是一個技術,是一整個架構體系。本文是系統化導航:從 Agent 三支柱(Context/Cognition/Action)出發,穿過 AI 工程三階段演化(Prompt → Context → Harness),到八種 Multi-Agent 設計模式和生產級 Harness 基礎設施。每個主題都有對應專文深入。
單一 RAG Agent 處理所有查詢會遇到知識邊界和效能瓶頸。Multi-Agent RAG 把檢索任務分派給多個專業化 Agent,每個 Agent 有自己的知識庫和檢索策略,由中央 Orchestrator 協調合併結果。
RAG 已經從簡單的「搜尋+生成」演化成涵蓋十個世代的技術體系,2025 年後更進入 Agentic/Reasoning RAG 新階段。本文是系統化導航:從 Naive RAG 到 Multi-Agent/LongRAG 的十代演化、後十代 Agentic Era(Search-R1/RL 搜索、MCP 協議、GraphRAG 3.x、視覺直嵌)、檢索策略、Chunking、Embedding、Reranking、評估框架、可觀測性、成本優化。每個主題都有對應專文深入。