所有標籤語言模型的輸入長度有限,agent 卻會一直累積工具輸出。李宏毅在 ML 2026 第二週把 Context Engineering 拆成三件事:壓縮(摘要、硬清除、卸載到檔案,以及 ACON、SUPO、AgentFold 這類讓壓縮變聰明的方法)、過濾(只讀需要的行、MCP-Zero 式的按需載入工具),最後是 Agentic Context Engineering:讓 LLM 自己決定下一輪的 context,從 Dynamic Cheatsheet、ACE 一路到 Recursive Language Models。投影片把 subagent 看成一種自主壓縮,這是整講最值得帶走的一個視角。
CME295 2026 版第 6 講(2026 年 11 月 6 日)課表列了七個主題,tool calling、MCP、retrieval 在 2025 版第 7 講已經講過;真正新增的是 context compaction、harness optimization、coding agents、skills/plugins。本篇是課前預寫版,用 Anthropic、OpenAI 的工程文章、MCP 2026-07-28 規格與 Meta-Harness 論文,先把這四個新主題講清楚。
Agent 每一步都把整段歷史重新送進模型,五次呼叫就累積 80K token 的輸入;OpenHands 的 1,500 個 session 平均 7.8 萬 token,其中 37% 是工具結果。Neubig 分兩層處理:模型層靠「多層局部 + 一層全域」的混合注意力與長度課程撐起百萬 context;harness 層靠穩定前綴吃到便宜約十倍的 cache,再用保留錨點、外存證據的 compaction 撐過上限,而且 compaction 要用接續任務來評。
2026 上半年 OpenAI、Anthropic、Letta、LangChain 不約而同選了 Markdown 檔案 + 索引取代向量資料庫;寫入權從 agent 交還給人;遺忘機制終於出現但沒人做 Ebbinghaus;LoCoMo 被 Penfield Labs 抓出 6.4% 錯答;三家同時用「Dreaming」指離線記憶整併。五個趨勢,一個結論:記憶不是功能,是架構決策。
Agent 記憶不是一個功能,是至少四種不同的工程問題——working、episodic、semantic、procedural。這個十篇系列從分類框架到 coding agent 實作、平台 API、開源框架、安全攻擊面,再到 2026 的趨勢判斷,完整走一遍設計空間。
CoALA 框架把 agent 記憶分為 working、episodic、semantic、procedural 四種,但光靠四格分類不夠——同一種記憶在不同系統裡的設計選擇差很大。這篇用六個獨立設計軸(讀取形態、寫入時機、保真度、寫入權、遺忘、範圍)加一條光譜(檔案 ↔ 向量/圖),畫出 2026 年 agent 記憶系統的完整設計空間。
五家雲平台都在 2025–2026 年推出 agent 記憶 API,但設計哲學分歧明顯:OpenAI 把記憶寫成檔案、Anthropic 把記憶掛載成目錄、Google 用向量加主題分類、AWS 用事件加策略管線、Microsoft 用 context provider 抽象。定價從免費到 $0.75/千筆/月不等,租戶隔離從「應用端自己來」到「IAM 一等公民」都有。
自建的 AI 助理用 Opus 4.6 生成 docx 連續兩次 stream_stall(90 秒超時)。根因是 skill instructions 少了一句 'Write a script',導致模型走 inline code output 路徑。claude.ai 的官方 SKILL.md 有這句話,穩定走 bash 執行。
使用者在後台把檢索 top_k 設成 15,但監控面板顯示 5、串流 UI 先閃 5 再跳 15。根因是同一個 top_k 值存在於四層——LLM 工具參數、執行時 runtime、trace DB、串流 payload——每層都要個別 override。三次修正,每次修完才發現下一層也錯。
Agent 有 workspace_browse 工具卻說「找不到檔案」——問題不在工具實作,在工具描述。Anthropic、OpenAI、Google 三家的官方指南都指向同一件事:觸發條件和工作流程要寫在 tool description 裡。一份 2025 年研究發現 97.1% 的 MCP 工具描述有品質問題。
子 agent 要不要看到父對話?Fork 帶完整歷史但 token 指數膨脹,Fresh 省錢但缺背景。業界共識:預設 Fresh,需要時才 Fork,且一定要搭歷史截斷和結果壓縮。
傳統需求散落在 Jira、Slack、會議紀錄裡,經過多次交接才到工程師手上。intent.md 讓需求發起人直接跟 Claude 對話,產出一份人可讀、機器可執行、版控可追溯的 Markdown proto-spec,從對話到文件只需要幾小時而不是幾週。
Claude Code 的 plan mode 讓工程師在寫任何程式碼之前,先產出一份可審查、可版控的實作計畫(plan.md)。設計審查從 PR diff 前移到計畫階段,修正成本從「改程式碼」降到「改文件」。
CLAUDE.md 是放在 repo 根目錄的上下文檔案,讓 Claude 在每次 session 開始時就知道這個專案的慣例、指令、架構和地雷。課程的核心建議:同樣的錯犯兩次,就寫進 CLAUDE.md。
Anthropic 在 Claude Academy 推出 14 堂免費課程,把 AI 寫程式從「個人用 Claude Code」拉高到「整個團隊的開發流程」。核心概念只有四個:intent.md、CLAUDE.md、Skills、Hooks,但它們串起來就是一套完整的 AI-native SDLC。
NVIDIA SkillSpector 掃描 agent skill 的 71 種漏洞模式;context-mode 用 MCP sandbox 把工具輸出壓到 2%;VoiceStudio 16 引擎本地跑語音克隆不送雲端;Pydantic AI v2.40.0 加入 realtime barge-in 和 @agent.on_event
Letta 延續 MemGPT 的作業系統類比,但它不是單一 memory API:agent state、可編輯的 in-context memory blocks、conversation history 與外部 archival memory 都由 runtime 持久化,模型也能透過工具主動整理記憶。
火山引擎開源 OpenViking 把 agent 的記憶、知識、技能存成 viking:// 虛擬檔案系統,用 ls、tree、find 就能翻。三層載入(L0/L1/L2)讓平均檢索只用 550 tokens,LoCoMo 記憶準確率從 24–57% 提升到 80–83%。
把 Anthropic 的 session 成本建議做成全域 skill,第一版就犯了它要防的錯:description 塞滿觸發關鍵字、用檔案數和分鐘數當硬門檻、把「保護主 context」和「省總 token」混成一件事。三輪修正後入口縮到一頁,細節拆進 references,數量門檻換成四個判斷維度,草稿裡的主張則逐條對官方文件查證。
Chroma 的對照實驗證明:就算塞得下,塞滿也會變差。於是各家 coding agent 發展出七種對策——壓縮、換手、剪枝、少載入、隔離、進模型、換單位。Amp 直接移除 /compact,Atlassian 說摘要該是最後手段,Cursor 的 A/B 測出 46.9% token 降幅。三場分歧的根源不是誰對,是各自在衡量不同的東西。
多數人以為 GenAI 證照的主軸是 prompt 寫作,但 CCAO-F 的 Prompting 只有 14%,輸出評估卻有 21%;CCDV-F 的 Prompt and Context Engineering 只有 11%。真正被考的是結構化輸出、防禦性 prompt、動態 context 注入、context 壓縮與快取、prompt 生命週期治理,以及「prompt 改了怎麼證明變好」——這六件事比較接近 context engineering 與軟體工程,而不是寫作技巧。另外沒有任何一張要你現場寫 prompt,全是選擇題,所以練「說得出為什麼」比練手感有用。最該記住的一條來自 CCAR-F:業務邏輯必須被保證時,「先改 prompt」通常是錯誤選項。
headroom 把送進 LLM 前的 tool output/log/RAG chunk 先做本地、內容感知的壓縮,7 個月衝上 6.6 萬星;agentmemory 讓 Claude Code、Cursor、Codex CLI 等十幾種 coding agent 共用同一份跨會話記憶,半年衝上 2.7 萬星;Andrew Ng 團隊的桌面 agent OpenWorker 把目標使用者從工程師擴大到一般知識工作者;NVIDIA 的 labs-OO-Agents 用物件導向重新設計 agent 抽象。Mastra 1.59.0 把 CostGuardProcessor 更名 TokenCostControl(breaking),browser-use 0.13.8 加入第一方 OpenClaw skill 支援。
微軟員工開源的 VS Code extension,讀本機 Claude Code / Codex / OpenCode 的 session log。真正的內容物是 45 條 Markdown 規則:prompt 短於 30 字元、收到 20 行 AI 程式碼後 15 秒內就送下一則、instructions 檔超過 4000 bytes——把「context engineering」翻成可以爭論的數字。
課程把指揮 agent 的工具列成四件:指示檔、hooks、commands、subagents。指示檔是唯一每次開機都全額進 context 的,所以它是 config 不是 memory;hooks 補上「規則會被忽略、hook 不會」那一塊;commands 是四件裡唯一由人主動觸發的。課程另給一張表,把軟體任務七步驟裡只剩一步半標成人的工作。
Agent Skills 的規格小到一句話講得完:一個含 SKILL.md 的資料夾。真正的設計在三層 progressive disclosure——開機只載 name 與 description,命中才讀全文,需要才展開附檔。本站自己的 repo 有 35 個 skill、7,893 行 SKILL.md,開機成本仍然只有那 35 組 metadata。
Fall 2026 把整整一週的 prompting 壓成這週的一節,換上 RePPIT(Research、Propose、Plan、Implement、Test)與 MCP。RePPIT 的兩條硬規則最值得抄:propose 一定要兩個方案、寫 code 的那個 instance 不准 review 自己的 code。MCP 那邊 Anthropic 量到把工具改成程式碼呼叫可以把 150,000 tokens 壓到 2,000。
Stanford CS146S 的 Fall 2026 大綱把 prompting 從整整一週壓成一節,砍掉終端機與 UI 生成兩週,換上 Agent Skills、Agent-Ready Codebases、Background Agents、AI-Native Team。評分也動了:Final Project 從 80% 降到 50%,多出 30% 的 open source 貢獻。這個系列照十週逐篇讀。
Chroma 測了 18 個前沿模型,全部隨輸入變長而跳崖式退化。記憶失效多半是檢索失效偽裝的。而 KV cache 的真正成本是頻寬不是儲存——decoding 每產生一個 token 都要讀過整個 cache。
工具一多,選擇準確率不是緩降是崩塌:4→51 個工具從 43% 掉到 2%、10→100+ 個從 78% 掉到 13.62%。根治解法是別一次塞全部——Anthropic Tool Search Tool 用 defer loading + 檢索砍 85% token,Opus 4.5 準確率 79.5%→88.1%。description 品質的效益是條件式的:簡單場景沒差,多工具串接場景 correctness 44%→50%。
CodeGraph 用 tree-sitter 把 codebase 抽成本地 SQLite/FTS5 知識圖譜,讓 AI coding agent 查圖而不是掃檔。官方端到端 benchmark(7 repos、median of 4)平均省 35% 成本、70% tool calls;但前提是 agent 直接走圖——把探索 delegate 給只會讀檔的 subagent,CodeGraph 反而變成 overhead。
別再把所有 tool description 在 session 開頭一次塞進 context。讓 model 寫 code、runtime 執行,tool 定義只在 import 那行才進 context — Anthropic 的 GDrive→Salesforce 範例從 ~150K tokens 降到 2K,Cloudflare 的 2,500 endpoints schema 從 1.17M 降到 1K。
Skill 是一個資料夾、一份 SKILL.md。三層 progressive disclosure 讓 Claude 在需要時才載入細節,避免每次對話重新解釋偏好。
Agent 的記憶不是一個插件,而是 harness 本身的一部分。選對記憶類型、估算資料量、再決定用什麼技術——最後,也要搞清楚你是否真的擁有那份記憶。
用自己寫的 30+ 篇 RAG/Agent 文章交叉檢視部落格現狀,整理出橫跨內容品質、網站技術、RAG 設計修正、Harness 基礎建設、AI Agent 應用的完整改進清單,按優先級排列、不分階段。
GitHub 上已有 6,400+ 個 .claude/agents/*.md 檔案。我們拆解了 4 個代表性專案——ChemistryTimes(內容生產 pipeline)、claude-sub-agent(document-driven 開發流水線)、agentic(Temporal.io DAG 平行執行)、vs-copilot-multi-agent(Hook 強制記憶寫入)——加上 ruflo 的企業級 swarm 架構,歸納出 6 種設計模式和 5 個實戰趨勢。
Agent CLI 不是更聰明的補全工具,而是能讀懂 codebase、執行多步驟任務、操作真實環境的 AI 代理。Claude Code、Codex CLI、Gemini CLI、OpenCode、Aider、Pi、Kiro、Amp、Cursor CLI... 工具越來越多,但底層共享一套設計邏輯——理解這套邏輯,才能真正用好它們。
AI 工程經歷三個階段:Prompt Engineering(寫好指令)→ Context Engineering(餵對資訊)→ Harness Engineering(設計整個工作環境)。每一次演化不是取代前者,而是在更高的抽象層級上操作。
Context Engineering 是 2025 年取代 Prompt Engineering 的核心概念:重點不再是「怎麼問」,而是「給什麼資訊」。把對的資訊在對的時機送進 context window,比換更強的模型更有效。這篇整理了定義、四大策略、實作技巧和常見失敗模式。
AI Agent 不是一個技術,是一整個架構體系。本文是系統化導航:從 Agent 三支柱(Context/Cognition/Action)出發,穿過 AI 工程三階段演化(Prompt → Context → Harness),到八種 Multi-Agent 設計模式和生產級 Harness 基礎設施。每個主題都有對應專文深入。
AI Agent 不是黑盒子——它由三層構成:知道什麼(Context)、怎麼想(Cognition)、能做什麼(Action)。搞清楚這三層,才能理解 agent 為什麼有時聰明、有時失控,以及怎麼設計一個真正好用的 agent 系統。