Skip to content
所有標籤

#context-engineering

40 篇文章

台大李宏毅 ML 2026 導讀:Context Engineering——壓縮、過濾、按需載入,以及要不要把 context 整個交給 LLM

語言模型的輸入長度有限,agent 卻會一直累積工具輸出。李宏毅在 ML 2026 第二週把 Context Engineering 拆成三件事:壓縮(摘要、硬清除、卸載到檔案,以及 ACON、SUPO、AgentFold 這類讓壓縮變聰明的方法)、過濾(只讀需要的行、MCP-Zero 式的按需載入工具),最後是 Agentic Context Engineering:讓 LLM 自己決定下一輪的 context,從 Dynamic Cheatsheet、ACE 一路到 Recursive Language Models。投影片把 subagent 看成一種自主壓縮,這是整講最值得帶走的一個視角。

CME295 2026 第 6 講預習:AI Agents,從叫工具走到管 context、調 harness

CME295 2026 版第 6 講(2026 年 11 月 6 日)課表列了七個主題,tool calling、MCP、retrieval 在 2025 版第 7 講已經講過;真正新增的是 context compaction、harness optimization、coding agents、skills/plugins。本篇是課前預寫版,用 Anthropic、OpenAI 的工程文章、MCP 2026-07-28 規格與 Meta-Harness 論文,先把這四個新主題講清楚。

CMU 11-768 導讀 L3:長 context agent 怎麼管記憶體——混合注意力、RoPE 外推、prompt cache 與 compaction

Agent 每一步都把整段歷史重新送進模型,五次呼叫就累積 80K token 的輸入;OpenHands 的 1,500 個 session 平均 7.8 萬 token,其中 37% 是工具結果。Neubig 分兩層處理:模型層靠「多層局部 + 一層全域」的混合注意力與長度課程撐起百萬 context;harness 層靠穩定前綴吃到便宜約十倍的 cache,再用保留錨點、外存證據的 compaction 撐過上限,而且 compaction 要用接續任務來評。

2026 記憶系統往哪走:檔案贏了向量,遺忘才剛開始

2026 上半年 OpenAI、Anthropic、Letta、LangChain 不約而同選了 Markdown 檔案 + 索引取代向量資料庫;寫入權從 agent 交還給人;遺忘機制終於出現但沒人做 Ebbinghaus;LoCoMo 被 Penfield Labs 抓出 6.4% 錯答;三家同時用「Dreaming」指離線記憶整併。五個趨勢,一個結論:記憶不是功能,是架構決策。

系列導讀:AI Agent 記憶工程

Agent 記憶不是一個功能,是至少四種不同的工程問題——working、episodic、semantic、procedural。這個十篇系列從分類框架到 coding agent 實作、平台 API、開源框架、安全攻擊面,再到 2026 的趨勢判斷,完整走一遍設計空間。

四種記憶與六個設計軸:Agent 記憶系統的設計空間

CoALA 框架把 agent 記憶分為 working、episodic、semantic、procedural 四種,但光靠四格分類不夠——同一種記憶在不同系統裡的設計選擇差很大。這篇用六個獨立設計軸(讀取形態、寫入時機、保真度、寫入權、遺忘、範圍)加一條光譜(檔案 ↔ 向量/圖),畫出 2026 年 agent 記憶系統的完整設計空間。

五朵雲的記憶 API:OpenAI、Anthropic、Google、AWS、Microsoft 怎麼讓 Agent 記住事情

五家雲平台都在 2025–2026 年推出 agent 記憶 API,但設計哲學分歧明顯:OpenAI 把記憶寫成檔案、Anthropic 把記憶掛載成目錄、Google 用向量加主題分類、AWS 用事件加策略管線、Microsoft 用 context provider 抽象。定價從免費到 $0.75/千筆/月不等,租戶隔離從「應用端自己來」到「IAM 一等公民」都有。

aidebug

一句 'Write a script' 的差距:Skill Instructions 如何決定 LLM 成功或失敗

自建的 AI 助理用 Opus 4.6 生成 docx 連續兩次 stream_stall(90 秒超時)。根因是 skill instructions 少了一句 'Write a script',導致模型走 inline code output 路徑。claude.ai 的官方 SKILL.md 有這句話,穩定走 bash 執行。

aidebug

修了三次才對:一個設定值在四層架構裡的不一致

使用者在後台把檢索 top_k 設成 15,但監控面板顯示 5、串流 UI 先閃 5 再跳 15。根因是同一個 top_k 值存在於四層——LLM 工具參數、執行時 runtime、trace DB、串流 payload——每層都要個別 override。三次修正,每次修完才發現下一層也錯。

aideep-dive

LLM Agent 工具發現:為什麼 Agent 有工具卻不用,以及怎麼修

Agent 有 workspace_browse 工具卻說「找不到檔案」——問題不在工具實作,在工具描述。Anthropic、OpenAI、Google 三家的官方指南都指向同一件事:觸發條件和工作流程要寫在 tool description 裡。一份 2025 年研究發現 97.1% 的 MCP 工具描述有品質問題。

Multi-Agent Context 管理:Fork vs Fresh、歷史截斷、結果壓縮的設計取捨

子 agent 要不要看到父對話?Fork 帶完整歷史但 token 指數膨脹,Fresh 省錢但缺背景。業界共識:預設 Fresh,需要時才 Fork,且一定要搭歷史截斷和結果壓縮。

AI-Native SDLC Playbook L2:intent.md 把需求變成版控文件

傳統需求散落在 Jira、Slack、會議紀錄裡,經過多次交接才到工程師手上。intent.md 讓需求發起人直接跟 Claude 對話,產出一份人可讀、機器可執行、版控可追溯的 Markdown proto-spec,從對話到文件只需要幾小時而不是幾週。

AI-Native SDLC Playbook L4:Plan Mode 先寫計畫再寫程式

Claude Code 的 plan mode 讓工程師在寫任何程式碼之前,先產出一份可審查、可版控的實作計畫(plan.md)。設計審查從 PR diff 前移到計畫階段,修正成本從「改程式碼」降到「改文件」。

AI-Native SDLC Playbook L5:CLAUDE.md 把團隊知識變成 Agent 的記憶

CLAUDE.md 是放在 repo 根目錄的上下文檔案,讓 Claude 在每次 session 開始時就知道這個專案的慣例、指令、架構和地雷。課程的核心建議:同樣的錯犯兩次,就寫進 CLAUDE.md。

Claude Academy:AI-Native SDLC Playbook 課程導讀

Anthropic 在 Claude Academy 推出 14 堂免費課程,把 AI 寫程式從「個人用 Claude Code」拉高到「整個團隊的開發流程」。核心概念只有四個:intent.md、CLAUDE.md、Skills、Hooks,但它們串起來就是一套完整的 AI-native SDLC。

AI Agent GitHub Digest — 2026-09-06

NVIDIA SkillSpector 掃描 agent skill 的 71 種漏洞模式;context-mode 用 MCP sandbox 把工具輸出壓到 2%;VoiceStudio 16 引擎本地跑語音克隆不送雲端;Pydantic AI v2.40.0 加入 realtime barge-in 和 @agent.on_event

aideep-dive

Letta/MemGPT 完整介紹:把記憶管理做進 Stateful Agent Runtime

Letta 延續 MemGPT 的作業系統類比,但它不是單一 memory API:agent state、可編輯的 in-context memory blocks、conversation history 與外部 archival memory 都由 runtime 持久化,模型也能透過工具主動整理記憶。

OpenViking:把 Agent 記憶做成虛擬檔案系統

火山引擎開源 OpenViking 把 agent 的記憶、知識、技能存成 viking:// 虛擬檔案系統,用 ls、tree、find 就能翻。三層載入(L0/L1/L2)讓平均檢索只用 550 tokens,LoCoMo 記憶準確率從 24–57% 提升到 80–83%。

aidebug

Claude Code skill 怎麼寫才不吃 context:入口、門檻、成本、來源

把 Anthropic 的 session 成本建議做成全域 skill,第一版就犯了它要防的錯:description 塞滿觸發關鍵字、用檔案數和分鐘數當硬門檻、把「保護主 context」和「省總 token」混成一件事。三輪修正後入口縮到一頁,細節拆進 references,數量門檻換成四個判斷維度,草稿裡的主張則逐條對官方文件查證。

Context 滿了怎麼辦:七種答案,沒有一種是共識

Chroma 的對照實驗證明:就算塞得下,塞滿也會變差。於是各家 coding agent 發展出七種對策——壓縮、換手、剪枝、少載入、隔離、進模型、換單位。Amp 直接移除 /compact,Atlassian 說摘要該是最後手段,Cursor 的 A/B 測出 46.9% token 降幅。三場分歧的根源不是誰對,是各自在衡量不同的東西。

prompt 與 context engineering 的考法:十張證照怎麼問,跟實務差在哪

多數人以為 GenAI 證照的主軸是 prompt 寫作,但 CCAO-F 的 Prompting 只有 14%,輸出評估卻有 21%;CCDV-F 的 Prompt and Context Engineering 只有 11%。真正被考的是結構化輸出、防禦性 prompt、動態 context 注入、context 壓縮與快取、prompt 生命週期治理,以及「prompt 改了怎麼證明變好」——這六件事比較接近 context engineering 與軟體工程,而不是寫作技巧。另外沒有任何一張要你現場寫 prompt,全是選擇題,所以練「說得出為什麼」比練手感有用。最該記住的一條來自 CCAR-F:業務邏輯必須被保證時,「先改 prompt」通常是錯誤選項。

AI Agent GitHub Digest — 2026-08-18

headroom 把送進 LLM 前的 tool output/log/RAG chunk 先做本地、內容感知的壓縮,7 個月衝上 6.6 萬星;agentmemory 讓 Claude Code、Cursor、Codex CLI 等十幾種 coding agent 共用同一份跨會話記憶,半年衝上 2.7 萬星;Andrew Ng 團隊的桌面 agent OpenWorker 把目標使用者從工程師擴大到一般知識工作者;NVIDIA 的 labs-OO-Agents 用物件導向重新設計 agent 抽象。Mastra 1.59.0 把 CostGuardProcessor 更名 TokenCostControl(breaking),browser-use 0.13.8 加入第一方 OpenClaw skill 支援。

aideep-dive

microsoft/AI-Engineering-Coach 的 45 條規則:一份把 agentic 工程意見寫成可執行門檻的清單

微軟員工開源的 VS Code extension,讀本機 Claude Code / Codex / OpenCode 的 session log。真正的內容物是 45 條 Markdown 規則:prompt 短於 30 字元、收到 20 行 AI 程式碼後 15 秒內就送下一則、instructions 檔超過 4000 bytes——把「context engineering」翻成可以爭論的數字。

CS146S Week 4:CLAUDE.md 該寫什麼、hooks 該擋什麼、subagent 該切在哪

課程把指揮 agent 的工具列成四件:指示檔、hooks、commands、subagents。指示檔是唯一每次開機都全額進 context 的,所以它是 config 不是 memory;hooks 補上「規則會被忽略、hook 不會」那一塊;commands 是四件裡唯一由人主動觸發的。課程另給一張表,把軟體任務七步驟裡只剩一步半標成人的工作。

CS146S Week 3:Agent Skills 是一個資料夾,難的是那兩行 description

Agent Skills 的規格小到一句話講得完:一個含 SKILL.md 的資料夾。真正的設計在三層 progressive disclosure——開機只載 name 與 description,命中才讀全文,需要才展開附檔。本站自己的 repo 有 35 個 skill、7,893 行 SKILL.md,開機成本仍然只有那 35 組 metadata。

CS146S Week 2:context 工程、RePPIT,與 MCP 的 98.7% 那一刀

Fall 2026 把整整一週的 prompting 壓成這週的一節,換上 RePPIT(Research、Propose、Plan、Implement、Test)與 MCP。RePPIT 的兩條硬規則最值得抄:propose 一定要兩個方案、寫 code 的那個 instance 不准 review 自己的 code。MCP 那邊 Anthropic 量到把工具改成程式碼呼叫可以把 150,000 tokens 壓到 2,000。

Stanford CS146S 兩版大綱對照:一年之間,這門 AI 開發課改掉了什麼

Stanford CS146S 的 Fall 2026 大綱把 prompting 從整整一週壓成一節,砍掉終端機與 UI 生成兩週,換上 Agent Skills、Agent-Ready Codebases、Background Agents、AI-Native Team。評分也動了:Final Project 從 80% 降到 50%,多出 30% 的 open source 貢獻。這個系列照十週逐篇讀。

context 與記憶:agent 失敗的真正位置

Chroma 測了 18 個前沿模型,全部隨輸入變長而跳崖式退化。記憶失效多半是檢索失效偽裝的。而 KV cache 的真正成本是頻寬不是儲存——decoding 每產生一個 token 都要讀過整個 cache。

aideep-dive

幾百個工具怎麼選得準:tool selection 的崩塌曲線與工程解法

工具一多,選擇準確率不是緩降是崩塌:4→51 個工具從 43% 掉到 2%、10→100+ 個從 78% 掉到 13.62%。根治解法是別一次塞全部——Anthropic Tool Search Tool 用 defer loading + 檢索砍 85% token,Opus 4.5 準確率 79.5%→88.1%。description 品質的效益是條件式的:簡單場景沒差,多工具串接場景 correctness 44%→50%。

aideep-dive

CodeGraph:本地端程式碼知識圖譜,與「直接走圖才省錢」的真相

CodeGraph 用 tree-sitter 把 codebase 抽成本地 SQLite/FTS5 知識圖譜,讓 AI coding agent 查圖而不是掃檔。官方端到端 benchmark(7 repos、median of 4)平均省 35% 成本、70% tool calls;但前提是 agent 直接走圖——把探索 delegate 給只會讀檔的 subagent,CodeGraph 反而變成 overhead。

aideep-dive

Code Mode:把 tool definition 從 context 搬進 code

別再把所有 tool description 在 session 開頭一次塞進 context。讓 model 寫 code、runtime 執行,tool 定義只在 import 那行才進 context — Anthropic 的 GDrive→Salesforce 範例從 ~150K tokens 降到 2K,Cloudflare 的 2,500 endpoints schema 從 1.17M 降到 1K。

aideep-dive

Claude Skills:把專業知識打包成資料夾,教一次就一直記得

Skill 是一個資料夾、一份 SKILL.md。三層 progressive disclosure 讓 Claude 在需要時才載入細節,避免每次對話重新解釋偏好。

aiguideAI Agent 實戰

Agentic Engineering 的記憶問題:從類型、實作到擁有權

Agent 的記憶不是一個插件,而是 harness 本身的一部分。選對記憶類型、估算資料量、再決定用什麼技術——最後,也要搞清楚你是否真的擁有那份記憶。

productproject

quidproquo 部落格改進完整規劃:從內容、技術、RAG 設計到 Harness 基礎建設

用自己寫的 30+ 篇 RAG/Agent 文章交叉檢視部落格現狀,整理出橫跨內容品質、網站技術、RAG 設計修正、Harness 基礎建設、AI Agent 應用的完整改進清單,按優先級排列、不分階段。

aiguide

Claude Code Agent Teams 怎麼用?從 GitHub 6,400+ 個 agent 看設計模式

GitHub 上已有 6,400+ 個 .claude/agents/*.md 檔案。我們拆解了 4 個代表性專案——ChemistryTimes(內容生產 pipeline)、claude-sub-agent(document-driven 開發流水線)、agentic(Temporal.io DAG 平行執行)、vs-copilot-multi-agent(Hook 強制記憶寫入)——加上 ruflo 的企業級 swarm 架構,歸納出 6 種設計模式和 5 個實戰趨勢。

Agent CLI 完整指南:設計邏輯、工具比較與使用原則

Agent CLI 不是更聰明的補全工具,而是能讀懂 codebase、執行多步驟任務、操作真實環境的 AI 代理。Claude Code、Codex CLI、Gemini CLI、OpenCode、Aider、Pi、Kiro、Amp、Cursor CLI... 工具越來越多,但底層共享一套設計邏輯——理解這套邏輯,才能真正用好它們。

aiguideAI Agent 實戰

從 Prompt 到 Harness:AI 工程的三次演化

AI 工程經歷三個階段:Prompt Engineering(寫好指令)→ Context Engineering(餵對資訊)→ Harness Engineering(設計整個工作環境)。每一次演化不是取代前者,而是在更高的抽象層級上操作。

aiguideAI Agent 實戰

Context Engineering:為什麼你的 AI Agent 問題出在資訊,不在模型

Context Engineering 是 2025 年取代 Prompt Engineering 的核心概念:重點不再是「怎麼問」,而是「給什麼資訊」。把對的資訊在對的時機送進 context window,比換更強的模型更有效。這篇整理了定義、四大策略、實作技巧和常見失敗模式。

aideep-dive

AI Agent 架構模式完整指南:從三支柱到 Multi-Agent 的系統化導航

AI Agent 不是一個技術,是一整個架構體系。本文是系統化導航:從 Agent 三支柱(Context/Cognition/Action)出發,穿過 AI 工程三階段演化(Prompt → Context → Harness),到八種 Multi-Agent 設計模式和生產級 Harness 基礎設施。每個主題都有對應專文深入。

aiguide

AI Agent 的三個核心支柱:Context、Cognition、Action

AI Agent 不是黑盒子——它由三層構成:知道什麼(Context)、怎麼想(Cognition)、能做什麼(Action)。搞清楚這三層,才能理解 agent 為什麼有時聰明、有時失控,以及怎麼設計一個真正好用的 agent 系統。