所有標籤李宏毅 ML 2026 第一講把 OpenClaw 拆成五個問題:agent 怎麼知道自己是誰、怎麼用工具與 SKILL、怎麼記憶、怎麼定時工作、怎麼長時間自主運作。答案都回到同一件事:語言模型只會文字接龍,每一輪都重新開始,身分、記憶、SOP 全是 OpenClaw 塞進 prompt 的文字檔,或模型透過工具讀寫的檔案。本篇照 intro.pdf 60 頁與課堂錄影走一遍,也整理投影片裡的防禦建議。
CME295 2026 版第 6 講(2026 年 11 月 6 日)課表列了七個主題,tool calling、MCP、retrieval 在 2025 版第 7 講已經講過;真正新增的是 context compaction、harness optimization、coding agents、skills/plugins。本篇是課前預寫版,用 Anthropic、OpenAI 的工程文章、MCP 2026-07-28 規格與 Meta-Harness 論文,先把這四個新主題講清楚。
CMU 11-768 第一份作業要你從空白的 ReAct 迴圈做起:先讓 CodeAgent 用 bash 修好一個西洋棋 app 的 bug,再加上下文壓縮去修一題 SWE-bench,最後讓同一個迴圈變成下棋的 ChessAgent,並用 simulate_move、run_python 與 skill 做兩步搜尋;100 分全部靠離線重播 patch 與軌跡評分。
CMU 11-768 第 4 講把跨任務的經驗分成 episode、fact、skill 三種,存在 context 與權重之外的外部檔案裡:人寫的 skill 靠 SKILL.md 與漸進揭露載入,SkillsBench 上把平均通過率從 33.9% 拉到 50.5%;agent 自己歸納的 skill 寫成程式碼時可以先測再收,但換個網站就容易壞。最難的是生命週期:判官不準、檢索太多、技能庫膨脹,每一段都會吃掉收益。
自建的 AI 助理用 Opus 4.6 生成 docx 連續兩次 stream_stall(90 秒超時)。根因是 skill instructions 少了一句 'Write a script',導致模型走 inline code output 路徑。claude.ai 的官方 SKILL.md 有這句話,穩定走 bash 執行。
alibaba/open-code-review 用「確定性工程 + agent」取代純 prompt 審查,token 消耗只有通用 agent 的 1/9;cloudflare/security-audit-skill 把 Cloudflare 自己抓漏洞的六階段流程包成 skill 開源,強調對抗式驗證;microsoft/skills 把 175 個 Azure SDK 領域知識打包成一鍵安裝的 skill/MCP 組合;Pydantic AI 兩天內連發 v2.45.0、v2.46.0,加入 TypeSafeModel 與 Choices helper
JustVugg/colibri 用記憶體多層調度把 744B–2.8T 參數的 MoE 模型塞進消費級硬體跑;tech-leads-club/agent-skills 想在 agent skill 變成下一個 npm 供應鏈風險之前先做好驗證;alphaXiv/OpenResearch 把 Claude Code / Codex 變成能跑實驗的研究員;calesthio/OpenMontage 用 agent 包辦從腳本到成片的整條影片產線;alibaba/open-code-review 用「規則引擎 + LLM agent」混合架構開源自家 code review 工具;Claude Code v2.1.269 把 Workflow tool 的並行 agent 上限拉到 256
Skill 是組織隱性知識的編碼形式——一個資料夾加一份 SKILL.md,讓 Claude 在觸發條件成立時自動載入並執行標準作業程序。課程的關鍵原則:skill 讓違規變少見,hook 讓違規接近不可能。
Anthropic 在 Claude Academy 推出 14 堂免費課程,把 AI 寫程式從「個人用 Claude Code」拉高到「整個團隊的開發流程」。核心概念只有四個:intent.md、CLAUDE.md、Skills、Hooks,但它們串起來就是一套完整的 AI-native SDLC。
obra/superpowers 把整套開發方法論固化成可跨 8 種 harness 安裝的 skill;affaan-m/ECC 用 68 個 agent + 286 個 skill 做 agent harness 效能優化系統;cathrynlavery/diagram-design 單日漲 2,286 星,用 39 種編輯風格圖表取代 Mermaid;Tencent teamai-cli 讓團隊統一分發 skill/rule/MCP 設定;Pydantic AI v2.42.0 新增 GitHub Copilot provider
mattpocock/skills 單日暴漲 2,757 星,是今天 GitHub Trending 漲最快的專案;Anthropic 官方 anthropics/skills 與開源 coding agent anomalyco/opencode 同步在榜。另一頭,MCP server reverify 用 71 個真實 Windows 系統檔案的 benchmark 證明:AI 讀 binary 時有 97% 機率在瞎掰,唯有確定性工具能攔下來。框架端 pydantic-ai、agno、haystack 今天都只有例行 patch,無重大更新。
NousResearch/hermes-agent 靠自我學習迴圈記住怎麼用你的工具、跨平台記得你是誰,239,994 星持續衝榜;pacifio/atlas 讓多個 coding agent 共用一套「看得到是誰改的」版本控制,一天漲 895 星;blader/humanizer 用 35 種模式把 AI 味洗掉但不竄改事實。文件處理端 firecrawl/pdf-inspector 用 Rust 在 50ms 內判斷 PDF 要不要 OCR;superlinked/sie 把 agent 會用到的所有模型收進一個自架推理叢集。框架端 AG2 v1.0.3 全面遷移 MCP 2.0(breaking change),並加入不靠 LLM 判斷的 TealTigerMiddleware 做 prompt injection 防護。
can1357/oh-my-pi 從知名 coding agent「Pi」fork 出來,靠死磕工具呼叫格式讓 Grok Code Fast 1 的任務成功率從 6.7% 衝到 68.3%;K-Dense-AI/scientific-agent-skills 把 163 個科研技能開放給任何相容 Agent Skills 標準的 agent;addyosmani/agent-skills 把資深工程師的六階段開發流程包成技能包,一週衝上 9 萬星;THU-MAIC/OpenMAIC v1.0.0 加入對話式 Pro workbench,把 multi-agent 落到課程內容產製這個具體垂直場景。框架端 agno v3.0.2 是本次唯一達標的重要更新:直接把 Agent/Team/Workflow 發布成具名 MCP tool,同時有多筆 breaking changes。
calesthio/OpenMontage 用 12 條產線、700+ 個 skill 檔把通用 coding agent 變成影片後製棚,本週衝上 5 萬星;Anthropic 官方外掛市集 claude-plugins-official 單日 +292 星;rohitg00/agentmemory 用 BM25+向量+知識圖譜做 coding agent 跨 session 記憶,自家 benchmark 宣稱 LongMemEval-S R@5 95.2%;sodiumsun/agenttrail 幫 Claude Code / Codex / Cursor 做本機即時任務地圖。今日框架端無重大 release。
把 Anthropic 的 session 成本建議做成全域 skill,第一版就犯了它要防的錯:description 塞滿觸發關鍵字、用檔案數和分鐘數當硬門檻、把「保護主 context」和「省總 token」混成一件事。三輪修正後入口縮到一頁,細節拆進 references,數量門檻換成四個判斷維度,草稿裡的主張則逐條對官方文件查證。
Agent Plugins 1.0 是一個封裝格式標準,把 Agent Skills(Markdown 指令)和 MCP server 設定包成一個目錄,讓同一個 plugin 能被 ChatGPT、Cursor、GitHub Copilot、Kiro、VS Code 直接載入。它不是新的協議,是協議之上的包裝紙。Vercel 發起,OpenAI、AWS、Microsoft、Cursor 共同制定,Google 發佈當天加入——Anthropic 不在治理名單上,但 MCP 團隊正面回應。
2026 年 agent 做簡報的共識:outline-first + 內容/構建分離 + render 成圖讓 fresh-eyes subagent 做視覺 QA。Anthropic 與 OpenAI 的官方 slides skill 都收斂到 PptxGenJS + 視覺驗證迴圈,學術線(PPTAgent→PreGenie→DeepPresenter)也指向同一方向。但下半年出現兩個修正:PresentBench 指出常被引用的 PPTEval 給分過於樂觀,SeaSlides 則主張不該讓模型直接寫自由格式的 HTML/SVG。
Agent Skills 的規格小到一句話講得完:一個含 SKILL.md 的資料夾。真正的設計在三層 progressive disclosure——開機只載 name 與 description,命中才讀全文,需要才展開附檔。本站自己的 repo 有 35 個 skill、7,893 行 SKILL.md,開機成本仍然只有那 35 組 metadata。
PIMiner 用可跨模型轉移的策略庫,以約 20 美元查詢成本讓提示注入攻擊成功率衝上 76-87%;Agent Skills Can Be Harmful 從 307 個技能誘發失敗中發現看似相關的技能比明顯無關的技能更容易搞砸任務,過度流程占效率退化六成以上;Order 66 情境分析用組合式威脅模型證明休眠植入、事後記憶投毒與對等擴散單獨看都不致命,疊加後可能自我維持傳播
MCP 管 agent ↔ 工具,A2A 管 agent ↔ agent,Skills 管可重複使用的知識。判準是資料會不會變:呼叫之間會變就要 MCP,穩定到可以寫下來就用 skill 檔案——後者不需要一個會獨立失敗的 runtime。
HeyGen 開源的 HyperFrames 用 HTML data 屬性定義影片時間軸,headless Chrome 逐幀 seek 截圖再由 FFmpeg 編碼成 MP4。3 個月 33k stars,Apache 2.0,21 個 agent skills——AI agent 寫 HTML 就能產影片,不需要 React。
MUSE-Autoskill(2026)提出五階段 skill 生命週期框架,自創 skill 在 SkillsBench 達 60.35%(+7.16%),成功生成 skill 的任務上更達 87.94%,超越人工撰寫上限。本文整合六篇 arXiv 論文,梳理 skill evolution 研究全景。
Browserbase 在 2026-05 推出的 browse.sh,是「瀏覽器技能目錄 + Browse CLI」兩件事。核心論點:瀏覽器 Agent 的瓶頸是健忘症不是推理,把學過的網站操作存成純文字 SKILL.md,Craigslist 任務官方自評從 ~$0.22 降到 ~$0.12。注意它跟 2018 年的 Browsh 文字瀏覽器毫無關係。
Claude 沒有 docx_tool / pdf_tool — 它只用 bash + file tools,加上 SKILL.md 指令、容器內預裝的 pdfplumber / python-pptx 等 library,三層拼出檔案讀寫能力。
綜述 11 個公開的 LLM 寫作 pipeline,三條主流模式:多 agent(researcher → writer → critic)、Karpathy LLM-wiki(raw + wiki + LLM 寫不手寫)、品質防線(technical verifier + never fabricate + brief gate)。Princeton GEO 論文(KDD 2024)量化了 inline 引用 +28%、加數字 +33%、quote 原文 +41%、關鍵字塞詞 −9%。
Agent Skills 是 Addy Osmani 開源的 19 個生產級工程技能,透過 /spec → /plan → /build → /test → /review → /ship 的指令驅動 AI 代理遵循資深工程師的開發紀律,而不是走捷徑。
Skill 是寫給 AI 看的 SOP。一個 markdown 檔案定義步驟,Claude 照著執行。不用寫程式,不用學框架,只要把「有經驗的人會怎麼做」寫成步驟就好。