所有標籤PageIndex(38.4k★,單日 +1,097)用目錄樹取代向量索引做推理式 RAG;iFixAi(18.3k★,+340)給 agent 配一個 120 秒稽核工具;Octop(6.2k★,+285)是騰訊雲開源的 local-first 多 agent 助理平台;BMAD-METHOD(53.7k★)把敏捷開發改寫成給 coding agent 用的 spec-driven 流程。Agno v3.1.0 加入 RBAC 權限套件但檔案系統要停機遷移;Pydantic AI v2.52.0 修了 web_fetch 的資安漏洞並把 harness 併入主倉庫。
dots(1.9k★,上線不到一天)用改過的 Firefox 引擎讓網頁 agent 不被偵測;context-mode(24.5k★,Hacker News 當日 #1)把工具輸出砍 98% 省 context;openrig(3k★)讓 Claude Code 和 Codex 組成同一個 team;dbx(23.2k★)把資料庫客戶端做成內建 AI 的 MCP server;universal-modder 讓 Claude Code 直接改遊戲 mod。Claude Code v2.1.286 版號是 patch,內容卻修了一批憑證洩漏漏洞,Haystack v3.3.0-rc1 修 anyio CVE 並調整 BM25 檢索行為。
paperclip(94.5k★)把 agent 當員工管,建組織圖、發預算、留稽核紀錄;Orca(81.6k★)讓你在各自的 git worktree 同時跑一整排 coding agent;Hindsight(42.8k★)把 agent 記憶拆成四層,從「記得」進化到「學會」;CLI-Anything(51k★)把任何軟體包成 agent 能穩定呼叫的 CLI;Cloudflare 開源自己拿來稽核程式碼的 security-audit-skill(23.2k★),靠「發現與驗證分屬兩個 agent」壓低誤判。crewAI 1.15.23 加入原生 Gemini 3.8 Flash 支援,Claude Code v2.1.285 則替背景長跑指令加上預設逾時。
Z.ai 的 ZCode(7k★)把桌面殼、瀏覽器介面和 Agent CLI 包進同一個 coding agent 工作台;magpie(1.6k★)在選單列一鍵切換 Claude Code / Codex / Gemini CLI 底層接的模型;jevgrep(1.3k★)用語意搜尋幫 coding agent 先找檔案,省掉部分來回 grep 的 token;golive-skill 和 agent-console 分別補上部署自動化與 session 可觀測性。Claude Code 今天發布 v2.1.284,新增 Sonnet 5.5 預設模型與多項終端機修復。
BuilderIO/agent-native(6.9k★)把 agent 工具和人類 UI 定義成同一份程式碼;yynxxxxx/Codex-X(4k★)幫 Codex CLI 包一層桌面圖形介面;career-ops-hq/career-ops(72.9k★)把 agent 塞進找工作這種私人任務,全程跑在本機 coding CLI 裡,不架網站也不上傳履歷。追蹤清單裡的框架今天沒有新的重大 release——Pydantic AI v2.51.0 與 Claude Code v2.1.283 都已在昨天報過。
Paperclip(86.7k★)用組織圖、預算、心跳排程把一群 agent 當員工管理;Block 開源的 Buzz(34.8k★)反過來讓人與 agent 用同一套 Nostr 簽章協定共用工作空間;智譜 Z.ai 開源 ZCode,加入自建 coding agent 殼的陣營;mobile-mcp 把 MCP 工具延伸到真實 iOS/Android 裝置。Notable Releases:Pydantic AI v2.51.0 加入 OpenAI GPT-Live 並收緊 realtime tool_choice/型號比對;Claude Code v2.1.283 新增 `deniedModels` 鎖模型設定與 `/doctor prompt-audit`。
Nokia 應用研究團隊開源 AnyJev,用 cyclic shift+批次先驗校正讓任何開源 LLM 免訓練吐出校準過的決策機率,官方測試把可自動判定流量從 7.7% 拉到 52.0%;DSPy 3.4.0 接上 TypeSafe client 並帶兩項 breaking changes;Pydantic AI v2.50.0 把上週的 `TypeSafeModel` 升級成正式的 `DecisionModel` 基底類別;另外還有幫 agent 產出接手上線部署的 golive-skill、讓 coding agent 換底層模型像點選單一樣簡單的 magpie、讓 Claude Code 和 Codex 組隊且會自我改寫 skill 的 sno-station。
google/ax 用 Kubernetes 風格的 Workspace/Task/Gateway/Model 四個原語跑 agent workload,今天狂漲 1,376 星;strands-agents/harness-sdk 把 agent loop 的 lifecycle、工具、MCP、多 agent、記憶全打包進 create_harness() 一行呼叫;HKUDS/CLI-Anything 幫任意軟體生成 agent 原生 CLI 介面,50,241 星、附 arxiv 技術報告;vectorize-io/hindsight 主打「會學習」的 agent 記憶,在 LongMemEval benchmark 宣稱業界最佳,今天單日漲 1,607 星;Haystack 3.2.0 加入摘要式 context 壓縮與 token 預算控制,但 Toolset 的 `+` 合併語法被整個移除。
browser-use/video-use 讓 Claude Code 直接剪片,靠 ElevenLabs 逐字稿定位時間軸,25,702 星;dream-num/univer 把辦公室 SDK 重新定位成「AI Agent 的 Office Harness」,今天登上 TypeScript 榜首;superdesigndev/treg 做「OpenRouter for agent tools」,讓 agent 免簽約、按次付費呼叫 3,000+ 個工具端點;davila7/claude-code-templates 破 3 萬星,靠一鍵安裝 agent/command/MCP 範本取代手刻設定;pydantic-ai v2.47.0 收緊型別驗證,`UserPromptPart.content` 型別錯誤不再靜默降級。
Microsoft 開源 agent-governance-toolkit(6,303 星)把 tool call 攔截做成程式碼層強制執行,引用 ICLR 2025 論文(對 GPT-4o/Claude 3/Llama-3 的自適應攻擊 100% 成功率)反駁純提示詞防護;ai-memory 一個月從 2,900 星漲到 7,575,讓長期記憶能跨 20 多種 coding agent CLI 共用;anthropics/financial-services 把金融垂直 agent 同時發成 Cowork plugin 跟 Managed Agents API 範本,35,728 星;MCP 官方 Inspector 出到 v2.7.0,web/cli/tui 三個 client 統一成一支 binary;coder/coder 把 AI coding agent 塞進 Terraform 定義的受控工作環境,API key 不進 workspace。
openclaw/openclaw 十個月衝上 39 萬星,但今天發的 v2026.9.5 也讓部分使用者升級後 session 消失、要等 8 小時才恢復;volcengine/OpenViking 直接拿 OpenClaw/Hermes/Claude Code 當對照組,證明外接 context database 能把長對話記憶準確率從 24-57% 拉到 80-83%;trycua/cua 發表 2.8MB 的 CUA-S1-FORMS,把填表格這種小決策從通用模型手上接走;pydantic-ai v2.46.0 也把同一種「窄任務轉交專門決策模型」的設計鋪進框架核心 API
affaan-m/ECC 靠「agent harness 效能優化」8 個月衝上 26 萬+ star,但成長速度快到該保守看待;cactus-compute/needle 用 8-29MB 模型犧牲聊天能力換工具呼叫精準度;Graphify-Labs/graphify 用本地 AST parsing 建知識圖譜取代向量資料庫;tinyhumansai/openhuman 把「認識使用者」當 agent 記憶的核心賣點;IvanMurzak/Godot-MCP 讓 agent 直接操作 Godot 編輯器;Claude Code v2.1.277 加入 AGENTS.md 支援
10+ 個社群開源的 deep-research skill 代表了 10+ 種「怎麼做研究」的哲學。從 hyperresearch 的持久化 vault 到 jamoeight v2 的 Co-Scientist 6-agent,從對抗驗證到 benchmark 對齊。這篇把它們放在一張表裡看。
七套開源記憶框架分佈在「向量抽取」到「檔案系統」的光譜上:Mem0 一行 add() 自動抽取、Graphiti 用 bi-temporal 知識圖保留矛盾歷史、Letta 讓 agent 自己編輯釘在 system prompt 的 blocks、LangGraph 用 namespace Store 做跨 agent 共享、LlamaIndex 靠 block 優先級控制截斷順序、Cognee 走三種儲存混合管線、Supermemory 強調時態向量圖引擎。這篇整理各自的儲存形式、寫入與遺忘機制、租戶隔離、benchmark 數字,再按四種常見場景給選型建議。
Deep research 的開源生態已經從『單一框架』演變成『工具叢集』。這篇比較 12+ 個專案:GPT-Researcher 重視多代理協作、STORM 模擬專家對話、smolagents 強調狀態管理。每個工具解決不同問題。
alibaba/open-code-review 用「確定性工程 + agent」取代純 prompt 審查,token 消耗只有通用 agent 的 1/9;cloudflare/security-audit-skill 把 Cloudflare 自己抓漏洞的六階段流程包成 skill 開源,強調對抗式驗證;microsoft/skills 把 175 個 Azure SDK 領域知識打包成一鍵安裝的 skill/MCP 組合;Pydantic AI 兩天內連發 v2.45.0、v2.46.0,加入 TypeSafeModel 與 Choices helper
Laguna 是 Poolside 的 agentic coding 模型家族:XS 2.1 以 33B-A3B 跑進 36GB Mac,S 2.1 以 118B-A8B、1M context 在 Terminal-Bench 2.1 拿下 70.2%、DeepSWE 40.4%,兩者都掛 OpenMDW-1.1 開源。
蚂蚁集團百靈大模型家族完整介紹:2025→2026 演化時間線、Ling/Ring/Ming 三大系列雙軌策略、從 Ling 1.0 到 Ling 3.0 的架構躍遷、Ling-3.0-flash-Fin 金融增強模型,以及 Agent 開發者的選型指南
Nex-N2.5 是 Nex AGI 的開源 agentic 模型家族:mini 以 35B-A3B 在 OSWorld-G 拿下 82.9 分,Pro 以 397B-A17B、87.4 分超車 Claude Opus 5,Max 以 1.6T 在 BrowseComp 以 92.6 分居全表之冠,三款都掛 Apache-2.0 開源。
NousResearch/hermes-agent 主打閉環學習——自己從經驗生技能、自己改進技能、跨對話記得你是誰;mksglu/context-mode 用 MCP + hooks 把工具輸出砍 98%,衝上 Hacker News 第一名;shinthink/blitzstrike 把偵察、靜態分析、live 驗證包成一支 MCP 滲透測試工具;pliablepixels/gap-trap 幫 vibe coding 裝 CI 閘門;Pydantic AI v2.44.0 一次修四個安全漏洞,CrewAI 1.15.22 加了跨模型路由的 `llm_overlay`
Cloudflare 開源 security-audit-skill,用六階段流程逼 agent 的資安稽核「發現者與驗證者永遠不同人」,上線單日暴漲 1,249 星;Vercel 推出 agent 框架 eve,往 LangGraph/Mastra 的地盤卡位;火山引擎 OpenViking 把知識、記憶、技能統一成一個可分層讀取的虛擬檔案系統;Anthropic 開源 11 個角色化 Claude plugin;Agno v3.0.10 把 shell 執行和公開 MCP 存取的預設值都收緊成需要顯式開啟
Alibaba 開源 Open Code Review,用「確定性引擎 + LLM agent」混合架構取代純 agent code review,token 只要 Claude Code Skills 的 1/9;pacifio/atlas 把 git 式版本控制搬進多 agent 協作,讓 Claude Code、Codex 共用 checkpoint 和記憶;alphaXiv/OpenResearch 把任何 coding agent 變成能自動跑實驗、留下可查證紀錄的 research agent;JustVugg/colibri 用純 C 引擎把 VRAM/RAM/硬碟當同一層記憶體,在消費級硬體上跑 2.8T 參數的 MoE 模型;今日無重要框架更新
CopilotKit/OpenBot 給每個 AI coworker 一台自己的電腦,所有動作先過閘門再執行;Tencent/teamai-cli 把 skill、rule、MCP 設定用「push → review → pull」同步給整團隊的 Claude Code / Codex / Cursor;VaderChen/YourDesk 新增 MCP,讓 agent 能直接連上、操作一台遠端桌面;agent-launcher 用一個桌面 App 統一管理六種 coding agent CLI 的帳號與設定;AgentVerse-OS 給每個專案一個獨立的 Incus 容器工作區,agent 只准在裡面跑;今日無重要框架更新
JustVugg/colibri 用記憶體多層調度把 744B–2.8T 參數的 MoE 模型塞進消費級硬體跑;tech-leads-club/agent-skills 想在 agent skill 變成下一個 npm 供應鏈風險之前先做好驗證;alphaXiv/OpenResearch 把 Claude Code / Codex 變成能跑實驗的研究員;calesthio/OpenMontage 用 agent 包辦從腳本到成片的整條影片產線;alibaba/open-code-review 用「規則引擎 + LLM agent」混合架構開源自家 code review 工具;Claude Code v2.1.269 把 Workflow tool 的並行 agent 上限拉到 256
max-sixty/worktrunk 把 git worktree 管理做得像切換分支一樣簡單,專為平行跑多個 coding agent 設計;melgarafael/DeskcommCRM 用 MCP 把整個 CRM 開放給 AI agent 操作,鎖定 WhatsApp 銷售場景;alsk1992/CloddsBot 內建 x402 協定讓 agent 互相付 USDC,同時也把 200 倍槓桿交易包進同一個聊天介面;vxcontrol/pentagi 用全自動 agent 在 Docker 沙箱裡跑滲透測試;DSPy 3.4.0 Beta 1 把 LM 執行層換成內建引擎,取代 3.3 版的實驗性型別
obra/superpowers 把整套開發方法論固化成可跨 8 種 harness 安裝的 skill;affaan-m/ECC 用 68 個 agent + 286 個 skill 做 agent harness 效能優化系統;cathrynlavery/diagram-design 單日漲 2,286 星,用 39 種編輯風格圖表取代 Mermaid;Tencent teamai-cli 讓團隊統一分發 skill/rule/MCP 設定;Pydantic AI v2.42.0 新增 GitHub Copilot provider
reverify 用二進位逆向工程的真實基準(97% 錯誤率全數攔下)證明確定性驗證比要求模型謹慎更有效;useAgent 把 Claude Code / Codex 包成雲端 AI 同事平台;bankmcp 讓 AI 透過 PSD2 唯讀讀取歐洲銀行帳戶;headcount 把 Claude Code skill 生態系拆成 16 個部門的公司架構;Pydantic AI 2.41 與 Agno 3.0.8 同日更新
DeepSeek Harness(dsh)用 everything-is-a-plugin 架構 3 週衝上 21.4 萬星;ponytail 用實測數據證明一個 skill 能讓 Claude Code 少寫 54% 程式碼;Magnitude 幫你的 coding agent 自動挑本地模型跑;wigolo 讓 agent 免 API key 搜尋、爬蟲、研究整個網路
Marker(Datalab 開源,Apache 2.0 授權,v2.0.0 於 2026-07-20 發布,39.5k stars)是一個以 Markdown 與 JSON 為輸出的 pipeline 式文件解析標準庫,支援 PDF、圖像、PPTX、DOCX、XLSX、HTML、EPUB,並提供可選的 LLM 增強(`--use_llm`,預設 `gemini-3.5-flash`)、可自訂格式邏輯與表格/公式/內嵌數學/連結/參考/程式碼區塊的完整處理、圖像提取與保存、標頭/頁尾移除,並可在純 CPU、GPU 或 MPS(Apple Silicon)環境運作。與 [Docling](/posts/tech/2026-09-06-docling-document-parsing) 同屬解析層,但授權路徑(`Apache 2.0` 代碼 + `AI Pubs Open Rail-M` 模型權重,有商業門檻 `$5M`)、輸出核心(`Markdown` 為主而非結構化 `JSON`)、解析引擎特點(`Pipeline` 式可替換階段,但 `VlmPipeline` 為可選的 `LLM` 增強而非固定 `VLM` 選項)、與 [MinerU](/posts/tech/2026-09-05-mineru-ocr-doc-parsing)(自訂協議、`Markdown` 為核心、`Hybrid` `effort` 參數)的差異形成解析層內三種不同取捨路徑。
拆解三個中文圈從零訓練 LLM 的開源專案——baby-llama2-chinese(218M、634 億 tokens)、ChatLM-mini-Chinese(0.2B T5、1,023 萬條對話)、Steel-LLM(1.12B、1 兆 tokens、8 個月)——比較語料策略、tokenizer 決策與社群生態;誠實呈現評測:baby-llama2 在 MiniMind 的橫評中 21 分墊底,ChatLM 知識紮實(62 分)但程式能力弱。
OpenELM 用 layer-wise scaling 把參數偏向靠近輸出的層,1.08B 參數、1.5T tokens 在 LLM360 平均分數上超越吃了 3T tokens 的 OLMo 1.2B(+2.36%);MiniCPM 用三階段解凍(先 Resampler、再視覺編碼器、最後全開)從零訓練多模態小模型,MiniCPM-V 4.5 以 8B 達到 VideoMME 30B 以下 SOTA,再靠 4-bit 量化把 fp16 的 16–17GB 記憶體壓到約 5GB。
LitGPT(Lightning AI,約 13,600 stars,Apache 2.0)把 Llama 3、Qwen2.5、Phi 4 等 20+ 個 LLM 逐一從零重寫成無抽象層的單檔實作,附 pretrain / finetune / evaluate / serve 完整命令列;1.1B 參數、3T tokens 的 TinyLlama 就是用它的程式碼訓出來的。這篇拆解它與 MiniMind 的差異、實際用法與限制。
MiniMind 是一個從零開始訓練 LLM 的開源專案:64M 的 Dense 模型與 198M-A64M 的 MoE 模型,單張 3090 約 2 小時、約 3 元人民幣就能跑完 Pretrain → SFT → LoRA → DPO → PPO/GRPO/CISPO → Agentic RL 的完整流程。所有核心演算法用 PyTorch 原生實作,不依賴高階封裝。
兩個國家級專案展示了從零訓練的另一種動機:瑞士的 Apertus 用 15T tokens、1,000+ 語言與嚴格的 opt-out 個資過濾對齊 EU AI Act;日本的 LLM-jp 由 NII 主導,2026 年 4 月的 LLM-jp-4 在 12T tokens 上訓練出多項 benchmark 超越 GPT-4o 的模型。它們回答的問題和效能路線不同:不是「跑得快」,而是「主權與合規下能訓出什麼」。
「開源 LLM」其實是一條光譜:只開權重(Llama)→ 權重加資料(多數 fully open 專案)→ 連資料順序、中間 checkpoint、訓練日誌都開(LLM360 K2、OLMo 3 的 model flow)。這篇拆解兩個把透明度推到極致的專案:OLMo 3 在 2025 年 11 月放出首個全開的 32B thinking 模型,K2 則是首個 65B 級、連 optimizer states 都公開的模型。
開源社群把「從零訓練 LLM」的門檻壓到了驚人的低:MiniMind 用約 $0.4、單張 3090 兩小時就能跑完從 PreTrain 到 RL 的完整流程,另一端 OLMo 3 與 LLM360 K2 把 65B 模型的訓練資料、程式碼、每個階段的 checkpoint 全部公開。這個系列用 11 篇逛完從 $0.4 到 65B 的專案光譜,並標註這份地圖覆蓋不到的地方。
從零訓練只在三種情況成立:你要學習訓練本身、你有開放模型沒見過的 10B+ 乾淨語料、或你需要全透明的訓練過程做研究。否則微調或 RAG 幾乎總是更便宜的答案。這篇把系列走過的主要路線收斂成一張成本梯度表與決策樹。
YuLan-Mini 是中國人民大學 AI Box 實驗室用 48 張 A800 訓出來的 2.4B 開源模型:只餵 1.08T tokens,MATH-500 拿 37.8、HumanEval 64.0,數學與程式能力壓過用了 7T–18T tokens 的 Qwen2/Qwen2.5 同級模型。它公開的不是口號,是每個階段的資料配比、退火前的 optimizer 狀態、連消融實驗的 W&B logs。
NVIDIA SkillSpector 掃描 agent skill 的 71 種漏洞模式;context-mode 用 MCP sandbox 把工具輸出壓到 2%;VoiceStudio 16 引擎本地跑語音克隆不送雲端;Pydantic AI v2.40.0 加入 realtime barge-in 和 @agent.on_event
Docling(IBM Research Zurich 起源,現由 Linux Foundation AI & Data 治理,MIT 授權,v2.100.0 於 2026-06-09 發布)是一個以結構化 JSON 為核心輸出的文件解析標準庫,支援 PDF、DOCX、PPTX、XLSX、HTML、EPUB、Apple Pages、影片(MP4/AVI/MOV,含 ASR 轉錄與代表性幀)、音訊(WAV/MP3)、電子郵件(EML/MSG)、ODF 與 XBRL 財報,並提供可替換階段的 pipeline 式解析(純 CPU 或 GPU 加速)、VlmPipeline 選項(GraniteDocling 258M VLM)、MCP server 與 API server(docling-serve),與 LangChain / LlamaIndex / Crew AI / Haystack 原生整合。
mattpocock/skills 單日暴漲 2,757 星,是今天 GitHub Trending 漲最快的專案;Anthropic 官方 anthropics/skills 與開源 coding agent anomalyco/opencode 同步在榜。另一頭,MCP server reverify 用 71 個真實 Windows 系統檔案的 benchmark 證明:AI 讀 binary 時有 97% 機率在瞎掰,唯有確定性工具能攔下來。框架端 pydantic-ai、agno、haystack 今天都只有例行 patch,無重大更新。
Thinking Machines Lab(Mira Murati 2025 年創立,20 億美元 seed、估值 120 億美元)2026 年 7 月以 Apache 2.0 釋出 Inkling(975B 總參數/41B 活躍、1M context、原生多模態、可控思考)與輕量版 Inkling-Small(276B/12B),搭配 Tinker 微調平台,把「可自訂」本身做成產品。
MinerU 是 OpenDataLab 的開源文件解析引擎,可將 PDF、圖像與 Office 文件轉成保留表格、公式和閱讀順序的 Markdown 與 JSON,適合 RAG 前處理與知識庫建構。
github/spec-kit 滿一年衝上 1.0.0,維護者特別強調穩定性讓位給適應力;stablyai/orca 讓你在各自 git worktree 同時跑一整支 coding agent 艦隊,單日狂漲 812 星;KeygraphHQ/shannon 3.0 上線,AI agent 自動滲透測試直接出 SARIF 報告接 CI/CD。瀏覽器端 ChromeDevTools/chrome-devtools-mcp 把官方 MCP server 開給任何 agent 操作 Chrome。框架端 Pydantic AI v2.38.0 改了一次性 capability 的合併規則(breaking),Claude Code v2.1.259 修掉多 session 互蓋設定的老問題。
NousResearch/hermes-agent 靠自我學習迴圈記住怎麼用你的工具、跨平台記得你是誰,239,994 星持續衝榜;pacifio/atlas 讓多個 coding agent 共用一套「看得到是誰改的」版本控制,一天漲 895 星;blader/humanizer 用 35 種模式把 AI 味洗掉但不竄改事實。文件處理端 firecrawl/pdf-inspector 用 Rust 在 50ms 內判斷 PDF 要不要 OCR;superlinked/sie 把 agent 會用到的所有模型收進一個自架推理叢集。框架端 AG2 v1.0.3 全面遷移 MCP 2.0(breaking change),並加入不靠 LLM 判斷的 TealTigerMiddleware 做 prompt injection 防護。
openclaw/openclaw 這款自架個人助理已經衝上 38 萬星,用單一 Gateway 串起 WhatsApp/Telegram/Slack 等聊天管道;同一週 NVIDIA 端出 SkillSpector,專門掃描 Claude Code/Codex/MCP skill 裡的 71 種漏洞模式,研究指出 26.1% 的 skill 有漏洞、5.2% 疑似惡意。另外 stablyai/orca 把多 agent 平行開發做成完整 IDE,VectifyAI/PageIndex 則用推理式樹狀索引挑戰「RAG 一定要向量資料庫」的預設。claude-code v2.1.257 新增 Containment Escape 安全規則,agno v3.0.5 把 embedding 失敗從默默吞掉改成如實回報。
HKUDS/nanobot 半年內衝上 4.7 萬星,示範「小核心+多管道+長期記憶」的自架個人 Agent;zhayujie/CowAgent(前身 chatgpt-on-wechat)用三層記憶架構和 Deep Dream 夜間蒸餾把老牌聊天機器人重生為完整 Agent Harness;conductor-oss/conductor 把耐久執行圖形引擎接上原生 MCP 工具呼叫,讓 agent 迴圈撐過當機或數週人工審核;mksglu/context-mode 直擊 MCP 工具呼叫塞爆 context window 的痛點,衝上 HN 第一。agno v3.0.4 是唯一達標的框架更新,把 KnowledgeManagementTools 的 ingest_path 改成預設關閉以堵安全缺口。
can1357/oh-my-pi 從知名 coding agent「Pi」fork 出來,靠死磕工具呼叫格式讓 Grok Code Fast 1 的任務成功率從 6.7% 衝到 68.3%;K-Dense-AI/scientific-agent-skills 把 163 個科研技能開放給任何相容 Agent Skills 標準的 agent;addyosmani/agent-skills 把資深工程師的六階段開發流程包成技能包,一週衝上 9 萬星;THU-MAIC/OpenMAIC v1.0.0 加入對話式 Pro workbench,把 multi-agent 落到課程內容產製這個具體垂直場景。框架端 agno v3.0.2 是本次唯一達標的重要更新:直接把 Agent/Team/Workflow 發布成具名 MCP tool,同時有多筆 breaking changes。
AgentHarness 核心類別、System Prompt 動態組裝流程、Skills 載入與格式化、Prompt Templates 系統、Harness 如何決定 Tool 可用性、Result Handling、Telemetry Schema 註冊、預設 Harness 建構、Extension 如何擴充 Harness。
pi-agent-core 的心臟:agentLoop() → runLoop() 雙層 while(true)。Inner loop 處理 tool calls + steering messages,Outer loop 處理 follow-up + prepareNextTurn(compaction、model switch)。Enter = steering(當前工具跑完插入)、Alt+Enter = follow-up(agent 判定結束插入)。streamAssistantResponse() 如何處理 partial message 更新、tool call 解析、parallel/sequential 執行、before/after hooks。
把 pi 當黑盒用:4 種運行模式怎麼切、Session 樹狀結構怎麼存、怎麼在對話中途換模型、Enter vs Alt+Enter 訊息插隊差異、/tree 怎麼跳回歷史分支。為後續架構篇建立直覺。
Compaction 完整機制:shouldCompact 觸發條件(token 佔比、訊息數)、estimateTokens 計算(字符/單字近似)、findCutPoint 尋找切點(保留最近 N 輪)、generateSummary 生成摘要(LLM 呼叫)、prepareCompaction 整理上下文、Branch Summary 生成、Structured Compaction(Extension 自訂 via fromHook)、CompactionEntry 細節、fromHook 機制、Compaction Settings。
Pi 為什麼不內建 Permission System、Gondolin Extension(微 VM 隔離)、Docker 整合模式、OpenShell 沙盒、Permission Model 設計哲學、三種容器化部署模式、安全邊界對比、micro-VM vs Container vs Process Isolation、Extension 如何實作沙盒。
Extension 系統完整解析:Extension 介面定義、onLoad/onUnload 生命週期、四大 Hook(onAgentStart/onBeforeToolCall/onAfterToolCall/onTurnEnd)、五大擴充點(tools/commands/keybindings/ui/settings)、ExtensionRunner 載入順序與依賴解析、ExtensionAPI 提供的能力、Dynamic Border、Widget、Dialog、Selector 等 UI 元件、Extension 間通訊、熱重載機制、官方範例 Extensions。
pi-ai Model Catalog 自動生成流程、Provider Factory 註冊與 Lazy Loading、OAuth 2.0 + PKCE 流程實作、Credential Store(Keychain/Libsecret/Credential Manager/加密檔案)、Credential Sync 跨裝置同步機制、Model Scope Diagnostics、ModelResolver 解析邏輯、CredentialSynchronizationOperation 狀態機。
從使用者可見功能切入架構:7 個 npm 套件各司其職、依賴圖單向流向、為什麼 pi-tui/pi-telemetry 零依賴、pi-ai 如何隔離 provider 細節、lockstep versioning 怎麼避免 diamond dependency。建立「從外往內」的架構心智模型。
pi-ai 是 pi-mono 的反腐層:上層只見 Message/Tool/Context/streamFunction,下層 15+ providers 各自實作細節。本文拆解:統一介面設計、Provider Factory Registry、Lazy Loading 實現 Tree-shaking、Model Catalog 自動生成流程、OAuth/API Key 統一管理、Credential Sync 機制、Thinking/Reasoning 參數標準化。
Release 完整流程:Lockstep Versioning(所有套件同版本)、CHANGELOG 更新、Local Smoke Test 驗證、Release Script 自動化、Binary Build (Bun + Node)、npm-shrinkwrap.json 鎖死傳遞依賴、GitHub Actions OIDC Trusted Publishing、R2 Release Marker 驗證、pi.dev/api/latest-version 公告、Announcement Verification 確保發佈成功。
pi-protocol JSON-RPC 2.0 定義、pi-client 連線管理與重連指數退避、pi-server Session Registry、WebSocket Transport、心跳機制、Session Snapshot、Remote Session Handle、RPC 模式架構、流式事件傳輸、Steering/Follow-up 遠端插隊。
本系列 17 篇帶你從 CLI 使用者角度切入,逐層深入 pi-mono 的 Agent Loop、Session Tree、Tool System、Extension System、TUI 架構、Remote Session、Telemetry、Compaction、Release 流程等核心機制。適合想自架 Agent、研究 Agent 架構、或想貢獻 pi 的開發者。
SessionManager 核心:JSONL append-only 儲存、id/parentId 形成樹、branch() 移動 leaf pointer 不改歷史、buildSessionContext() 處理 compaction entry、createBranchedSession() fork 新檔案。完整 Entry 類型:message、thinking_level_change、model_change、compaction、branch_summary、custom、custom_message、label、session_info。Migration v1→v2→v3 細節。
pi-telemetry 核心:TelemetrySchema 定義 Span/Event/Attribute、defineTelemetrySchema 建立 TypedSpanStarter、InMemoryTelemetryContext/NOOP_TELEMETRY_CONTEXT 零開銷實作、Conformance Tests 驗證 Adapter 正確性、AI/Harness Telemetry Schema 完整定義、屬性類型系統、為什麼不直接用 OpenTelemetry。
測試策略:Faux Provider(無 API Key 跑 e2e)、Vitest 單元測試、Browser Smoke Test(真實瀏覽器驗證)、Biome Lint/Format、tsgo Type Check、Pinned Dependencies、Shrinkwrap 生成、Install Lock、npm Trusted Publishing、CI Pipeline 完整流程。
pi-coding-agent 8 核心工具完整解析:ToolDefinition(給 LLM 看)vs AgentTool(執行邏輯)、createToolDefinition/createTool Factory、executionMode 決定 parallel/sequential、beforeToolCall/afterToolCall 攔截鏈、withFileMutationQueue 序列化檔案寫入、truncateHead/Line/Tail 輸出截斷、read/write/edit/bash/grep/find/ls/powershell 各工具實作細節。
pi-tui 核心完整解析:Virtual DOM Diff 算法實現無閃爍渲染、Component 生命週期、Layout Engine(Flex-like VStack/HStack/Box)、CSI 2026 同步輸出避免 partial frame tearing、Keybindings Manager、Alt Screen 管理、括號貼上模式、Kitty/iTerm2 圖片協定、Markdown/Editor/Selector/Diff 等內建元件。
我在寫自己的 Python coding agent「looplane」,這個系列把 pi、oh-my-pi、opencode、codex、claude-code 五個成熟專案的原始碼逐題對照,也對照 Looplane 現在已經落地的 TUI、外部 CLI runtime、local gateway、usage/OTel/session 工具與 Cloudflare 切片。每篇固定走「設計問題→五家做法→looplane 選擇→學術依據→改善路線」五段,證據一律給到 file#symbol 層級。
Google 官方的 ChromeDevTools/chrome-devtools-mcp(5 萬星)讓 coding agent 直接操控真實 Chrome 做效能分析與除錯;abhigyanpatwari/GitNexus 用純瀏覽器端知識圖譜取代「讀程式碼靠猜」;mksglu/context-mode 專攻 coding agent 的 context window 浪費問題;google/skills 是 Google 自家的官方 Agent Skills 套件庫;livekit/agents 語音 agent 框架持續活躍。框架端 pydantic-ai v2.36.0 加入 `@durable_operation`,讓第三方 durable execution 引擎可插拔進來。
screenshot-to-code 不是一步到位的截圖轉碼工具。核心是一個最多 30 步的 Agent Loop,搭配 7 個工具——從截圖裁切真實素材、用 Playwright 自我驗證、到同時跑 4 個模型讓使用者選最好的版本。GitHub 74,500+ stars,MIT License。
calesthio/OpenMontage 用 12 條產線、700+ 個 skill 檔把通用 coding agent 變成影片後製棚,本週衝上 5 萬星;Anthropic 官方外掛市集 claude-plugins-official 單日 +292 星;rohitg00/agentmemory 用 BM25+向量+知識圖譜做 coding agent 跨 session 記憶,自家 benchmark 宣稱 LongMemEval-S R@5 95.2%;sodiumsun/agenttrail 幫 Claude Code / Codex / Cursor 做本機即時任務地圖。今日框架端無重大 release。
thedotmack/claude-mem 用壓縮記憶讓 context 跨 session 存活,總星數破 9 萬;volcengine/OpenViking 把記憶/RAG/skills 統一成用 viking:// 協定瀏覽的虛擬檔案系統,本週 +3,078 星;apache/maka 進 Apache Incubator,把 agent 執行過程做成可回放的 event-sourcing log;K-Dense-AI/scientific-agent-skills 讓 17.5 萬科學家用 163 個 skill 把通用 coding agent 變成領域專家。Haystack v3.1.0 加入 AgentTool 支援多 agent 委派。
deepseek-ai/deepseek-harness(dsh)用 Cordis 外掛架構把「模型/工具/沙箱/記憶」全部做成可替換元件,developer preview 上線一週已逼近 20 萬星;PrimeIntellect-ai/prime-agent 用 Recursive Language Model 架構做長跑研究型 coding agent,靠持久 IPython session 撐過終端機斷線;liqiwa/mcp-radar 反過來做這類 digest 的自動化版本,每天掃 GitHub 排名新出現的 MCP server。框架端 Mastra 1.61.0 補上可撐過當機的背景任務佇列,ComposioHQ/composio 0.17.0 把 SSRF 防護延伸到工具執行下載與 S3 上傳。
每個模型發布都帶 benchmark 數字,但同一個模型在不同 harness 上可以差 20 分、SWE-bench Verified 的 32% 驗證器判斷有誤、DeepSWE 113 題讓多數模型掛零。這篇拆解六個主要 coding benchmark 各自測什麼、哪些容易灌水、讀者該看哪個。
2026 年幾乎所有前沿開源模型都是 MoE 架構:Ornith 35B 只啟用 3B 打贏 31B dense、MiniMax M3 用 456B 總量但 45.9B 啟用拿下 SWE-bench Pro 59%、DeepSeek V4 用 1.6T 總量但 49B 啟用。這篇用四個案例解釋 MoE 為什麼在 coding 和 agentic 任務上佔據主流。
Allen AI 的 OLMo 是目前唯一把權重、訓練資料(Dolma,9.3 兆 token)、訓練程式碼、所有中間 checkpoint 和評估工具全部公開的語言模型家族。OLMo 3 的 32B Think 模型在 MATH 跑到 96.1%,同時你可以用 OlmoTrace 追溯任何輸出回到訓練資料的哪一段。
AI 的「開源」不等於軟體的開源。MIT 和 Apache 2.0 真的隨便用;Llama License 超過 7 億月活要另外談;舊版 Gemma 授權 Google 可以片面修改(Gemma 4 已改 Apache 2.0)。這篇按授權類型整理你能做什麼、不能做什麼。
2026 年三個非大廠團隊用不同的 RL 後訓練路線做出 benchmark 黑馬:Ornith 讓模型自己出題自己改進(GRPO self-improvement loop),Nous Research 用 DataForge 合成資料 + Atropos 執行獎勵 RL,MiniMax 在 20 萬個真實環境裡大規模 RL。三條路各有強項,但共同證明了一件事:後訓練 RL 比預訓練規模更重要。
tinyhumansai/openhuman 用本地優先的 Memory Tree 壓縮數位生活、指揮多個 agent,早期 beta 已衝上 3.7 萬星;Vercel Labs 的 fx 用 Zig 寫出不到 8 MiB 的原生 coding agent CLI;NVIDIA 開源 labs-OO-Agents,把 agent 的 prompt/tool/workflow 收進單一 Python class;CopilotKit/OpenBot 把 agent 包進容器並加上治理閘門,動作先審後動。Agno v3.0.0 是需要跑資料庫遷移的重大 breaking release,Haystack v3.1.0 新增多 agent 委派工具 AgentTool 和上下文壓縮 CompactionHook。
MiniMax 從消費級聊天 App 起家,M2.5 在 SWE-bench Verified 拿 80.2% 但 API 價格只有 Claude Opus 的 1/10-1/20;M3(456B 總量 / 45.9B 啟用)是首個在 SWE-bench Pro 突破 59% 的開源權重模型,還有 1M context。
Nous Research 不預訓練,只做 fine-tuning 和 RL——Hermes 4 在 MATH-500 拿 96.3%,NousCoder-14B 只用 24K 樣本就把 Qwen3-14B 的 coding 能力拉高 7%。但真正的護城河是 Hermes Agent 框架:236K GitHub stars,全球第 19 名,3,000 位貢獻者。
DeepReinforce 用 self-improvement RL 訓練的 Ornith 1.5 家族:397B 旗艦在 SWE-bench Verified 拿 86.0 追平 Claude Opus 4.8,35B-A3B 每 token 只啟用 3B 參數卻在同量級 coding benchmark 全面領先,9B 版本可以跑在手機上。MIT 授權、完全開源。
Panniantong/Agent-Reach 用一支 CLI 包住 yt-dlp、twitter-cli 等工具,讓 agent 讀遍 Twitter/Reddit/YouTube/Bilibili;LangChain 官方推出 deepagents,把檔案系統、sub-agent、skills 打包成開箱即用的 harness;Tracer-Cloud/opensre 把「AI SRE agent」做成有評分 RCA 題庫的框架;Anthropic 的 claude-plugins-community 市集靠審核流程幫社群外掛做信任背書,單日 +490 星。GitHub Copilot CLI v1.0.81-8(pre-release)加上 Grok 4.6 xhigh 推理與外掛即時熱重載。
Stanford Marin 在 11×GB200 上公開訓練 535B-A23B,先用 1% 算力的 5 階 Scaling Ladder 預註冊 paloma macro-loss 2.04,再以 W&B 即時公開 847 組訓練數據;本文按訓練流程拆解其設計與監控方法。
duty1g/x64dbg-mcp-server 把逆向工程除錯器包成 MCP 工具,兩天衝上 563 星;Cripacx/mediagen 把歐盟 AI 法案要求的內容標記做進生圖 MCP server;QwenLM/qwen-code v0.22.0 公開 SWE-bench Verified 完整測試軌跡,77.08% 過關;open-gitagent/gitagent 把核心引擎搬到 Rust 重寫,agent 狀態整個活在 git repo 裡。框架端,GitHub 官方 MCP Server v1.10.0 是一次資安大掃除,`--tools` 打錯名稱現在會直接讓 server 啟動失敗。
DeepSeek 用 MLA + MoE 兩項架構創新把推論成本壓到業界最低,V4 Flash 以 13B 活躍參數跑出接近前端模型的品質,成為 OpenRouter 用量第一。這篇追蹤從 V1 到 V4 的演化、R1 推理線的分叉、以及每個版本該怎麼選。
GLM 是智譜 AI(Z.ai)推出的開源 LLM 家族,源自清華大學 KEG 實驗室。GLM-5.3(2026/08)在 coding benchmark 比前代提升 50%,CyberGym 84.5% 超過 Anthropic Mythos 5 與 OpenAI GPT-5.6 Sol,在 Artificial Analysis Intelligence Index 得分 60 與 Kimi K3 並列開源第一。它是目前唯一完全在華為昇騰晶片上訓練出的前沿開源模型。
Grok 是 xAI 的 LLM 家族,2023/07 成立、2024/03 以 314B MoE Apache 2.0 開源起手,兩年半迭代到 Grok 4.6(500K、$2/$6、四檔推理)與 2M 的 Grok 4 Fast;另有 Imagine 圖像/影片與 Grok Build 終端 coding agent——護城河在分發(X / grok.com / Tesla / Bedrock),而非單點模型能力。這篇追蹤 Grok 1→4.6 的演化、子線定位、定價與授權陷阱。
Kimi 是月之暗面(Moonshot AI)推出的 LLM 家族,以超長 context 起家。2026 年 7 月發布的 Kimi K3 是全球首個開源 3T 級模型——2.8T 參數、104B 活躍、1M context,在 Artificial Analysis Intelligence Index 得分 60 與 GLM-5.3 並列開源第一。其 Kimi Delta Attention 架構帶來 2.5 倍 scaling 效率提升。
Llama 是 Meta 推出的開源 LLM 家族,以企業部署量最大、生態最成熟聞名。Llama 4 Scout(10M context)和 Maverick(17B active / 400B total MoE)是目前的開源多模態標竿,但 Meta 已在 2026 年 4 月轉向閉源 Muse Spark——Llama 4 很可能是最後一個主要的開源 Llama,且授權不是真正的開源(Llama 4 Community License,月活超 7 億需另外授權)。
Mistral 是歐洲最成功的 AI 新創,以「更小、更快、更便宜」的策略和歐洲資料主權定位在 AI 市場殺出血路。Mistral Large 3 是歐洲最強的商用 LLM,Small 4 是 24B 級別的效率之王,Medium 3.5 則是專為 agentic coding 優化的 Modified MIT 開源模型。它的護城河不是技術規模,而是「歐洲合規」這張牌。
Qwen 是 HuggingFace 下載量最高的模型家族,尺寸從 0.8B 一路涵蓋到 2.4T。2026 年 8 月阿里首度開源 Max 級旗艦權重(Qwen3.8-2.4T-A95B),但授權換成了自訂條款而非慣例的 Apache 2.0;同期開源、筆電就能跑的原生視覺模型 Qwen3.8-27B 反而是新面孔裡唯一的 Apache 2.0。這篇追蹤 Qwen 從 2023 年到 3.8 世代的演化、開源線與商用線的分家邏輯,以及每一層該怎麼選。
2026 年 AI 模型按用途分成七大類、20+ 個子用途。這篇是「AI 模型家族」系列的導讀地圖——從用途找模型、從模型找家族,附每個用途的選型建議和最新排名。
CopilotKit/OpenBot 用 AG-UI 協定包出「每個都有自己電腦」的 AI coworker 框架,一週衝上 2,289 星;Bruno 官方 MCP server(usebruno/bruno-mcp)比社群版(Ostico/bruno-mcp-studio)晚兩個月才補上;browser-use 團隊另開 macOS Harness 專案,用六個 accessibility 原語讓 LLM 直接操控 Mac;搬到 Anomaly 底下的 opencode 星數(約 19.9 萬)已經超過 Anthropic 自家 Claude Code(約 14.2 萬)。框架端,MCP TypeScript SDK v2 把單一套件拆成 8 個子套件,並跟進協定的 stateless 改版,拿掉了 session handshake。
2026 年 8 月,不只五個框架在動。OMP 2、Pi v2、Opencode 2、dsh、Claude Code 之外,Google(Antigravity CLI)、Meta(Muse Code)、xAI(Grok Build)三家模型商直接下場做 coding agent,加上 Amp、Cline 2.0、Codex CLI Rust 重寫,共八個以上框架同時有架構級變動。再算進 110+ 個 CLI 工具,H2 2026 是 harness 方法論的分裂期。本文從四條架構路線、一個共同方向、一場信任危機拆解。
Helicone 是開放原始碼的 LLM Gateway 與觀測平台:請求經過相容端點後,自動留下模型、延遲、token、成本與自訂欄位;它也能用 managed credits 或 BYOK 路由與 fallback。
火山引擎開源 OpenViking 把 agent 的記憶、知識、技能存成 viking:// 虛擬檔案系統,用 ls、tree、find 就能翻。三層載入(L0/L1/L2)讓平均檢索只用 550 tokens,LoCoMo 記憶準確率從 24–57% 提升到 80–83%。
Steel 用 Apache-2.0 runtime 把 Chromium session、CDP、proxy、stealth 與除錯介面包成同一套 browser API;公開 repo 約 7,400 stars,並在 2026 年進入 Stripe Projects developer preview。單機自架適合開發與資料邊界,Cloud 才解決高併發、託管 proxy、CAPTCHA、錄影與 SLA。
HKUDS/nanobot 靠 v0.3.0「The Agency Release」7 個月衝上 4.7 萬星,主打個人自架 agent runtime;genspark-ai/genoffice 用開源桌面應用做 AI 辦公套件,三週破 3,400 星;NVIDIA 發表 labs-OO-Agents(NOOA),把 agent 狀態收進單一 Python class;MCP server repo-context-mcp 幫 coding agent 讀 repo 不用整包塞進 prompt。框架端 Mastra 1.60.0 補上 durable execution 與 Cloudflare Sandbox;pydantic-ai v2.33.0 因 anthropic SDK 升級 httpx2 而有 breaking change。
DeepSeek Harness(dsh)是 DeepSeek 官方的開源 coding agent 框架,2026-08-13 發布 v0.1 開發者預覽版,9 天內累積 184,000+ 星。核心是 Cordis plugin kernel——模型、工具、agent loop、UI 全部都是可抽換的外掛。四種 runtime 模式,能把 Claude Code 和 Codex 當子代理使用。Web UI 優先,目前沒有原生 CLI。
OMP 2 不再是 Pi 的 fork。整個 codebase 用 Rust 從零重寫,約 41 個 crate 涵蓋自製 bash 引擎、GPU 加速 GUI、嵌入式 CPython 3.14t、gRPC transport 與 Kokoro-82M TTS。目前 pre-release,尚未正式發行。
Opencode 2 是 Anomaly(Dax Raad)主導的大重寫。runtime 從 Bun 換成 Node.js(記憶體問題)、桌面從 Tauri 換成 Electron(WebKit 效能與 Node 整合)、v1 API 刻意不相容。新增多分頁並行 session、持久化後端服務、HTTP API + SDK。目前 beta,預估 2026 年 9 月 stable。約 200K stars。
Pi v0.84.0(2026-08-06)把 AgentHarness v2 API 升為 stable。Lane-based v4 Session model 讓操作可持久化、可中斷。CBOR 取代 JSON,Unix socket 取代 HTTP。背後的 Earendil Inc.(Armin Ronacher 的 PBC)拿到首輪資金。95.4K stars,still MIT,still 極簡。
Tavily 和 Exa 都是純雲端 API,不能自己架。能自己組的是 SearXNG(269 個上游引擎、82 個預設開啟)+ Crawl4AI(78.8k stars、Apache-2.0),現成的 Tavily 相容 wrapper 都還是幾十顆星的個人專案,不建議直接用。但 SearXNG 沒有自己的索引,而且從機房 IP 跑會被搜尋引擎打成空結果——這兩件事決定了自架划不划算。
Cursor 開源官方外掛市集 cursor/plugins,用 plugin.json + skills + MCP 定義把生態標準化,一天 +470 星;apache/maka 進 Apache 孵化器,用 append-only 事件日誌記錄 agent 的每次工具呼叫與權限決策,主打可稽核的 local-first 工作台;magnitudedev/magnitude 幫你自動偵測硬體、下載並在本機跑模型,開箱即用的離線 agent;vercel/eve 把 agent 能力放進 tools/、skills/、schedules/ 等慣例目錄,檔案系統就是介面。框架端 pydantic-ai 補了 v2.32.1 patch。
Supabase 不只是 Firebase 的開源替代,它的核心設計是把 Auth、Storage、Realtime 全部建在 PostgreSQL 的 schema 和 WAL 上。結果是:你可以用一條 SQL 查所有東西,pgvector 直接用,agent 寫 SQL 就能操作整個平台。108k GitHub stars、Apache 2.0 授權、Free 方案 500 MB 資料庫。
Volcengine(字節跳動旗下)開源 OpenViking,用 viking:// 虛擬檔案系統取代黑盒向量搜尋做 Agent 記憶,官方測試把準確率拉到 80%+ 同時省 34–91% token;munder-difflin 把多個 coding CLI 包成桌面辦公室、用共享記憶層互相協作;ai-memory 用 Rust MCP server 解決『換 CLI 就失憶』的痛點;mukul975 的資安技能包一天內衝到近 2.8 萬星。pydantic-ai v2.32.0 補強 OpenRouter/xAI 附件搜尋與 instrumentation。
DeepSeek 開源的 agent harness「dsh」8/13 發布一小時內破 2 萬星,目前累積約 15.8 萬星,社群兩天湧入 2000+ 外掛提案;核心是 Cordis 驅動的「一切皆插件」架構,甚至能把 Claude Code、Codex 當子 agent 呼叫。RightNow-AI 用 Rust 從 OS 層級重新定義 agent(openfang),網易有道推出建立在 OpenClaw 之上的桌面 Agent LobsterAI,PrimeIntellect 的 prime-agent 主打自我改進推理迴路。CrewAI 1.15.16 補強 execution context 追蹤與 flow 錯誤記錄。
Aider 是 2023 年就存在的終端 AI pair programmer(Python、Apache-2.0、約 48.3k stars),設計上跟現在的自主 agent 走反方向:手動 /add 檔案控制 context、每次修改自動產生一個 atomic git commit、architect/editor 雙模型分工。但要注意維護節奏:最後一版 PyPI 發布是 2026-02 的 0.86.2,最後一筆 commit 在 2026-05,官網仍推薦 Claude 3.7 Sonnet 與 o1。
omp 是 Pi 的 fork,但不只是插件層堆疊:它多了約 80,000 行 Rust,把 grep/shell/AST/PTY 全部搬進 in-process。內建工具從 Pi 的 7 個變成 31 個,外加 14 個 LSP op、28 個 DAP op、60+ 供應商。同一份 codebase,兩個相反的賭注。
OpenClaw 386k star、Hermes Agent 232k,但 OpenRouter 上 Hermes 的日 token 量在 2026-05-10 就反超了(224B vs 186B)。這半年冒出來的九個自架 agent 不是九個競品,是對同一題的九種答案:agent 的執行邊界該畫在哪。CVE-2026-44112 打穿的是 OpenClaw 的沙箱本身,而 Meta 對齊主管那次刪信事故裡連攻擊者都沒有——安全指令是被 context 壓縮吃掉的。
headroom 把送進 LLM 前的 tool output/log/RAG chunk 先做本地、內容感知的壓縮,7 個月衝上 6.6 萬星;agentmemory 讓 Claude Code、Cursor、Codex CLI 等十幾種 coding agent 共用同一份跨會話記憶,半年衝上 2.7 萬星;Andrew Ng 團隊的桌面 agent OpenWorker 把目標使用者從工程師擴大到一般知識工作者;NVIDIA 的 labs-OO-Agents 用物件導向重新設計 agent 抽象。Mastra 1.59.0 把 CostGuardProcessor 更名 TokenCostControl(breaking),browser-use 0.13.8 加入第一方 OpenClaw skill 支援。
forge 給自架 LLM 的 tool-calling 加一層可靠性 middleware,可直接代理 opencode/aider/Claude Code 免改程式;repo-context-mcp 用 MCP 提供 token 預算化的 repo context 打包,上線 5 天就做進 PR CI;DeepSeek 官方 harness dsh 一週內冒出至少 5 個獨立社群桌面包裝版,合計逼近 1,500 星;微軟研究院的瀏覽器 agent 框架 Webwright 靠 Skill Factory 把解過的任務蒸餾成免模型呼叫的可重跑腳本,在 WebArena 上拉高 15 個百分點的重用準確率;Mastra 1.59.0 把 CostGuardProcessor 更名 TokenCostControl(breaking),Pydantic AI v2.30.0 修了本機 web chat 介面的 DNS rebinding 資安漏洞。
微軟員工開源的 VS Code extension,讀本機 Claude Code / Codex / OpenCode 的 session log。真正的內容物是 45 條 Markdown 規則:prompt 短於 30 字元、收到 20 行 AI 程式碼後 15 秒內就送下一則、instructions 檔超過 4000 bytes——把「context engineering」翻成可以爭論的數字。
用 4 份台大碩班掃描考古題實測 10 種開源 PDF 解析工具。VLM 類(Firecrawl、MinerU 3.4、Marker v2)在公式和程式碼上全面碾壓傳統 OCR,但安裝踩坑才是真正的門檻——MinerU 舊包名會進依賴地獄、Marker 首次模型下載要 10 分鐘、PaddleOCR 缺引擎。實務推薦兩階段策略:RapidOCR 粗篩 + MinerU/Firecrawl 精查。
Vercel 推出 filesystem-first 的 TypeScript agent 框架 eve,深度綁定自家 AI Gateway/Sandboxes;Prime Intellect 的 Prime Agent 把整個對話 context 當程式變數,搭配可自我改寫的 Continual Harness;aden-hive 的 Hive 用『複製 Queen』取代預先編譯的執行圖;HKUDS 的 nanobot 靠 v0.3.0 Agency Release 半年內衝上 4.7 萬星。今日 watchlist 框架無重大版號更新。
2026-08-13 的發布新增 363,246 行,首次公開 For You 的排序權重:favorite 0.5、reply 5.0、report −234.0。但權重是常數,真正決定順序的 P(action) 來自一個 2560 維、8 層的 transformer。
把兩套都 clone 下來各 build 一次之後,有三件事跟原本的認知不一樣:ArduPilot 的 EKF3 檔頭直接寫著推導來自 PX4/ecl,兩套在最難的那一層是同源的;PX4 近一年的提交來自公司網域(Auterion 一家 380 筆),ArduPilot 來自個人信箱且一個人佔 37%;而真正決定選哪個的不是效能,是 BSD-3 vs GPLv3 與你要改的是哪一層。
Firecrawl 開源的 Rust 轉檔函式庫,14 種辦公格式(含 .doc / .ppt / .xls 老格式)統一轉 GFM,中位耗時 4.7ms,同樣計時條件下比 Docling 快 109 倍。代價是完全不碰 OCR。
掃描件與複雜版面只能靠模型推斷結構。但 MinerU、Marker、Docling 的技術差距遠小於授權差距——MinerU 過 $20M 月營收要另談授權、Marker 的模型權重過門檻要付費、只有 Docling 是乾淨的 MIT。選型先看 LICENSE,再看 benchmark。
把文件餵給 LLM 之前,最常見的錯誤不是選錯工具,是選錯層。結構已經在檔案裡的用轉換層(毫秒級),有文字沒結構的用抽取層,連文字都要推斷的才用解析層——anydoc 的 4.7ms 到 Docling 的 513.6ms 差 109 倍,多數人卻直接跳最貴的那層。
數位原生 PDF 的文字是讀得到的,缺的只是結構。PyMuPDF、pdfplumber、pypdf、Tika 這一層用啟發式規則就能還原段落與表格,零 GPU、零推論成本。最大的選型陷阱不是準確度,是 PyMuPDF 的 AGPL-3.0 授權。
Koboyo 宣稱有近 9 萬個免費手繪 SVG(數字上下跳動:92,967 → 87,954 → 90,150),但 sitemap 只列得出約 17,930 個圖示頁,而且授權頁明文禁止拿去做圖示庫或畫布 app。想要手繪感其實有三條路:收圖庫、用程式把既有幾何弄歪(sketchyicons 把 Lucide 的每條直線轉成二次貝茲,用 icon 名稱當亂數種子確保 byte-for-byte 一致)、或 AI 生成。這篇比較七家圖庫的規模與授權、拆解 sketchyicons 與 tldraw 的生成演算法,並整理正在往 MCP 靠的圖示搜尋工具。
從 MarkItDown (175k stars, MIT) 到 curl_cffi (6k stars),整理 34 個「爬資料餵 AI」的開源工具。沿五條軸線分類:整站爬取、AI 瀏覽器代理、文件轉檔、智慧擷取、反偵測基建。選型關鍵不是哪個最好,是場景匹配。
HeyGen 開源的 HyperFrames 用 HTML data 屬性定義影片時間軸,headless Chrome 逐幀 seek 截圖再由 FFmpeg 編碼成 MP4。3 個月 33k stars,Apache 2.0,21 個 agent skills——AI agent 寫 HTML 就能產影片,不需要 React。
從 CLI 工具 kin3o 到 CVPR 2026 論文 OmniLottie,盤點把文字和圖片轉成 Lottie 動畫的開源路徑,附效能基準與選型建議。
AI agent 跑測試不可重現、手寫 Playwright 難維護——2024-2025 年出現四套工具各自解決這個兩難,設計哲學差異很大。
Anthropic 2026-04-17 發 Claude Design,4-28 nexu-io/open-design 公開,同樣的 artifact-first loop、Apache-2.0、跑在你已經有的 16 個 coding-agent CLI 上。兩週從 0.1 到 0.7、40k+ stars。把 AI 設計工具從 vertical SaaS 攤平成 skill bundle 的範式轉移。
asgeirtj/system_prompts_leaks 蒐集 40 多個 AI 助理的 system prompt 原文,從 GPT-5.5、Claude Opus 4.7 到 Gemini 3.1 Pro 都有,40.3k stars、461 commits、MIT 授權。價值不在於拿到秘密,而在於把廠商的隱性政策變成可比對的工程素材——要學的是設計決定,不是文字本身。
Warp 從一個用 Rust 打造的現代終端機,演化成整合 AI Agent 的開發環境(ADE),2026 年 4 月開源,目前擁有 70 萬開發者使用者。
goose 是由 Linux Foundation 旗下 AAIF 維護的開源 AI Agent,支援 15+ LLM 供應商、70+ MCP 擴充,用 Rust 打造桌面 App + CLI + API,定位是不鎖廠商、可自架的 Claude Code 替代方案。
AEO/GEO 工具不是單一類別,而是三個面向:輸入面(網站有沒有準備好給 AI 讀)、流量面(AI bot 實際爬了多少)、輸出面(品牌在答案裡怎麼被提到)。這篇把三面向、從開源自架到商業 SaaS 的工具一次攤開。
DeerFlow 是字節跳動開源的 Super Agent Harness,基於 Python 3.12 + LangGraph,透過沙箱、長期記憶、子代理、技能與訊息閘道協調長時任務。2026 年 2 月登上 GitHub 趨勢榜第一,目前超過 63,000 星,支援 Telegram/Slack/飛書等 IM、Claude Code 整合與多種搜尋後端。
Vercel Labs 開源的 coding agent 參考實作。三層架構分離 web UI、agent workflow、sandbox VM,設計給想自建 Claude Code / Cursor Background Agent 的團隊當起手。
Claw Code 是用 Rust 從零重寫的 Claude Code CLI 替代品,48K 行程式碼、40 個工具、MIT 授權。最驚人的是整個專案在 5 天內由多個 AI Agent 協作完成,上線不到一週就突破 170K stars。
香港大學 HKUDS 開源的 Agent Harness 框架,實作了工具呼叫、技能載入、記憶、權限、多代理協作等完整基礎設施,支援 Anthropic / OpenAI / GitHub Copilot 三種 API 格式。
OpenCode 是免費開源的 TypeScript CLI agent(MIT,約 198K GitHub stars),支援 75+ 模型供應商含本地 Ollama,可用 Copilot/ChatGPT 帳號認證,session 中途切換模型不丟上下文。另有桌面版與官方 Zen gateway。
2026 Q1 開源模型全面爆發:LLM 方面 GLM-5、Kimi K2.5、Qwen3.5 追上閉源;Embedding 和 Reranker 由 Qwen3 和 BGE 主導;語音有 Voxtral TTS 和 Whisper V3;圖像有 FLUX.2;影片有 Wan 2.2 追平 Sora。這篇是完整導覽地圖。
Codex CLI 是 OpenAI 的開源終端機 coding agent(Rust,Apache-2.0,約 106.6k stars),支援 MCP、subagents、圖片輸入、code review、Skills。模型主線已換成 GPT-5.6 Sol / Terra / Luna,桌面版、CLI 與 IDE 擴充共用一份 config.toml。
Gemini CLI 是 Google 開源的終端機 AI agent(Apache 2.0,~106.6k stars),曾提供每分鐘 60 次、每天 1,000 次的免費額度含 1M context。個人方案已於 2026/6/18 停止服務,接替者是 Antigravity CLI。專案本身沒關閉,repo 仍在維護,但只服務 Gemini Code Assist Standard/Enterprise 授權與付費 API key。
OpenCode 是用 TypeScript 打造的開源 AI coding agent(MIT,約 198K GitHub stars,repo 在 anomalyco/opencode),內建 TUI、支援 75+ LLM、LSP 整合、Vim 風格編輯器、SQLite session 管理,另有桌面版。免費、不需訂閱,可接本地或雲端模型。
Pi 是 Mario Zechner 打造的極簡 coding agent(TypeScript、MIT、約 93K stars),只有 4 個核心工具與極短 system prompt,其餘全靠 Extensions/Skills/Prompt Templates 自己疊。刻意不做 MCP、sub-agents、plan mode、權限彈窗。repo 已改名 earendil-works/pi,npm scope 換成 @earendil-works。