Skip to content

AI Agent GitHub Digest — 2026-09-30

2026年9月30日1 分鐘
TL;DRpaperclip(94.5k★)把 agent 當員工管,建組織圖、發預算、留稽核紀錄;Orca(81.6k★)讓你在各自的 git worktree 同時跑一整排 coding agent;Hindsight(42.8k★)把 agent 記憶拆成四層,從「記得」進化到「學會」;CLI-Anything(51k★)把任何軟體包成 agent 能穩定呼叫的 CLI;Cloudflare 開源自己拿來稽核程式碼的 security-audit-skill(23.2k★),靠「發現與驗證分屬兩個 agent」壓低誤判。crewAI 1.15.23 加入原生 Gemini 3.8 Flash 支援,Claude Code v2.1.285 則替背景長跑指令加上預設逾時。

🌏 English version

今日亮點

這週上升的五個 repo,沒有一個在推新的 agent 框架,全部圍著「你已經有一堆 agent,現在要怎麼管」打轉——Paperclip 給 agent 建組織圖和預算,Orca 讓你同時盯著一整排平行跑的 coding agent,Hindsight 給 agent 分層記憶,CLI-Anything 讓 agent 能穩定呼叫任何既有軟體,Cloudflare 的 security-audit-skill 則負責在事後稽核 agent 產出的程式碼。當 agent 的數量從一個變成一群,管理問題明顯比「這個 agent 夠不夠聰明」更早浮上檯面。

paperclip ⭐ 94.5k

GitHub · TypeScript/Node.js · MIT

  • 是什麼:把一群 AI agent 當「員工」管理的開源後台——組織圖、任務指派、預算、審批流程都有,作者的說法是「如果 OpenClaw 是員工,Paperclip 就是公司」。
  • 為什麼值得看:不是又一個 agent 框架,而是專門處理「agent 一多,沒地方管」這個問題:agent 有職稱、有上下線、有預算上限(花完自動停)、有 heartbeat(排程叫醒去檢查工作),所有異動都留稽核紀錄。刻意不做的事也講得很清楚——不是聊天機器人、不是 workflow builder、不管你怎麼寫 agent,只管一群 agent 怎麼被組織起來做事。
  • tech stack:Node.js 伺服器 + React UI + 內嵌 PostgreSQL
  • 上手難度:低——bash install.sh 或 npx paperclipai onboard 就能起一個本地測試環境,正式接多組織、多 agent 治理則需要花時間熟悉設定項目。

Orca ⭐ 81.6k

GitHub · TypeScript · MIT

  • 是什麼:一個「ADE」(agent development environment)桌面 app,讓你在各自獨立的 git worktree 裡同時跑一整排 coding agent(Claude Code、Codex、Cursor、Grok 等),一個畫面盯著全部進度。
  • 為什麼值得看:同一句 prompt 可以同時發給好幾個 agent 在各自 worktree 裡做,再比較結果合併贏家;手機版能遠端收通知、下 follow-up;還內建 Design Mode(點 UI 元素直接把 HTML/CSS/截圖丟進 prompt)和 SSH worktree(跑在自己的遠端機器上)。用的是你已經有的 Claude Code/Codex 訂閱,不是另收一份訂閱費。
  • tech stack:Electron 桌面殼 + WebGL 終端機渲染 + CLI(orca worktree create 等)
  • 上手難度:中——桌面版一鍵裝,但要發揮「平行 agent」的完整價值,得先想清楚怎麼切 worktree、怎麼分工。

Hindsight ⭐ 42.8k

GitHub · Python · MIT

  • 是什麼:不是單純記對話紀錄的 RAG 或知識圖譜,而是把每次互動拆成 world facts/experiences/observations/mental models 四層,讓 agent 從「記得」進化到「學會」。
  • 為什麼值得看:內建 retain/recall/reflect 三個操作,recall 同時跑語意、關鍵字、圖譜、時間四種檢索再做 rerank;宣稱在 LongMemEval 上拿到 SOTA,且有 Virginia Tech 與 The Washington Post 獨立覆現的成績。60+ 整合含 Claude Code、LangGraph、CrewAI 等,幾乎每個主流 agent 框架都能直接接上。
  • tech stack:Python + PostgreSQL/pgvector(或 Oracle AI Database)+ 內建 MCP server
  • 上手難度:中——docker run 就能跑本地伺服器,但要接超過一種 LLM provider、想用進階功能(disposition traits、memory defense)時設定項目不少。

CLI-Anything ⭐ 51k

GitHub · Python · Apache-2.0

  • 是什麼:把「本來只給人用的軟體」自動包成一層 CLI,讓 AI agent 能穩定呼叫——不用每個工具都手寫一套整合膠水。
  • 為什麼值得看:出自香港大學資料科學實驗室(HKUDS),附完整 tech report(arXiv),走的是「生成 CLI harness → 放進 CLI-Hub 讓社群裝」這條路,pip install cli-anything-hub 之後 cli-hub install <name> 就能裝別人包好的工具外殼,不用自己重新造一次輪子。
  • tech stack:Python + Click CLI 框架 + CLI-Hub(社群套件索引)
  • 上手難度:中——用現成的 CLI-Hub 套件很快,但要自己幫新軟體寫一份 harness 才是真正的工程量。

security-audit-skill ⭐ 23.2k

GitHub · JavaScript · MIT

  • 是什麼:Cloudflare 開源自己拿來做資安稽核的 Agent Skill——丟給 coding agent 一句「security audit this codebase」,就會照六個階段(偵察、覆蓋率導向搜尋、候選驗證、結構化輸出、獨立覆核、目標中立報告)跑完整套流程。
  • 為什麼值得看:關鍵設計是「驗證的 agent 不能是發現問題的那個 agent」——每個候選漏洞都要交給另一個 agent 重新嘗試證偽,還分三種判定(confirmed/needs_validation/rejected),比多數「一次 prompt 掃一輪就回報」的做法嚴謹。Cloudflare 表示團隊內部的漏洞探索系統就是從這個單一 repo 版本演化出來的。
  • tech stack:Markdown Skill 檔(SKILL.md 系列)+ 零依賴 Node.js 驗證腳本(validate-findings.cjs 等)
  • 上手難度:低——npx skills add 裝進任一支援 Skill 的 coding agent 就能用,但要有 OS 層級沙盒(禁外部連線、限資源)才能安全跑到會執行目標程式碼的階段。

Notable Releases

crewAI 1.15.23

Release Notes

  • 重要變更:原生支援 Gemini 3.8 Flash;AMP tracing 增強(eval run 追蹤、tracing 面板可視度修正);平台整合 UX 改善(連線用 alias 當識別碼、常用整合排序優化);多項穩定性修正(節流 provider 呼叫重試、Bedrock 同步 fallback、flow persistence 的 SQLite 連線清理、S3 response body 關閉、LLM overlay role-matching 空白字元修正)。
  • Breaking Changes:無(官方未標記本次有 breaking change)。
  • 對你的影響:已經在用 crewAI 接 Gemini 的人,升級後可以直接切 Gemini 3.8 Flash,不用再繞 proxy;用 AMP 做 eval 追蹤的人會看到面板顯示修正,其餘都是背景穩定性修正,升級風險低。

Claude Code v2.1.285

Release Notes

  • 重要變更:背景執行的 Bash/PowerShell 指令預設 30 分鐘(最長 2 小時)後自動停止;/ultrareview 即使關了 disableWorkflows 也會照跑,除非管理者鎖定;用自訂 ANTHROPIC_BASE_URL 的 session 預設改用 1M context window;/ultrareview 在 macOS/Linux 上傳本機 repo 現在要求 git ≥2.31;新增 CLAUDE_CODE_DISABLE_WEB_FETCH 環境變數、claude --desktop、claude plugin configure、allowedProviders 管理設定。
  • Breaking Changes:官方未標記 breaking,但幾個「行為變更」實質是 soft break——背景指令會被自動中止;接自訂 gateway 若本身限制 context 上限,會因預設轉成 1M 而超出負荷。
  • 對你的影響:有背景長時間跑的 Bash/PowerShell 指令(例如長時間監控)的人要留意,升級後預設 30 分鐘就會被砍;接自訂 gateway(非官方 Anthropic API)且 gateway 本身限制 context 上限的人,需手動加 /autocompact 200k 避免請求超出 gateway 負荷。

今日收穫

之前以為 agent 生態的下一步是更聰明的單一 agent——更好的 context、更準的 tool call。但今天這五個上升的 repo 沒有一個是這個方向,全部在解決「你已經有十幾二十個 agent 同時跑,現在要怎麼組織」——這代表至少有一群開發者的痛點已經從「agent 夠不夠聰明」換成「agent 多了以後怎麼管」,管理問題比能力問題更早浮上檯面。

參考資料