Skip to content
系列
7 篇文章

Agent 生產線

把 agent 當成一條生產線來看:概念界線、模型與 harness 的分工、context 與記憶、企業案例、安全、協定層,以及 RAG 的三種形態。

ai deep-dive Agent 生產線

概念界線:agent、workflow、RAG、MCP 到底差在哪

workflow 與 agent 的分界是「步數由誰決定」——開發者在設計時決定是 workflow,模型在執行時決定是 agent。依這個定義,今天大多數上線的 LLM 系統其實是 workflow。附 agent / RAG / MCP 的可操作判準。

ai deep-dive Agent 生產線

模型只是元件,harness 才是系統

Microsoft、OpenAI、Salesforce、Stripe 等七個獨立案例講出同一句話:可靠性來自模型周圍的工程。而「把確定性的部分還給程式碼」已經被四家公司各自做成產品——Agent Script、Procedures、runtime、blueprints。

ai deep-dive Agent 生產線

context 與記憶:agent 失敗的真正位置

Chroma 測了 18 個前沿模型,全部隨輸入變長而跳崖式退化。記憶失效多半是檢索失效偽裝的。而 KV cache 的真正成本是頻寬不是儲存——decoding 每產生一個 token 都要讀過整個 cache。

ai deep-dive Agent 生產線

上線才是工作的開始:企業 agent 案例橫向讀

Salesforce 從兩萬個部署得到的數字:agent 有 90% 的工作發生在上線之後,跟傳統軟體剛好相反。Stripe 每週合併 1,300 個零人類手寫的 PR,靠的是環境而不是模型。附六家公司的橫向比對。

ai deep-dive Agent 生產線

安全:prompt injection 只能在 harness 層做損害控制

2025-11 三大實驗室聯手把先前提出的 12 種 prompt injection 防禦全部攻破。EchoLeak 的 payload 通過了微軟自己的專用分類器。所以目標不是擋住每次攻擊,是攻擊成功時活下來——而這只能在 harness 做。

ai deep-dive Agent 生產線

協定層:MCP、A2A、ACP、Skills 各解什麼問題

MCP 管 agent ↔ 工具,A2A 管 agent ↔ agent,Skills 管可重複使用的知識。判準是資料會不會變:呼叫之間會變就要 MCP,穩定到可以寫下來就用 skill 檔案——後者不需要一個會獨立失敗的 runtime。

ai deep-dive Agent 生產線

RAG 的三種形態與 evaluator paradox

Standard RAG 取錯 chunk 就答錯,而且沒有任何機制會發現。Agentic RAG 補上自我檢查,但代價是 evaluator paradox——自我修正能力的上限,就是那個做評估的 LLM 判斷相關性的能力。