Promptfoo 深入介紹:把 LLM Eval 與 Red Team 寫進本機測試迴圈
Promptfoo 用 YAML 把 prompts、providers、test cases 與 assertions 組成可在本機與 CI 重跑的 LLM 評估矩陣,並共用同一套 target 做 red team;它降低測試門檻,但隨機輸出、LLM judge 偏差與 hosted data flow 仍要另外治理。
Promptfoo 用 YAML 把 prompts、providers、test cases 與 assertions 組成可在本機與 CI 重跑的 LLM 評估矩陣,並共用同一套 target 做 red team;它降低測試門檻,但隨機輸出、LLM judge 偏差與 hosted data flow 仍要另外治理。
Model Armor 能在 runtime 檢查 prompt injection、jailbreak、敏感資料、惡意 URL 與內容安全;它是 probabilistic detector,不是 authorization 或 sandbox boundary。
Promptfoo 以 plugins 產風險 probes、strategies 變形攻擊、targets 執行系統、graders 判斷結果;有價值的 red team 必須測整個 agent application,而不只是 foundation model。
Volcengine(字節跳動旗下)開源 OpenViking,用 viking:// 虛擬檔案系統取代黑盒向量搜尋做 Agent 記憶,官方測試把準確率拉到 80%+ 同時省 34–91% token;munder-difflin 把多個 coding CLI 包成桌面辦公室、用共享記憶層互相協作;ai-memory 用 Rust MCP server 解決『換 CLI 就失憶』的痛點;mukul975 的資安技能包一天內衝到近 2.8 萬星。pydantic-ai v2.32.0 補強 OpenRouter/xAI 附件搜尋與 instrumentation。