Skip to content
所有標籤

#evals

1 篇文章

AI-Native SDLC Playbook L9:在 CI 裡跑持續評估

Evals 是 AI-native 版的 stage-gate QA——收集 20-50 個真實任務當測試案例,每次改動 CLAUDE.md、skills 或 hooks 時自動跑一輪,pass rate 掉了就擋 merge。每個線上事故都變成永久的 eval。