Google Cloud Model Armor 是放在生成式 AI request/response path 的 runtime screening service。Template 可啟用 prompt injection/jailbreak、harmful content、malicious URI、malware 與 Sensitive Data Protection 等 filters,並設定 confidence threshold 與 INSPECT_ONLY 或 INSPECT_AND_BLOCK。
Input 與 output 要用不同 policy
User prompt、RAG chunk、web page、uploaded document 與 tool result 都可能帶 indirect prompt injection;input template 應聚焦不可信 instructions、malicious URI、上傳 secrets。Model output template 則聚焦 credential/PII leakage、harmful content 與惡意 link。官方也建議分開 templates,因兩側的 false-positive 成本與風險不同。
Confidence threshold 越低會攔更多可疑內容,也增加合法 request 被擋。先用 inspect-only 對 production-like traffic 建 confusion matrix,依 route/tool risk 設 threshold,不用一套全站數值。High-risk write/delete/payment tool 即使 detector 未命中,仍要 deterministic authorization 與 confirmation;low-risk FAQ 也不能因 false positive 變成不可用。
Filter output 不是安全決策的唯一依據
Prompt-injection classifier 可能 false negative、被新語言/encoding/多模態繞過,也可能把合法 security discussion 判成攻擊。正確架構是 layered:隔離 instructions 與 untrusted data、限制 tool schema/arguments、per-user authorization、least privilege、side-effect confirmation、sandbox、egress policy、audit,再以 Model Armor 降低進入模型或離開模型的危險內容。
Templates 是 IAM-controlled policy objects;organization/folder/project floor settings 可要求最低 filters,避免某 team 建立更寬鬆 template。仍要測 local setting precedence、inline integration coverage 與繞過路徑,確保所有 model/provider/tool calls 都經過預期 template,而不是只保護一個 chat endpoint。
Logging prompt/response 能支援 incident/debug,卻可能把 PII、credentials 與 proprietary context複製到 log。log_sanitize_operations 應預設關閉或經明確 data governance,設定 retention、redaction、access與 region。Model Armor 可透過 REST 保護不同模型/雲,實際 latency、token/file limits、streaming、fail-open/fail-closed 與 service outage 需壓測。
參考資料
Loading...