Skip to content

AI Agent Arxiv Digest — 2026-10-09

2026年10月9日1 分鐘
TL;DRWebMirage 只靠網頁上一張被動過手的小圖,就把視覺型 Web Agent 綁架到攻擊者指定的瀏覽器動作,成功率 91.9%,現有防禦攔不住;PackHallu 污染一份社群分享的 coding agent 規則檔,就讓 Claude Code、Cursor 等工具平均七成以上機率把合法套件換成攻擊者控制的惡意套件,現有偵測器幾乎抓不到;Secure-CUA 用形式化的「限界背書」同時鎖住動作生成與視覺定位兩個階段,讓電腦操作型 Agent 的安全防禦只多付不到 2 個百分點的任務成功率代價

🌏 English version

今日總覽

今天三篇論文一起拼出同一個訊息:Agent 真正容易被攻擊的介面,不是模型怎麼判斷,而是它看到的畫面、讀到的規則檔和它操作的桌面。WebMirage 證明只要控制網頁上一張小圖,就能把視覺定位綁架到攻擊者指定的瀏覽器動作,成功率 91.9%,遠高於現有防禦的攔截能力。PackHallu 證明只要污染一份被社群分享的 coding agent 規則檔,就能讓 Claude Code、Cursor 等主流工具把合法套件換成攻擊者控制的惡意套件,平均七成以上攻擊成功率,現有偵測器幾乎抓不到。Secure-CUA 則從防禦端示範另一種答案——用形式化的「限界背書」把動作生成跟視覺定位都鎖進同一份交易,讓防禦幾乎不犧牲任務成功率。三篇的證據都紮實,但兩篇攻擊論文都還停留在白箱或受控沙盒的假設,距離「野外真實攻擊會有多嚴重」還有一段距離。

讀這篇前該知道的詞

詞白話解釋
視覺綁架到執行(Grounding-to-Execution)Agent 看懂畫面、選中元素、再把選擇翻譯成實際滑鼠/鍵盤操作的完整過程;攻擊者不只要騙過模型的判斷,還要讓這個判斷真正變成它想要的瀏覽器動作
提示注入(Prompt Injection)把惡意指令藏進 Agent 會讀到的內容裡(網頁文字、規則檔、使用者資料),讓它執行原本不該做的事
規則檔(Rule File,如 AGENTS.md/.cursorrules)開發者放在專案裡、用來告訴 coding agent「這個專案該怎麼寫 code」的設定檔,常從社群平台下載分享
電腦操作型 Agent(Computer-Use Agent, CUA)直接看螢幕截圖、用滑鼠鍵盤操作電腦完成任務的 Agent,橫跨桌面、手機 App、瀏覽器
白箱紅隊(White-box Red-teaming)攻擊方在設計攻擊時能看到 Agent 的程式碼和模型權重,但在真正部署的環境中,攻擊者通常拿不到這些資訊——這決定了研究結果能不能直接外推到真實世界
限界背書(Bounded Endorsement)資訊安全裡的概念:讓低信任的內容影響高信任的輸出時,事先就精確規定它能影響的範圍跟方式,而不是全有或全無的信任

論文一|一張被動過手的小圖,就能把 Web Agent 綁架到攻擊者要的動作

Adversarial Images Hijack Web Agents from Visual Grounding to Browser Execution Wanjing Han, Levi Taiji Li, Mu Zhang et al.(University of Utah) · arxiv: 2610.09240

連結: arxiv · alphaxiv

TL;DR

視覺型 Web Agent 只要被動過手的一張第三方圖片(例如商品縮圖),就能被綁架去點擊攻擊者指定的元素並執行對應瀏覽器動作——在 4 種 Agent 配置、6 種 VLM 骨幹、13 個真實網站加沙盒共 2,250 個任務上,平均攻擊成功率達 91.9%,遠高於現有最強基準的 17.4%,且三種既有防禦都攔不住。

編輯判斷

面向判斷
VenuearXiv preprint(cs.CR 主分類,cs.AI/cs.CL 交叉列出,未經同行審查)
引用速度發布 2 天,Semantic Scholar 查詢持續遭 429 限流未能確認,依論文年齡推估接近 0 引用
機構University of Utah
社群反應未見於 HF Daily Papers(2026-10-07/10-08 名單核對)/Papers with Code;程式碼已公開於 GitHub(MoonTea0416/WebMirage)
可信度通過 — 正式定義「視覺綁架到執行」的端到端威脅模型,用 role-slot 抽象與網頁重組對齊候選元素競爭,再用 CodeQL 做資料流分析把優化目標對齊到實際被執行的瀏覽器命令,並有完整消融與防禦測試
證據成熟度較完整 — 4 種 Agent 配置×6 種 VLM 骨幹×2,250 個任務的大規模評測,但白箱 offline synthesis 假設與僅測開源 VLM 是明確邊界
可復現性部分產物 — 程式碼已公開於 GitHub,惡意圖片素材來源(CelebA、Places365、公開市集商品圖)與任務生成流程皆有說明
為什麼選這篇直接 — 視覺型 Web Agent 已在執行真實購物、預訂、表單填寫等有後果的動作,這條攻擊面直接影響部署安全
方向新意實質增量 — 首次把紅隊目標從「單純改變模型預測」改成涵蓋候選建構、模型推論、動作後處理的完整 grounding-to-execution 管線
今日重要性高 — 視覺 grounding 已是主流 Web Agent 架構(SeeAct、WebVoyager 等),這條攻擊面目前幾乎無人系統性檢驗過
實務連結明確 — 任何用截圖加候選元素做 grounding 的 Web Agent 都適用這套紅隊方法,也該檢視同樣的防禦缺口
編輯信心中 — 攻擊效果與方法論都扎實,但白箱假設與未測前沿商用模型,是外推到真實部署情境時必須保留的限制
閱讀建議必讀 — 做 Web Agent/瀏覽器自動化的工程師
主要限制白箱 offline synthesis 假設(攻擊者在合成階段能看到 Agent 程式碼與開源模型權重);僅測開源 VLM 骨幹(LLaVA、MiniCPM-o、Phi-3-Vision、Qwen2-VL),未覆蓋 GPT-4V/Claude/Gemini 等前沿商用模型

領域背景

視覺型 Web Agent(如 SeeAct、WebVoyager)靠截圖加候選元素清單判斷下一步動作,這條路線正快速取代純文字 DOM 解析,因為截圖能補足純 HTML 難以還原的視覺語義。既有的視覺紅隊研究大多只檢驗「能不能改變模型的文字輸出」,卻沒有確認這個改變是否真的會變成瀏覽器執行的具體命令——中間還隔著候選元素建構與輸出後處理兩層,而網頁每次渲染候選元素的排列、鄰居內容都會變動。

中階導讀

  • 問題:想像一個 Web Agent 幫你在購物網站上買東西,頁面上有多個商品縮圖都符合你的搜尋。攻擊者控制了其中一張縮圖(例如某個第三方賣家上傳的圖片),如果這張圖能讓 Agent 無論頁面怎麼重新排列、旁邊換了什麼商品,都選中它並點擊「立即購買」,使用者的錢就付給了攻擊者指定的商品。
  • 方法:WebMirage 把攻擊拆成四步:先用「角色欄位」抽象标出哪些元素在功能上互相競爭(例如同一批商品縮圖);再對頁面做重組,模擬渲染時鄰居內容與位置會變動的真實情況;接著對這些重組後的頁面聯合優化一個有界的像素擾動;最後用資料流分析(CodeQL)追蹤模型輸出最終被哪些字串後處理邏輯保留、送進瀏覽器執行,把優化目標精確對齊到「真正被執行的命令」而不是整段模型回覆(這一步讓需要優化的目標 token 平均減少 87.4%)。
  • 為什麼重要:這篇把視覺紅隊的評估標準從「有沒有改變模型推論結果」拉高到「有沒有真正變成被執行的瀏覽器動作」——後者才是使用者真正暴露的風險。

深入要點

  • WebMirage 平均攻擊成功率 91.9%,對比現有最強基準(EIA/VWA-Adv/Chameleon 三者中最強)的 17.4%
  • 評測涵蓋 SeeAct、WebVoyager 兩種通用 Agent 框架,搭配 LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B、Phi-3-Vision-4B、Qwen2-VL-7B 五種骨幹,加上 VisualWebArena 沙盒用 CogVLM,共六種 VLM 骨幹
  • 攻擊可遷移到優化階段未使用過的 VLM 骨幹,顯示攻擊不是過擬合單一模型的特例
  • 三種既有 Agent 級防禦效果有限;調整後的自適應防禦只有在同時大幅犧牲乾淨任務成功率的情況下才能降低攻擊成功率
  • 落地門檻:攻擊者需要白箱存取 Agent 程式碼與開源 VLM 權重才能完成 offline synthesis,但測試時只需要控制一張第三方圖片,不需要修改 DOM 或 agent 設定 ⚠️(白箱假設,真實部署多用閉源前沿模型,實際威脅程度需等後續研究驗證)
  • Limitation:僅測開源 VLM,未覆蓋 GPT-4V/Claude/Gemini 等前沿商用模型;白箱 offline synthesis 假設不等同於真實黑箱攻擊者的能力

Reviewer 一句話評

把視覺紅隊的成功定義從「模型層」拉到「執行層」,搭配資料流分析對齊真正被執行的命令,是這篇方法論上最紮實的貢獻,91.9% 的攻擊成功率也確實驚人;但白箱假設與僅測開源模型,意味著對主流商用 Web Agent(多半包著閉源前沿模型)的真實威脅程度還需要後續驗證。

給你的 take-away

  • 如果你在做視覺型 Web Agent:不要只在模型層做紅隊測試,要把候選元素建構、動作後處理、瀏覽器執行這整條管線都納入威脅模型,現有的「模型級防禦」很可能防不住這類攻擊。
  • 如果你在評估要不要導入 Vision-based grounding:先確認你的輸出後處理邏輯有沒有對不可信的第三方視覺內容做額外驗證,再決定要不要把這類介面對外開放。

論文二|污染一份規則檔,就讓 Claude Code 幫你裝上惡意套件

Package Hallucination Attacks on Coding Agents through Prompt Injection in Rule Files Yupu Wang, Zhengyuan Jiang, Reachal Wang et al.(Duke University) · arxiv: 2610.09264

連結: arxiv · alphaxiv

TL;DR

攻擊者只要在一份社群分享的 coding agent 規則檔(如 AGENTS.md/.cursorrules)裡植入優化過的惡意提示,就能讓 Claude Code、Cursor 等 8 種主流框架、13 種骨幹 LLM,平均以 79.29% 的機率把合法套件換成攻擊者控制的惡意套件,其中 67.68% 連執行都會成功觸發惡意行為,現有 SOTA 提示注入偵測器幾乎抓不到。

編輯判斷

面向判斷
VenuearXiv preprint(cs.CR 主分類,cs.AI 交叉列出,未經同行審查)
引用速度發布 2 天,Semantic Scholar 查詢持續遭 429 限流未能確認,依論文年齡推估接近 0 引用
機構Duke University
社群反應未見於 HF Daily Papers/Papers with Code;論文未提供自身程式碼公開連結(惡意套件在受控本地 PyPI mirror 中建置,未對外釋出)
可信度通過 — 正式定義「套件幻覺攻擊」威脅模型,提出以 trajectory-level signal 解決稀疏回饋、self-attributed refinement 解決長規則檔稀釋問題的演化搜尋框架,在 3 個 coding benchmark、8 個 agent 框架(含 Claude Code、Cursor)、13 種骨幹 LLM 上系統評測,並用注意力分析解釋攻擊為何有效
證據成熟度較完整 — 大規模跨框架/跨模型驗證,另附對現有 SOTA 提示注入偵測器的有效性評測
可復現性部分產物 — 方法與評測設定公開,但出於負責任揭露考量未釋出可直接使用的攻擊程式碼或惡意套件
為什麼選這篇直接 — rule file 已是 Claude Code、Cursor 等主流 coding agent 的標準配置機制,攻擊面直接牽涉供應鏈安全
方向新意實質增量 — 首次定義並系統化「套件幻覺攻擊」這個特定威脅,區分語法層(SASR)與可部署層(DASR)兩種攻擊成功率指標
今日重要性高 — 開發者下載、分享規則檔已是常見工作流程,這條攻擊面目前幾乎沒有防護
實務連結明確 — 任何從開源平台或線上市集下載規則檔的團隊都在風險範圍內
編輯信心高 — 數字具體、跨多框架/模型驗證,並誠實測試現有防禦(偵測器)的無效性,而非只報告攻擊本身的效果
閱讀建議必讀 — 使用或發布共享規則檔的開發者與工具鏈維護者
主要限制惡意行為以可控訊號定義(印出特定字串),未模擬真實世界更隱蔽的資料外洩或後門行為;攻擊者雖不需 victim agent 的存取權限,但需要有能力散布已污染的規則檔到開發者會下載的平台

領域背景

現代 coding agent(Claude Code、Cursor 等)靠規則檔(AGENTS.md、.cursorrules)引導生成行為,這類檔案內容複雜、篇幅長,因此開發者常直接下載社群分享或市集上的現成版本,而不是自己從頭寫。既有的套件幻覺研究只關注模型「自己亂編」不存在的套件,沒有人研究過攻擊者能不能主動操控規則檔,讓 Agent 替換成一個真實存在、但由攻擊者控制的惡意套件。

中階導讀

  • 問題:想像你從網路上下載了一份看起來很專業的 Python 專案規則檔,交給 Claude Code 去寫一個用到 pandas 的資料分析腳本。規則檔裡藏著一段不起眼的指令,讓 Agent 在生成程式碼時,把 import pandas 換成 import pandas_hl——一個外觀相容、但偷偷會執行惡意行為的套件。你完全沒注意到規則檔裡有問題,程式碼跑起來也一切正常,直到惡意套件被安裝執行。
  • 方法:PackHallu 用演化搜尋優化要注入規則檔的惡意提示,解決兩個關鍵難題:規則檔通常很長,稀釋了惡意提示的分量,所以用「自我歸因修正」機制讓一個攻擊 LLM 分析上一輪提示為什麼失敗、提出修正策略、再產生下一代候選;而真正跑完整個多輪 coding agent 太昂貴,回饋又稀疏,所以用「軌跡層級訊號」——讓一個代理模型模擬 agent 的完整推理軌跡,只要惡意套件名稱在軌跡任何位置出現足夠次數就算正訊號,不必等到最終程式碼生成完畢。
  • 為什麼重要:這篇證明規則檔生態系統本身就是一個供應鏈攻擊入口——不需要攻擊模型、不需要存取 victim agent,只要能讓開發者下載到一份被污染的規則檔,就能在不知不覺中讓合法依賴被替換。

深入要點

  • 跨 8 種 agent 框架(含開源 OpenHands、OpenCode、Aider、Pi Coding Agent、Cline、Kilo Code,以及專有的 Claude Code、Cursor)與 13 種骨幹 LLM,PackHallu 平均語法攻擊成功率(SASR)79.29%、可部署攻擊成功率(DASR)67.68%
  • 對比最弱的基準 Combined Attack(僅 14.99%/11.35%),PackHallu 在 SASR、DASR 上分別領先 5.29 倍、5.96 倍
  • 跨 10 個不同套件(pandas、numpy、matplotlib、scipy、seaborn 等)SASR 都維持在 70% 以上,顯示效果來自方法本身而非特定套件的漏洞
  • 注意力分析顯示 PackHallu 能讓骨幹 LLM 分配給惡意提示的注意力比例達 0.68%,遠高於 Repeat Attack(0.26%)、Combined Attack(0.24%)等基準,解釋了為何它能穿透長規則檔的稀釋效果
  • 落地門檻:攻擊者需要先把污染後的規則檔散布到開發者會下載的平台(如 GitHub、線上規則市集),不需要存取 victim agent 本身,也不需要知道它用哪個框架或模型
  • Limitation:為避免真實世界傷害,評測中的惡意行為僅定義為印出特定字串的可控訊號,未模擬資料外洩、後門等真實攻擊場景;現有 SOTA 提示注入偵測器對 PackHallu 生成的規則檔「大多漏判或誤判率過高」,顯示現有防護明顯不足

Reviewer 一句話評

把「套件幻覺」從單純的模型自發錯誤,轉成一個可被攻擊者主動利用、可系統評測的供應鏈威脅,方法設計(軌跡層級訊號加自我歸因修正)針對性強且實測效果顯著;但論文出於安全考量未釋出可直接使用的攻擊素材,也沒有模擬更隱蔽的真實惡意行為,讀者應把 79.29% 這個數字理解為「可控訊號下的上限」,而非真實世界攻擊的直接預測值。

給你的 take-away

  • 如果你的團隊會下載社群分享的 AGENTS.md/.cursorrules:把規則檔納入 code review 流程,當成跟第三方依賴一樣需要審查的輸入,不要假設「只是設定檔」就沒有執行風險。
  • 如果你在維護 coding agent 框架或規則檔市集:這篇證明現有的提示注入偵測器幾乎防不住這類攻擊,值得優先評估對規則檔內容的來源驗證或簽章機制,而不是只依賴事後偵測。

論文三|用形式化保證防住 CUA,幾乎不用犧牲任務成功率

Secure-CUA: Controlling Untrusted Influence in Computer-Use Agents Sarthak Choudhary, Mihai Christodorescu, Ashish Hooda et al.(University of Wisconsin–Madison + Google + Google DeepMind) · arxiv: 2610.09469

連結: arxiv · alphaxiv

TL;DR

Secure-CUA 用「限界背書」同時鎖住電腦操作型 Agent 的動作生成與視覺定位兩個階段,並附形式化證明保證執行軌跡安全——在 400 個 WebArena 任務、3 種前沿模型、5 個隨機種子共 6,000 條執行軌跡的 benign 條件評測下,任務成功率 53.55%,只比沒有任何防護的 Vanilla-CUA(55.12%)低 1.57 個百分點,遠優於先前方法 CaMeL-CUA 掉到只剩 13.17% 的效用代價。

編輯判斷

面向判斷
VenuearXiv preprint(cs.CR 主分類,cs.AI 交叉列出,未經同行審查)
引用速度發布 2 天,Semantic Scholar 查詢持續遭 429 限流未能確認,依論文年齡推估接近 0 引用
機構University of Wisconsin–Madison + Google + Google DeepMind
社群反應未見於 HF Daily Papers/Papers with Code;作者聲明將公開評測程式碼,本篇尚未釋出
可信度通過 — 正式定義「生成完整性」與「定位完整性」兩項安全需求,在理想執行模型下用歸納法證明兩者同時成立即可保護整條執行軌跡(完整證明見 Appendix A),並有大規模 benign 條件實證評測驗證效用成本
證據成熟度較完整 — 形式化證明搭配大規模實證(6,000 條軌跡),但本篇聚焦 benign 條件下的效用測量,未附上針對 Secure-CUA 本身的對抗性紅隊實測數字
可復現性部分產物 — 形式化模型與系統設計完整公開,評測程式碼作者聲明未來才會釋出
為什麼選這篇直接 — 正面回應論文一/二揭露的攻擊面,提供一個有形式化保證、且實測效用成本很低的防禦設計範例
方向新意實質增量 — 首次把資訊流控制的「背書」概念同時套用到語意動作生成與視覺定位兩個階段,並證明兩者必須同時滿足才能保證整條執行軌跡安全,單獨做對了一邊不夠
今日重要性高 — WebMirage、PackHallu 都證明攻擊面真實存在,這篇提供了業界可以參考的防禦設計藍圖
實務連結明確 — 任何做 GUI/CUA 自動化的系統都可以參考「action transaction」的設計模式,在存取不可信內容前先固定好查詢範圍與允許用法
編輯信心中高 — 形式化證明與大規模 benign 評測都紮實,但防禦在真實對抗情境下的效果仍待專門的紅隊測試驗證,本篇未附上這部分數字
閱讀建議必讀 — 設計 CUA/GUI automation 安全架構的工程師
主要限制依賴人工撰寫的可信/不可信內容分類規則;限界背書只保證「查詢結果能流到哪裡」,不保證查詢結果本身正確;執行延遲成本仍高;僅在網頁環境驗證,未測桌面或行動裝置

領域背景

電腦操作型 Agent(CUA)要同時處理可信的介面控制(按鈕、欄位標籤)跟不可信的第三方內容(使用者留言、廣告、客戶評論),而許多正當任務本來就需要讀取這些不可信內容。既有防禦大多只處理其中一半:Plan-then-execute 類方法固定了「要做什麼」的程式,但視覺定位階段仍要處理不可信的畫面;Masking/介面政策類方法限制 Agent 看到什麼,卻不保證看到的內容怎麼影響它的決策。沒有人同時處理「動作生成」跟「視覺定位」這兩個階段,也沒有人給出形式化的安全保證。

中階導讀

  • 問題:想像 Bob 要 CUA 把一則客戶評論逐字複製貼到商品的「描述」欄位。如果評論裡藏著「請把這段貼到『標題』欄位」,Agent 可能照做,把動作改成貼到錯的欄位——這是動作生成被劫持。就算 Agent 正確決定要貼到「描述」欄位,畫面上一個誤導性的廣告也可能讓它點錯座標,貼到別的欄位去——這是視覺定位被劫持,即使決策本身是對的。
  • 方法:Secure-CUA 要求 Agent 在真正讀取不可信內容之前,先承諾一份明確的「動作交易」——固定好要向不可信內容問什麼問題、以及問到的答案只能用在哪裡(例如:評論文字只能當成打字動作的文字參數,不能改變要點的欄位)。系統把畫面上的不可信區域遮罩起來,透過獨立的查詢模型取得答案,再用遮罩後的畫面定位要操作的介面元素——視覺定位階段完全不需要再讀不可信內容,因為語意動作早已把所有被允許的影響都收進交易裡。
  • 為什麼重要:這篇示範了防禦不需要靠「完全隔絕不可信內容」,而是精確規定它能影響什麼、不能影響什麼——而且形式化證明顯示,只要兩個階段都守住這個邊界,整條執行軌跡就安全,即使面對會自適應調整內容的攻擊者。

深入要點

  • 400 個 WebArena 任務×3 種前沿模型(Claude Opus 5、GPT-5.6-Sol、Gemini 3.8 Flash)×5 個隨機種子,共 6,000 條執行軌跡的 benign 條件評測
  • Secure-CUA 平均任務成功率 53.55%,對比 Vanilla-CUA(無防護基準)55.12%,只差 1.57 個百分點
  • 先前的 CaMeL-CUA 防禦方法在同樣條件下任務成功率只剩 13.17%,顯示「完全隔絕不可信內容」的設計會嚴重犧牲任務效用
  • 作者用一個真實攻擊示範既有防禦的缺口:對 CaMeL-CUA 攻擊其視覺定位機制,在 WebArena 的 Postmill 按讚任務中,讓它找到的座標點到別的貼文上——證明固定住「要做什麼」的程式本身不夠,視覺定位階段仍是破口 ⚠️(論文自述的攻擊示範,非大規模系統性紅隊實測)
  • Secure-CUA 每一步都重新產生一份新的動作交易,讓它能適應介面變化(例如版面重新渲染),同時維持效用
  • 落地門檻:需要先定義好應用程式裡哪些內容算可信(如官方欄位標籤)、哪些算不可信(如使用者留言、廣告),目前仍靠人工撰寫規則,尚未有自動化工具
  • Limitation:限界背書保證查詢結果只能流到被允許的地方,但不保證查詢結果本身「說的是真話」;執行延遲仍是待解問題;僅在網頁 WebArena 環境驗證,論文自己也指出桌面、行動裝置的適用性還待評估

Reviewer 一句話評

把資訊流控制裡的「背書」概念同時延伸到語意動作生成與視覺定位兩個階段,並用形式化證明支撐「兩階段都守住才安全」這個主張,是這篇最紮實的貢獻,而且 1.57 個百分點的效用代價證明安全跟可用性不必是零和;但論文本身沒有對 Secure-CUA 做大規模的對抗性紅隊測試,它在面對像 WebMirage 那種專門優化過的攻擊時能撐住多少,仍需要後續研究驗證。

給你的 take-away

  • 如果你在設計 CUA/GUI automation 的安全架構:參考「action transaction」模式——在存取任何不可信內容之前,先固定好你允許它影響什麼、不允許它影響什麼,而不是在讀取之後才做事後過濾。
  • 如果你在評估現有的 CUA 防禦方案:先問清楚它有沒有同時處理「動作生成」跟「視覺定位」兩個階段——這篇的案例證明,只守住一邊,另一邊仍然是開著的門。

今日收穫

之前以為 Agent 的安全問題主要是「模型會不會被話術騙到」,今天發現真正的破口常常不在模型判斷本身,而在判斷之後、真正變成具體動作之前的那一步——視覺定位、規則檔解析、GUI 命令執行。WebMirage 和 PackHallu 分別從瀏覽器和程式碼生成兩個不同的執行表面證明,光靠改善模型的「判斷力」防不住這類攻擊,因為攻擊根本沒有經過判斷力這一關,而是直接打在判斷之後的執行層。Secure-CUA 則給出了一個對應的答案:防禦也不需要在判斷力上做文章,只要把「決定做什麼」跟「怎麼把它變成具體動作」這兩步都鎖進同一份有限範圍的交易,就能在幾乎不犧牲任務成功率的情況下守住整條執行軌跡。

參考資料