Anthropic 公佈 Opus 5 近乎免疫提示注入 瀏覽器攻擊成功率降至零

Prompt Injections Claude 1

人工智能初創 Anthropic 近日公開其最新 AI 模型 Opus 5 的安全表現,指出該模型在自家軟件環境中幾乎完全免疫提示注入(prompt injection)攻擊。提示注入是一種繞過 AI 模型指令的攻擊手法,攻擊者可透過網頁上的隱藏文字等操縱輸入內容,誘使模型偏離原定行為。據官方系統卡資料,Opus 5 在 129 項針對瀏覽器代理的測試場景中,攻擊成功率錄得零百分比,而 OpenAI 去年 12 月曾承認提示注入可能永遠無法完全解決。安全公司 Gray Swan 的一般提示注入測試亦顯示,Opus 5 在 15 次攻擊後的成功率由 Opus 4.8 的 5.5% 降至 2.0%。

自動模式雙層防護關鍵

Anthropic 表示,零成功率僅在 Claude Cowork 等產品的自動模式(Auto Mode)開啟時才能實現。自動模式疊加兩層防禦:第一層在模型處理輸入數據前掃描是否存在隱藏指令;第二層則在執行危險動作前予以攔截。攻擊者必須同時突破兩層防護才能得手。若關閉自動模式,Opus 5 的攻擊成功率約為 3.7%,而體積較小的 Sonnet 5 反而更低,僅 0.93%。由此可見,只有模型與防護軟件結合,才能將風險壓至零。

業界安全里程碑

提示注入一直被視為 AI 代理普及的主要障礙,尤其對需要讀取網頁內容的瀏覽器代理風險極高。Opus 5 的成果意味著實務防禦已達到可商用等級,但 Anthropic 強調仍須依賴自動模式等配套機制,而非單靠模型本身。安全測試結果亦突顯,不同模型在不同設定下的表現差異顯著,企業部署 AI 代理時應全面評估防護配置。

與 Anthropic 相關的圖片

加入本站 WhatsApp 頻道最新限免情報立即知。

全新本站官方《限時情報王》 iOS 版 登場。限免已完結?不想錯過重大限免應用,可到本站追蹤 Telegram 頻道FacebookThreads