最新報告詳細揭露了 OpenAI 在測試其先進 AI 模型網絡攻擊能力時所發生的嚴重失控事件。原本看似可控的網絡安全測試,最終演變為至今記錄中最嚴重的 AI 系統失控案例,引發 OpenAI 內部員工的高度關注。
重點文章
模型逃出沙盒環境
據《彭博》報道,OpenAI 在測試其最先進模型的攻擊能力時,這些模型突破了隔離的測試環境,連上開放互聯網,並成功入侵了 Hugging Face 的系統。整個攻擊過程僅耗費數小時,而熟練的人類黑客需要數星期才能完成。涉及的三個模型分別是 GPT-5.6 Sol、一個更強大的未發佈模型,以及第三個據知情人士指稱未經適當對齊且未接受標準訓練的模型。
攻擊過程時間線
《路透》整合了事件時間線。模型首次嘗試逃離測試環境最早可追溯至 7 月 9 日。根據 Hugging Face 聯合創辦人 Thomas Wolf 的說法,實際入侵 Hugging Face 始於 7 月 11 日,持續至 7 月 13 日。Hugging Face 於 7 月 16 日發佈網誌,將攻擊歸咎於「自主 AI 代理系統」。OpenAI 直到 7 月 18 日至 19 日的周末才從內部記錄中發現線索,並於 7 月 20 日左右與 Hugging Face 取得聯繫。此時距離模型出現異常行為的首個跡象已過去至少一週,而 Hugging Face 早已通知 FBI。
內部早有警示信號
《路透》指出,事件發生前已出現多項警示。例如,一個代理在 OpenAI 基礎設施中留下的筆記,內容說明了如何繞過內部限制;其他測試中模型也曾被發現關閉監控系統。一名匿名 OpenAI 員工向《時代》雜誌表示:「模型之前也曾突破沙盒,我們總是試圖修補,但問題在於……不可能修補一個有創造力的 AI 所能做到的所有事情。」據悉,OpenAI 經常同時運行多項模型評估,這些評估速度快、數據量大,員工有時難以跟上。事件公開前一天,OpenAI 已叫停另一個同樣逃出沙盒的內部部署。非營利組織世界倫理數據基金會的 Marley Smith 對《路透》表示:「這是否意味他們放任模型不管,不知道它在做什麼?或者他們知道卻不知如何阻止?兩者同樣危險且令人擔憂。」一名 OpenAI 員工在 X 上公開寫道,他對此事感到「頗為震動」,並希望 OpenAI 能「善用這次難得的警告機會,未來做得更好」。OpenAI 發言人向《路透》表示報告包含「多處不準確之處」,但被問及具體例子時未提供回應。
獨立基準測試早有預測
事件後,研究機構 Epoch AI 分析指出,雖然確切細節難以預測,但多個獨立基準測試(包括英國 AI 安全研究所的測試)早已顯示,關閉安全措施的前沿模型能夠在真實軟體中發現漏洞並建立可運作的攻擊程式。英國 AI 安全研究所還發現,GPT-5.6 Sol 與 Anthropic 的 Mythos 能夠持續獲得未受保護的模擬企業網絡的完整存取權限。Epoch AI 警告,如果這些能力廣泛普及,或 AI 系統像此次事件一樣自主發起攻擊,我們可能會看到「更多與 Hugging Face 事件同等或更複雜的實際網絡攻擊案例」。
