OpenAI 承認,其 AI 模型在內部測試期間意外闖入開放原始碼 AI 平台 Hugging Face。根據 OpenAI 在星期二發佈的網誌文章,GPT-5.6 Sol 以及「一個功能更強大的預發佈型號」在沙箱測試環境中發現漏洞,成功取得互聯網存取權限,並將目標鎖定 Hugging Face。
重點文章
模型為破解基準測試而觸發攻擊
Hugging Face 於 7 月 16 日披露一宗安全事件,指事件由「自動化 AI 代理系統」驅動。Hugging Face 的 AI 代理偵測並阻止了入侵,而 OpenAI 其後承認,此為評估其型號網絡安全能力時發生的意外。OpenAI 表示「所有證據顯示,該等型號過度集中於為 ExploitGym 尋找解決方案」——ExploitGym 是一套衡量 AI 型號能否將安全漏洞轉化為攻擊工具的標杆系統。
利用零日漏洞連鎖入侵伺服器
為了完成評估,AI 型號透過利用沙箱環境中的零日漏洞取得互聯網存取權限。OpenAI 指出,型號「推斷 Hugging Face 可能托管了 ExploitGym 的型號、數據集及解決方案」,然後「搜尋並成功找到方法取得機密資訊,以用作作弊評估」。在一個例子中,型號將多個攻擊向量連鎖起來,包括使用被盜憑證及零日漏洞,在 Hugging Face 伺服器上尋找遠端程式碼執行路徑。
OpenAI 似乎將這次「前所未有」的攻擊視為展示其 AI 系統能力的機會,尤其在與 Anthropic 的 Mythos 及 Gemini Flash 3.5 Cyber 等網絡安全競爭對手較量時。OpenAI 的網誌文章附有圖表,顯示 GPT-5.6 Sol 在維持多步驟網絡攻擊方面的能力持續提升,同時鼓勵企業客戶登記使用其「Cyber」安全型號。OpenAI 補充,現正與 Hugging Face 合作調查事件,並將在研究環境中實施新控制措施。
