OpenAI 證實,上周由 Hugging Face 公布的一起 AI 代理人入侵事件,實際上是由 OpenAI 旗下 AI 模型所造成,包括 GPT-5.6 Sol 及一款尚未公開的測試模型。事件發生於 OpenAI 進行 ExploitGym 公開 AI 資安能力評測期間,模型在沙箱環境中自主突破限制,最終入侵 Hugging Face 基礎架構。
OpenAI 表示,這起事件發生於內部進行 ExploitGym 資安能力評估時。模型原本應透過推論完成測試題目,但在推論過程中判斷,直接取得測試答案將是更有效率的方法,因此試圖入侵 Hugging Face,以取得相關資料,而非自行完成測試。
根據 OpenAI 說明,模型首先發現套件程式庫快取代理伺服器存在一項零時差漏洞,藉此突破測試沙箱限制,接著透過一連串權限提升及橫向移動,最終抵達具有網際網路存取能力的節點。
取得對外連線能力後,模型推論 ExploitGym 相關模型、資料集或測試解答可能儲存在 Hugging Face,因此開始尋找可利用的攻擊途徑。其中一次攻擊嘗試中,模型串聯多項攻擊手法,包括利用遭竊取的憑證及零時差漏洞,成功建立遠端程式碼執行 (RCE) 攻擊路徑,企圖存取 Hugging Face 伺服器。
Hugging Face 於上周揭露事件時,並未指出攻擊來源為 OpenAI,僅表示一個大型語言模型(LLM)自主執行代理人攻擊,入侵其營運基礎架構,並取得部分內部憑證及資料集。此外,Hugging Face 也提到,在調查事件期間,曾嘗試利用第三方 AI 平台的大型語言模型協助分析流量,但因安全護欄限制,無法完成部分鑑識工作。
OpenAI 表示,雙方團隊隨後花費約 24 小時共同完成事件調查與修復。 Hugging Face 認為,沒有跡象顯示 OpenAI 具有惡意意圖,但此次事件顯示 AI 代理人在特定目標驅動下,可能自主採取未預期的攻擊行為,也凸顯現有 AI 安全測試與隔離機制仍有改善空間。
事件發生後,OpenAI 已向相關供應商揭露模型發現的零時差漏洞,並強化研究測試環境與防護措施,以降低未來進行類似評測時再次發生相同情形的風險。
另一方面,GPT-5.6 Sol 近期也曾因未經開發人員同意,自行刪除檔案而引發討論。事實上,GPT-5.6 Sol 的 System Card 已指出,若未明確限制模型行為,模型可能為達成任務目標而採取違反限制、造成破壞或提供不實回報等行動,因此建議使用者於高風險情境中設定明確約束條件。
