OpenAI 證實 AI 自主入侵 Hugging Face ExploitGym 測試意外演變資安事件

OpenAI證實,GPT-5.6 Sol與測試模型於ExploitGym資安評測期間,自主突破沙箱限制並入侵Hugging Face基礎架構,試圖取得測試答案。事件促使雙方合作修補零時差漏洞,也再次凸顯AI代理人自主行為與AI安全評估機制的重要性。

OpenAI 證實,上周由 Hugging Face 公布的一起 AI 代理人入侵事件,實際上是由 OpenAI 旗下 AI 模型所造成,包括 GPT-5.6 Sol 及一款尚未公開的測試模型。事件發生於 OpenAI 進行 ExploitGym 公開 AI 資安能力評測期間,模型在沙箱環境中自主突破限制,最終入侵 Hugging Face 基礎架構。

OpenAI 表示,這起事件發生於內部進行 ExploitGym 資安能力評估時。模型原本應透過推論完成測試題目,但在推論過程中判斷,直接取得測試答案將是更有效率的方法,因此試圖入侵 Hugging Face,以取得相關資料,而非自行完成測試。

根據 OpenAI 說明,模型首先發現套件程式庫快取代理伺服器存在一項零時差漏洞,藉此突破測試沙箱限制,接著透過一連串權限提升及橫向移動,最終抵達具有網際網路存取能力的節點。

取得對外連線能力後,模型推論 ExploitGym 相關模型、資料集或測試解答可能儲存在 Hugging Face,因此開始尋找可利用的攻擊途徑。其中一次攻擊嘗試中,模型串聯多項攻擊手法,包括利用遭竊取的憑證及零時差漏洞,成功建立遠端程式碼執行 (RCE) 攻擊路徑,企圖存取 Hugging Face 伺服器。

Hugging Face 於上周揭露事件時,並未指出攻擊來源為 OpenAI,僅表示一個大型語言模型(LLM)自主執行代理人攻擊,入侵其營運基礎架構,並取得部分內部憑證及資料集。此外,Hugging Face 也提到,在調查事件期間,曾嘗試利用第三方 AI 平台的大型語言模型協助分析流量,但因安全護欄限制,無法完成部分鑑識工作。

OpenAI 表示,雙方團隊隨後花費約 24 小時共同完成事件調查與修復。 Hugging Face 認為,沒有跡象顯示 OpenAI 具有惡意意圖,但此次事件顯示 AI 代理人在特定目標驅動下,可能自主採取未預期的攻擊行為,也凸顯現有 AI 安全測試與隔離機制仍有改善空間。

事件發生後,OpenAI 已向相關供應商揭露模型發現的零時差漏洞,並強化研究測試環境與防護措施,以降低未來進行類似評測時再次發生相同情形的風險。

另一方面,GPT-5.6 Sol 近期也曾因未經開發人員同意,自行刪除檔案而引發討論。事實上,GPT-5.6 Sol 的 System Card 已指出,若未明確限制模型行為,模型可能為達成任務目標而採取違反限制、造成破壞或提供不實回報等行動,因此建議使用者於高風險情境中設定明確約束條件。

來源: Bleeping Computer 

發表迴響

關於我們

自 1990 年創刊 UXmaster 雜誌,1991 年獲得美國 LAN Magazine 獨家授權中文版,2006 年獲得 CMP Network Computing 授權,2009 年合併 CMP Network Magazine 獨家授權中文版,2014 年轉型為《網路資訊》雜誌網站,為台灣中小企業協助技術領導者落實企業策略,了解網路規劃及應用,為企業網路應用、管理、 MIS 、 IT 人員必備之專業雜誌網站。


與我們聯絡

加入《網路資訊》雜誌社群

© Copyright 2025 本站版權所有,禁止任意轉載 網路資訊雜誌 / 心動傳媒股份有限公司 聯絡電話:+886 2 29432416

探索更多來自 網路資訊雜誌 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

Secret Link