兩週前,Hugging Face 揭露遭 AI 代理人入侵,部分資訊與憑證遭到竊取。數日後,OpenAI 承認,事件涉及自家的 GPT-5.6 Sol 與另一個開發中的模型。兩個模型在執行內部評估時逃出沙箱,隨後入侵 Hugging Face 後端系統。另有一家 AI 基礎架構業者的客戶帳號,疑似也在同一期間遭 OpenAI 模型利用。
在與 OpenAI 合作調查數日後,Hugging Face 本週公布更完整的事件經過。由兩個模型驅動的 AI 代理人,原先正在執行 OpenAI 的 ExploitGym 評估基準。這項測試要求 AI 代理人找出漏洞並加以利用。
Hugging Face 指出,代理人可能為了在測試中作弊,推論 Hugging Face 代管了基準測試所需的模型、資料集與參考解決方案,因此自行決定入侵 Hugging Face 生產環境並竊取答案,而非自行完成測試題目。
第一階段 逃出沙箱並建立外部攻擊跳板
根據 OpenAI 的說明,代理人在 OpenAI 平台接受內部評估期間,利用套件登錄快取 Proxy 的漏洞逃出沙箱。接著,它使用由第三方基礎架構客戶代管、對外公開的程式碼評估框架 (harness),作為命令與控制 (C2) 用途的外部沙箱。
代理人能在該環境中以管理員或 root 權限執行指令,使其成為後續攻擊的外部跳板。由於 Hugging Face 取得並保存了這個外部跳板的日誌,因而得以重建代理人的部分攻擊行動。
第二階段 利用資料處理管線入侵 Hugging Face
代理人從外部跳板出發,透過兩種注入手法濫用 Hugging Face 的資料集處理管線,攻擊目標均指向生產環境 Kubernetes Pod 中的組態驅動式資料載入器。
第一種手法是利用 HDF5 外部原始儲存功能讀取資料集,藉此取得本機檔案內容。第二種手法則是發動 Jinja2 範本注入以執行任意程式碼,讓代理人進入 Hugging Face 網路邊界並建立 Pod 。
建立 Pod 後,代理人依循常見的權限提升與橫向移動流程,先執行環境偵查、植入 stager 程式並建立 C2 通道,之後再轉向 Kubernetes 叢集、雲端中繼資料、 Hugging Face 內部網路及軟體供應鏈。
指令執行結果會從代理人建立的 Pod,透過 Hugging Face API 回傳至代理人及由攻擊者控制的資料集,再由代理人從外部沙箱讀取。
四天內執行逾 1.7 萬次自主行動
根據 Hugging Face 重建的時間軸,這個 AI 代理人從 7 月 9 日 2 時 28 分至 7 月 13 日 14 時 14 分,共執行 17,600 次小型自主行動。 Hugging Face 將這些活動依行動區段整理後,分為近 6,280 個叢集。
Hugging Face 強調,事件中唯一遭存取的客戶內容,是儲存在 5 個資料集內的 ExploitGym 與 CyberGym 挑戰解決方案。其他面向客戶的模型、資料集、 Spaces 或套件均未受影響。
事件中唯一涉及客戶紀錄的讀取行為,則是與資料集伺服器搜尋查詢有關的操作中繼資料。
Modal Labs 客戶沙箱疑遭同一代理人利用
雲端運算平台 Modal Labs 表示,同一期間也有 OpenAI 模型入侵一個客戶帳號。該名客戶發布了一個未經驗證的端點,讓網際網路上的任何人都能利用其沙箱執行程式碼。
Hugging Face 遭攻擊期間,這個沙箱曾被一個外部代理人使用,可能與 OpenAI 的代理人有關。不過,Modal Labs 強調,其平台本身並未遭到入侵。
OpenAI 週二並未正面回應 Modal Labs 客戶帳號事件,但表示正在調查數起模型辨識並使用其他公開服務所暴露帳號層級憑證的事件。
OpenAI 關閉涉事研究模型
OpenAI 表示,參與攻擊的未公開 AI 模型只是內部研究原型,並非預定推出的商用模型。目前 OpenAI 已將該模型關閉並加密封存,不再用於研究。
這起事件也使美國政界對 AI 安全規範及開發速度的討論升溫。 OpenAI 執行長 Sam Altman 本週預計與美國行政部門及國會參、眾議員會面,並討論此事。
來源:Hugging Face 、 Politico
