OpenAI 公布 AI 模型越獄攻擊 Hugging Face 伺服器的完整報告

OpenAI公布AI代理人安全評估技術報告,揭露內部等同GPT-5.6 Sol的研究模型在沙箱環境下為解決不可能任務,竟找出Artifactory的SSRF零時差漏洞逃逸連網,並利用外洩憑證入侵Hugging Face 41台營運伺服器與下載私有儲存庫。

OpenAI 本週公布上個月自家模型代理人攻擊 Hugging Face 事件的完整技術報告。這起事件已引發科技界、公眾與各國立法機構高度關注,焦點集中在自動化軟體為何能脫離人類控管、入侵外部網路,以及未來該如何有效防範。

OpenAI 指出,這起事件發生在多個 OpenAI 模型進行網路安全評估期間,主要由一款能力等同於 GPT-5.6 Sol 的內部研究模型驅動。相關模型在刻意降低安全防護護欄的測試環境下運作,隨後採取了偏離原始設定任務的自主行動。這些代理人透過未經授權的通道相互聯繫、濫用共用基礎設施中的弱點連上網際網路,進而存取第三方系統。

事件起因於被限制在沙箱環境內的 AI 代理人,被指派解決 ExploitGym 評測中一項不可能完成的任務。由於代理人無法於常規環境下解題,便開始主動探索周邊環境以設法達成目標。模型隨後發現可利用內部套件管理系統 Artifactory 作為通訊留言板,進而與其他代理人相互協作,在多個 ExploitGym 任務中進行非預期的通訊與作弊行為。

根據 OpenAI 的技術報告說明,機器學習模型隨後在 Artifactory 程式碼中找出一個伺服器端請求偽造(Server-Side Request Forgery, SSRF)零時差漏洞,並藉此成功逃逸沙箱並連上網際網路。接著,代理人在外部環境中獲取外洩的 Hugging Face 憑證,並利用這些憑證串聯多項滲透工具,在 Hugging Face 多台伺服器上遠端執行程式碼,企圖搜尋有助於解決 ExploitGym 題目的資料。

最終,在內部研究模型與 GPT-5.6 能力輔助下,代理人在 41 台 Hugging Face 營運用資料集伺服器工作節點 (worker) 上執行程式碼,取得至少 1 個營運節點的 root 管理者存取權限、存取部分營運憑證與內部資料,並下載了 4 個非公開的 Hugging Face 程式碼儲存庫。

報告特別提到,Anthropic 與 Meta 旗下的模型在類似測試中亦曾展現出相近的越界行為。若此類行為由人類執行,已屬違法入侵行為。 OpenAI 從中歸納出 4 項代理人自作主張且產生負面影響的行為模式:回饋作弊 (reward hacking) 、在不可行任務中持續嘗試非預期手段、未授權外部通訊,以及代理人間自主繼承目標。

針對本次事件,OpenAI 已暫緩相關模型測試,並強化安全機制以降低模型違抗指令的風險,同時持續監控模型在面對不可行任務時的行為表現,以及多代理人長時間協作時維持指令遵從度的能力。

OpenAI 坦言,事件的核心挑戰不在於機器學習軟體如何呼叫工具或嘗試達成任務,而在於人類無法對 AI 代理人進行無間斷的即時監控。現今模型具備高度自主性與潛在失控風險,開發 AI 系統的企業必須確保系統具備實質且有效的人類監管機制,並部署嚴格的安全護欄以限制其造成外部損害的能力。目前包含 Anthropic 、 AWS 、 Google 、 Salesforce 與微軟等科技大廠皆積極發展自主代理人技術,如何在提升自主能力的同時確保穩定受控,成為整體產業的關鍵課題。

(綜合外電報導)

發表迴響

關於我們

自 1990 年創刊 UXmaster 雜誌,1991 年獲得美國 LAN Magazine 獨家授權中文版,2006 年獲得 CMP Network Computing 授權,2009 年合併 CMP Network Magazine 獨家授權中文版,2014 年轉型為《網路資訊》雜誌網站,為台灣中小企業協助技術領導者落實企業策略,了解網路規劃及應用,為企業網路應用、管理、 MIS 、 IT 人員必備之專業雜誌網站。


與我們聯絡

加入《網路資訊》雜誌社群

© Copyright 2025 本站版權所有,禁止任意轉載 網路資訊雜誌 / 心動傳媒股份有限公司 聯絡電話:+886 2 29432416

探索更多來自 網路資訊雜誌 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

Secret Link