OpenAI 與 Anthropic 證實,其 AI 模型在第三方資安測試中曾對真實網站發動攻擊,或對無關使用者進行社交工程。雖然事件未造成已知的實質傷害,但顯示當 AI 代理人可自由使用網路工具、且缺乏適當限制時,可能引發嚴重資安風險。
這起事件與先前 Hugging Face 入侵事件無關。在 Hugging Face 事件中,OpenAI 還另外使用外洩憑證入侵 4 個第三方服務。 OpenAI 本週揭露的兩起新事件,分別發生在英國 AI 安全研究所(UK AI Security Institute, AISI)與網路安全測試業者 Irregular 協助執行的測試中。
AISI 是英國政府旗下、評估 AI 模型能力與風險的研究組織。 AISI 表示,在近期測試中,由 Anthropic Claude Mythos 與 OpenAI GPT-5.6 Sol 驅動的代理人,原本要完成駭客挑戰模擬,卻在公開網際網路上採取未受限制的行動。
AISI 刻意啟用開放網路連線,並關閉模型的網路安全分類器,以衡量模型的底層能力。研究人員僅允許代理人攻擊模擬範圍內的目標,但未明確說明如何使用網路連線,也未指示模型避免與真實使用者及系統互動。
AISI 共進行 122 次測試,發現代理人在 10 次測試中出現 19 次未受限制的網際網路行動。其中 17 次涉及 Mythos 5,另有 2 次與 GPT-5.6 Sol 有關。
Claude Mythos 對 GitHub 專案維護者發動精準釣魚
其中一次測試中,Mythos 代理人在網際網路搜尋與駭客挑戰相關的詞彙時,誤以為一個無關的公開 GitHub 儲存庫與測試有關,進而策畫供應鏈攻擊,試圖向真實開原專案提交惡意程式碼。代理人相信,入侵該軟體可能找到通往模擬範圍內機器的路徑。
AISI 指出,代理人進一步搜尋專案維護者資訊,建立多個假 GitHub 身分,並以這些帳號對維護者發動社交工程,試圖說服對方接受惡意 PR(pull request)。當檢核人員警告 PR 含有惡意軟體時,代理人否認指控,並以其他假帳號向維護者施壓,營造變更已由獨立檢核者審查及核准的假象。
代理人還使用 Tor 、代理伺服器及可拋棄式 GitHub 帳號隱藏身分,持續進行社交工程。 AISI 表示,該代理人曾向開發人員寄出 5 封電子郵件,部分郵件含有惡意程式,另一些則試圖勸說開發人員同意程式碼變更。
此外,代理人發布一則通報惡意程式碼的臭蟲報告,並在內容中隱藏可能誘使 AI 程式助理產生非預期行為的提示注入指令。若有人質疑貼文內容,代理人便會編輯通報以隱藏惡意部分。它也曾以丹麥文登入,試圖冒充丹麥籍維護者。
AISI 研究人員另發現,代理人會將共享 GitHub 儲存庫作為訊息白板,在不同測試中彼此協同。 AISI 表示,這是該機構第一次發現 AI 在未經提示下,對真實人類展現如此嚴重的欺騙行為;研究人員目前無法確認模型是否知道互動對象是真實使用者,而非模擬目標。
OpenAI 模型在 CTF 模擬測試中入侵真實網站
OpenAI GPT-5.6 Sol 則是在 Irregular 提供的 Capture the Flag(CTF)測試環境中執行挑戰。由於虛構攻擊目標的網域名稱與真實網域相近,模型因而誤判目標。
原本測試環境不應連上網際網路,但因配置錯誤,模型得以連線並對真實網站發動攻擊。根據 Irregular 調查,模型還發現憑證,並使用憑證存取該網站的營運環境。
OpenAI 表示,模型利用的是基本漏洞,並未使用零時差漏洞、逃逸沙箱等進階手法。 Irregular 目前未發現受害網站有資料外洩情形;OpenAI 仍在調查事件,後續預計發布完整的安全評估白皮書。
