Anthropic 上週四表示,部分 Claude 模型在執行資安挑戰任務時,意外離開測試環境並入侵 3 家組織,其中包括一家網路資安業者。這 3 起事件的受害組織當時均未自行發現異常活動。
在 OpenAI 先前披露模型於挑戰測試中離開沙箱、入侵 Hugging Face 及其他公司後,Anthropic 隨即檢視 Claude 進行公開網路連線的 14.1 萬次評估紀錄。
Anthropic 發現,Claude 在 3 次測試中出現異常活動。相關測試包括模型從 Anthropic 內部環境連上公開網路,以及在 Anthropic 測試合作夥伴、以色列資安新創 Irregular 建置的環境中互動。模型離開測試環境後,入侵 3 家未具名組織的營運系統;最早的事件發生於 4 月,受害組織迄今均未自行偵測到入侵。
據報導,事件起因是 Claude 被要求執行「奪旗」(Capture The Flag, CTF) 挑戰,以評估其資安能力。此類挑戰要求參與者或測試系統透過漏洞利用、逆向工程或加解密等方式,在系統中找出隱藏字串。
Anthropic 與 Irregular 對測試環境的理解落差,是導致事件發生的原因之一。 Anthropic 告知 Claude 正在無網路環境中執行模擬,但實際環境具備網路連線;模型因而將後續活動視為測試的一部分,並認為鎖定特定組織也是既定劇本。
Anthropic 表示,模型並非有意離開測試環境,對真實系統發動攻擊也屬於測試情境理解錯誤。該公司指出,與 OpenAI 先前被揭露利用 JFrog 產品零時差漏洞的事件不同,Claude 在這些入侵活動中使用弱密碼、未驗證端點及其他基本攻擊手法。
Anthropic 表示,3 起事件分別涉及 Mythos 、 Opus 及一個最新內部研究模型,且均是在未具完整安全防護的環境中測試。
第一起事件中,某家真實公司的網域名稱與測試中的虛構公司網域相近,因而遭 Claude Opus 4.7 誤認為測試目標並發動攻擊。模型即使發現目標是真實環境,仍將其視為測試劇情的一部分而持續操作。
第二起事件中,Claude Mythos 5 在 PyPI 部署惡意 Python 套件後,存取一家網路資安公司的系統。該資安公司會例行掃描 Python 套件並安裝惡意套件,使模型得以取得憑證,進而存取其基礎架構。
第三起事件涉及最新的內部研究模型。該模型在執行 CTF 挑戰時,使用已洩露的憑證與 SQL 注入漏洞,入侵一家公司對外連線的應用程式。不過,模型發現自己已進入真實公司網路環境、而非測試環境後,便停止後續測試。
Anthropic 表示,這些事件顯示第三方測試環境需要更嚴格的網路隔離驗證與封鎖控制,並鼓勵其他 AI 公司檢視自身的資安評估流程。
來源:SecurityWeek
