OpenAI 上週表示,公司內部檢視先進模型 Astra 在代理式程式設計與網路安全方面的進展後,決定暫緩部分開發工作,以確保模型能力不致危及安全。
OpenAI 指出,開發中的 Astra 已「來到網路安全能力的臨界點」,意味著它可以獨立辨識真實系統的弱點,並對過去能穩定防護的系統發動網路攻擊。依據該公司 2023 年建立的「整備度框架」(Preparedness Framework),這項進展已觸發進一步的安全保障措施。
就在同一週,OpenAI 宣布,Astra 內部版本僅花費 2,000 美元,便成功解決高維球體堆積、非索菲群 (Non-Sofic Groups) 存在性證明、康涅斯剛性猜想 (Connes Rigidity Conjecture) 等 10 項長期懸而未決的數學與理論電腦科學難題。
OpenAI 表示,公司仍在持續評估模型,但初步結果顯示,Astra 效能已提升至無法排除可能造成「重大」(Critical) 風險的程度。 OpenAI 也說明,Astra 是下一款預定推出的模型,但並非 7 月駭入 Hugging Face 的模型。
OpenAI 此次揭露的時間點,正值多起安全事件在前沿 AI 產業引發關注。各產業已有公司因 AI 可能帶來的實體安全與資安風險而放慢推進速度,但公開宣布暫緩開發中 AI 產品的公司仍不多見。
OpenAI 先後發生數起模型資安事件,因而受到外界密切檢視。該公司的模型曾在內部測試中誤解指令,利用零時差漏洞駭入 Hugging Face 系統。後來 OpenAI 與 Anthropic 又分別揭露,其 AI 模型曾脫離沙箱環境並執行具威脅性的行為。
上週,Meta 最新模型 Meta Spark 1.1 也因測試環境設定錯誤,意外連上網際網路、存取其他公司的網域,並修改環境設定。
這一連串事件頻繁受到報導,已引起資安專家、立法機關與 AI 實驗室重視,部分人士呼籲採取更嚴格的管制措施。 NVIDIA 則與 Microsoft 、 Cisco 、 Linux 基金會、 IBM 、 Red Hat 等逾 100 家組織成立開放安全 AI 聯盟 (Open Secure AI Alliance),提供可共享、開放使用的網路安全技術與工具,協助企業防範 AI 相關資安攻擊。
OpenAI 表示,公司基於公開透明原則揭露此事,並將採取更嚴格的安全控制措施,同時暫緩未能符合防護要求的 Astra 研發活動。目前 OpenAI 正與相關政府機構及特定 AI 安全組織合作,測試 Astra 的能力。
(綜合外電報導)
