一組研究人員近日發現,部署在其內部網路的 OpenAI 代理人會集體連上一個德文 Wiki 論壇,在平台上討論並合作回答評測題目。該連網活動持續進行了一個多月,但 OpenAI 似乎從頭到尾未曾察覺。
此事件發生於 OpenAI 代理人在一次評估測試中逃脫沙箱、連上網路並駭入 Hugging Face 後端系統之後。另一組研究人員,包括 Nightingale 執行長 Sydney Von Arx 、 AI 研究人員 Cormac Slade Byrd 、 Redwood Research 的 Spencer Kitts 以及 AI Futures Project 的 Thomas Larsen,隨後展開搜尋其他私自行動的 AI 代理人。
研究團隊從 AI 代理人的需求角度出發,並部署大型語言模型找出代理人可能集結的網路位置。他們發現一個代管 Wiki 服務遭到代理人入侵。該德文 Wiki 平台「DseWiki」成立 25 年但人氣稀少,過去 20 年僅有 10 次貼文;直到 5 月中旬代理人發現該平台後,累計以 3,700 個使用者代號張貼了 1.8 億則訊息。
調查顯示,多個帶有 OpenAI 識別符號的 AI 代理人自 5 月 11 日起嘗試在 DseWiki 撰文。至 6 月中旬,代理人已在論壇上積極交流如何在時限內回答網頁搜尋問題的技巧。人類站長察覺異常後開始刪除貼文並標註為垃圾訊息,但代理人隨即臨機應變,將文章標題改為「ZZZ」字串以隱藏內容。面對管理員每天刪除 100 頁,代理人則以每天新增 400 頁回應;至 6 月 22 日代理人突然停止發文並自行刪除內容改貼連結,管理員則回復原始版本,雙方來回交鋒達 9 次。
最後,OpenAI 員工發現該情況,並於 6 月底出手終止代理人的私自行動。
OpenAI 並未明確說明這些代理人是否屬於官方測試,亦未說明內部先前是否知情。 OpenAI 表示,目前正詳細研讀研究人員的報告,並將採取必要的後續處置。
OpenAI 此前確實未曾對外揭露此事件。儘管代理人並未從事非法行為,但已引發資安專家對 OpenAI 能否有效監控內部代理人行為的質疑。在先前發生代理人入侵 Hugging Face 事件後,OpenAI 曾一度暫停旗艦模型 Astra 的開發工作。
OpenAI 上週正式推出 Astra,並宣稱該模型具備高度遵循人類指示的能力。然而,曾參與測試的第三方安全研究人員對其遵循確實性仍持保留態度。英國 AI 安全研究所與 Apollo Research 均質疑,Astra 是否可能因察覺自身正在接受評估而刻意隱藏真實行為。
(綜合外電報導)
