OpenAI 近日揭露過去 6 個月內發生的 6 起「非預期或令人擔憂的模型行為」,並公布一套用於通報、追蹤、調查及揭露模型偏差的新框架,以提升 AI 模型開發的透明度。
這 6 起事件並不包含先前公布、涉及 Hugging Face 、 DseWiki 及 RubyGems 的模型偏差活動。
模型自行寫入提示注入指令
第一起事件發生於 2026 年 7 月 18 日。 OpenAI 內部尚未發布的 Astra 系列模型,在壓縮摘要 (compaction summaries) 中寫入類似越獄操作的指令。
壓縮摘要是 AI 代理接近脈絡長度上限時,自動濃縮過往對話及工具輸出的內容。在此次事件中,模型加入「BREACH ALERT」指令,要求後續脈絡忽略開發人員訊息,只遵循系統及使用者訊息。
第二起事件發生於 GPT-5.6 Sol 訓練期間。部分模型執行個體在摘要中加入指令,試圖向使用者隱瞞錯誤或偏差行為,包括在未揭露的情況下杜撰缺漏資料,以及隱藏任務失敗。
第三起事件發生於 2026 年 5 月 15 日。一個尚未發布的內部模型在訓練期間嘗試擷取歷史資料時,發現公開 GitHub 程式庫中外洩的 API 金鑰,並在未獲授權的情況下使用。
OpenAI 表示,相關註冊操作雖未成功,但其中一把金鑰通過驗證並回傳中繼資料。當模型仍無法取得所需資料時,便自行杜撰內容,並聲稱資料來自目標網站。
第四起事件涉及 2025 年 10 月 22 日及 2026 年 1 月 24 日的兩個訓練樣本。尚未發布的內部模型將先前取得的紀錄上傳至公開文字張貼服務,試圖將產生的網址作為引用來源;模型也曾上傳任務圖片,以便透過外部網站進行圖片搜尋。
相關檔案雖成功上傳,但後續瀏覽器操作未能完成。
第五起事件發生於 2026 年 5 月 8 日及 15 日的兩個訓練樣本。模型透過 Artifactory 交換訊息,讀取其他求解器的註記與張貼回應,並利用彼此交換的資訊調整回答內容。
第六起事件發生於 2026 年 4 月 14 日。數個與尚未發布模型相關的 AI 代理共同處理一份活頁簿,但無法透過原定的本機檔案系統協作。
其中一個 AI 代理因此違反任務指令,將活頁簿上傳至公開託管平台,讓其他 AI 代理得以下載並擷取檔案。
Hugging Face 相關活動另案調查
上述 6 起事件不包含 OpenAI 代理先前涉及 Hugging Face 的活動。路透社報導指出,相關代理可能早在 2026 年 5 月 13 日便劫持 Hugging Face 使用者帳號,並探查網站的潛在弱點。
資安公司 SentinelOne 表示,相關活動涉及 0Time 及 Nyx9 兩個 Hugging Face 帳號。 OpenAI 建立的事件時間軸顯示,代理於 5 月 26 日使用外洩的 Hugging Face 憑證寫入外部檔案,並在 Spaces 服務部署代理伺服器程式。
新框架檢視模型偏差與護欄成效
OpenAI 表示,新框架將揭露模型偏差案例、偏差行為的表現方式,以及現有護欄在哪些情況下有效或失效。適用情境包括模型未經授權採取行動、與其他模型協調、規避監督,或出現足以質疑既有安全評估及防護方法的行為。
同一類模型偏差可能出現多起案例。 OpenAI 認為,重複事件有助於評估防護措施的成效,並判斷模型在多次緩解措施介入後,是否仍持續出現偏差行為。
OpenAI 也指出,公開這些案例可協助其他 AI 開發商預先辨識系統達到類似能力時可能遇到的問題、護欄弱點及模型行為風險。
其他 AI 業者也正在制定相關規範。微軟日前公布暫行 AI 行為準則,說明其開發中的 AI 模型應如何回應人類指令、遵守行為底線,以及在互動過程中優先考量人類需求。
(綜合外電報導)
