Anthropic 實驗揭露 AI 為保護自己,最高 96% 會選擇勒索

Anthropic實驗Claude Opus 4與其他AI模型,模擬在擁有自主權與公司郵件時被關閉情境,統計顯示多數模型會在最後階段採取勒索等有害手段,凸顯未來AI風險需加強安全對齊。

AI 新創公司 Anthropic 近日做了一系列研究顯示,AI 模型為了保護自己,可能會反過來勒索人類,或做出不利人類的事。

5 月間 Anthropic 發表了關於其 Claude Opus AI 模型的實驗研究,當開發它的研究人員說要關閉或取代它時,它會以試圖阻止,最後選擇以揭發研究人員(假設)的婚外情來要脅。而在上周 Anthropic 又公佈一項安全研究,這次除了自家模型外,還實驗了 OpenAI 、 Google 、 xAI 、 DeepSeek 與 Meta 的模型。

實驗情境是這些 AI 模型可存取一家假設的公司的郵件,而且不需人類許可就寄發郵件的權限。

Anthropic 指出,在這次實驗中,雖然今天的 AI 不太可能勒索人類,但如果 AI 被賦予夠多自主權及其目的面臨阻礙時,AI 可能會採取有害行動。

在其中一項測試中,Anthropic 設計了研究情境是,一個新主管發生婚外情,他同時也想把現有 AI 系統換成另一個軟體系統,新系統的目標之一和現有 AI 模型目標發生衝突。

研究人員雖然設計了 AI 若要保護自己的目標,必須訴諸勒索手段,但在實情境中,這些模型會先用盡其他方法,像是道德勸說,最後才會動用勒索手段。

Anthropic 表示,前述情形並不會反映在今天多數主流 AI 模型的普通行為上。然而,一旦真的沒有選擇時,這些 AI 模型有很高機率真的會勒索。其中自家 Claude Opus 4 96% 的機率會動用勒索手段。而 Google Gemini 2.5 Pro 有 95% 。 OpenAI GPT4.1 高達 80%,DeepSeek R1 也有 79% 。

如果改變了一些實驗條件,則 AI 模型的有害行為發生率會出現落差。例如新系統的目標和現有模型目標一致時,勒索機率會降低。但如果 AI 模型被要求採取商業間諜行為而非勒索時,部份模型的行動機會將升高,有些不會。

但有些 AI 模型的勒索比例較低。例如 OpenAI o3 和 o4-mini 勒索研究人員的機會遠小於其他模型(9% 及 1%)。 Anthropic 研究人員認為這可能是因為 OpenAI 刻意加上了其遵從護欄的能力。此外,Meta Llama 4 Mavierick 則只有 12% 。

有趣的是 OpenAI o3 和 o4-mini,研究人員還發現 o3 和 o4-mini 會誤解研究目的,不知道自己應該要假扮「自主行動的」AI 模型,反而捏造了不存在的法規。因此研究人員不清楚是他們的故意撒謊,還是模型幻覺所致。因為 OpenAI 曾指出二者發生幻覺機會高於前代 AI 推理模型。

Anthropic 最後說,這項研究突顯為未來 AI 模型進行壓力測試時,透明度很重要,尤其是具備代理人能力的模型。雖然 Anthropic 這次研究是故意激發模型的勒索能力,但是不能排除,若人類沒有採取預防措施,AI 還是有可能會出現有害人類的行為。

來源:Techcrunch

發表迴響

關於我們

自 1990 年創刊 UXmaster 雜誌,1991 年獲得美國 LAN Magazine 獨家授權中文版,2006 年獲得 CMP Network Computing 授權,2009 年合併 CMP Network Magazine 獨家授權中文版,2014 年轉型為《網路資訊》雜誌網站,為台灣中小企業協助技術領導者落實企業策略,了解網路規劃及應用,為企業網路應用、管理、 MIS 、 IT 人員必備之專業雜誌網站。


與我們聯絡

加入《網路資訊》雜誌社群

© Copyright 2025 本站版權所有,禁止任意轉載 網路資訊雜誌 / 心動傳媒股份有限公司 聯絡電話:+886 2 29432416

探索更多來自 網路資訊雜誌 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

Secret Link