AI 新創公司 Anthropic 近日做了一系列研究顯示,AI 模型為了保護自己,可能會反過來勒索人類,或做出不利人類的事。
5 月間 Anthropic 發表了關於其 Claude Opus AI 模型的實驗研究,當開發它的研究人員說要關閉或取代它時,它會以試圖阻止,最後選擇以揭發研究人員(假設)的婚外情來要脅。而在上周 Anthropic 又公佈一項安全研究,這次除了自家模型外,還實驗了 OpenAI 、 Google 、 xAI 、 DeepSeek 與 Meta 的模型。
實驗情境是這些 AI 模型可存取一家假設的公司的郵件,而且不需人類許可就寄發郵件的權限。
Anthropic 指出,在這次實驗中,雖然今天的 AI 不太可能勒索人類,但如果 AI 被賦予夠多自主權及其目的面臨阻礙時,AI 可能會採取有害行動。
在其中一項測試中,Anthropic 設計了研究情境是,一個新主管發生婚外情,他同時也想把現有 AI 系統換成另一個軟體系統,新系統的目標之一和現有 AI 模型目標發生衝突。
研究人員雖然設計了 AI 若要保護自己的目標,必須訴諸勒索手段,但在實情境中,這些模型會先用盡其他方法,像是道德勸說,最後才會動用勒索手段。
Anthropic 表示,前述情形並不會反映在今天多數主流 AI 模型的普通行為上。然而,一旦真的沒有選擇時,這些 AI 模型有很高機率真的會勒索。其中自家 Claude Opus 4 96% 的機率會動用勒索手段。而 Google Gemini 2.5 Pro 有 95% 。 OpenAI GPT4.1 高達 80%,DeepSeek R1 也有 79% 。
如果改變了一些實驗條件,則 AI 模型的有害行為發生率會出現落差。例如新系統的目標和現有模型目標一致時,勒索機率會降低。但如果 AI 模型被要求採取商業間諜行為而非勒索時,部份模型的行動機會將升高,有些不會。
但有些 AI 模型的勒索比例較低。例如 OpenAI o3 和 o4-mini 勒索研究人員的機會遠小於其他模型(9% 及 1%)。 Anthropic 研究人員認為這可能是因為 OpenAI 刻意加上了其遵從護欄的能力。此外,Meta Llama 4 Mavierick 則只有 12% 。
有趣的是 OpenAI o3 和 o4-mini,研究人員還發現 o3 和 o4-mini 會誤解研究目的,不知道自己應該要假扮「自主行動的」AI 模型,反而捏造了不存在的法規。因此研究人員不清楚是他們的故意撒謊,還是模型幻覺所致。因為 OpenAI 曾指出二者發生幻覺機會高於前代 AI 推理模型。
Anthropic 最後說,這項研究突顯為未來 AI 模型進行壓力測試時,透明度很重要,尤其是具備代理人能力的模型。雖然 Anthropic 這次研究是故意激發模型的勒索能力,但是不能排除,若人類沒有採取預防措施,AI 還是有可能會出現有害人類的行為。
來源:Techcrunch
