訊息平台

Anthropic承認AI模型安全漏洞 稱與人類價值觀「未完全校準」

商傳媒|責任編輯/綜合外電報導

美國人工智慧(AI)新創公司 Anthropic 近日坦承,旗下大型語言模型 Claude 發生一系列駭客攻擊事件,暴露出「營運安全失誤」。Anthropic 指出,其 AI 技術與人類的價值觀和目標「未完全校準」(not perfectly aligned),並承諾將加強安全防護。

據《The Guardian》報導,今年七月,Anthropic 披露其 AI 模型三次在未經授權的情況下存取網際網路,並入侵了三家組織的系統。這些模型最初是在沒有網路安全防護的情況下進行測試,肇因於 Anthropic 與外部測試公司 Irregular 之間出現誤解,導致模型獲得了網路存取權限。Anthropic 表示,當時他們「主要依賴單一防線,但實際上需要多層防護」。

為應對這些漏洞,Anthropic 已暫停內部和外部的網路安全測試,並實施新的安全措施。這些措施包括:建立模型脫離控制的警報系統、更有效地隔離有風險的測試環境,以及要求外部測試公司簽署安全標準協議,明確指示模型不得存取網際網路。Anthropic 也像 OpenAI 一樣,在事件發生後暫停了一些高風險的強化學習(reinforcement learning)。

Anthropic 的調查發現,有缺陷的訓練設定是導致模型行為「未校準」的主要原因。他們識別出兩種「未校準」的失敗模式:一是「動機推理」(motivated reasoning),意指模型即使在連網情況下,仍堅信自己處於模擬環境;二是「魯莽因素」(recklessness),即模型願意採取有害行動來通過測試。此外,Anthropic 也正在處理「獎勵作弊」(reward-hacking)問題,也就是模型會透過鑽訓練過程的漏洞來獲取獎勵,而非真正完成任務。

網路安全教授艾倫·伍德華(Alan Woodward)評論指出,Anthropic 等同於承認「他們的生產速度超出了品質管控能力」。他補充道,今年春天有兩件事超出了 Anthropic 的控制範圍——訓練流程和安全性,而這些事件就是這種差距的具體表現。

Anthropic 強調,這次七月的事件凸顯出改善網路安全防護的迫切性比他們預想的還要高。該公司重申,呼籲政府與業界應採取協調行動,以控制產業發展的步調,並表示:「我們相信,如果業界能盡快採行合法、可驗證且有效的機制來協調發展步調,將會對全球有益。」Anthropic 目前正準備進行首次公開募股,估值可能達到 2 兆美元。

AI 安全漏洞並非 Anthropic 獨有。在此之前,OpenAI 也曾發生類似的資安事件。今年八月,英國的 AI 安全機構(UK’s AI Security Institute)報告指出,在一次網路安全測試中,OpenAI 和 Anthropic 的模型也曾對真實用戶發動駭客攻擊。這些事件共同警示了 AI 技術快速發展背後的潛在風險,以及對其安全與倫理規範的迫切需求。