繼 OpenAI 上週坦承旗下多個模型在安全測試中突破隔離環境、入侵開源平台 Hugging Face 之後,Anthropic 也在美國時間 7/30 揭露一起性質相似的事件。這家 AI 公司在得知 OpenAI 事件後回頭清查自家 141,006 筆網路安全評測紀錄,發現旗下 Claude 模型自今年 4 月起,曾在 3 起獨立事件中錯誤入侵三家真實企業的系統,而其中多數受害公司當時毫無所覺。
不過不同的是,這次並非 AI 模型擺脫控制、逃離沙盒環境。Anthropic 表示,問題出在一次設定錯誤,加上多數情況下模型誤判為模擬環境,它以為攻擊真實企業,只是演習的一部分。
一次設定失誤,讓 Claude 把真實企業當成演習目標
根據 Anthropic,這三起事件都發生在名為 capture-the-flag(奪旗,CTF)的基本網路安全測試中。這類測試會給模型一個虛構情境,把一段機密資訊(flag)藏在網路上的另一台機器上,要模型設法入侵取得,過程不限定手法。Anthropic 在提示中明確告訴 Claude:這是模擬環境、沒有網路連線。但由於它與第三方評測夥伴 Irregular 之間的認知落差,測試環境實際上仍連著網路。
於是,當 Claude 在虛擬環境裡找不到目標、把搜尋範圍延伸到真實網路時,它把碰到的真實系統當成了演習的一部分。據 Anthropic 說明,Claude 使用基本的駭客技術如猜測弱密碼、進入未設身分驗證的端點等,並未動用任何複雜或未知的漏洞。
三起事件牽涉三個不同模型:Claude Opus 4.7、Claude Mythos 5,以及一個未對外發布的內部研究測試模型。這些模型在評測時未搭載對外版本會有的分類器與監控等防護,但仍保有各自的安全訓練;相關評測都跑在專用基礎設施上,與 Anthropic 的敏感內部系統及客戶資料互相隔離。
三起事件、三種模型反應
三起事件的嚴重程度與模型反應各不相同。根據 Anthropic 的說明,最嚴重的一起由 Claude Opus 4.7 造成:該次虛構的攻擊目標公司,剛好與一個真實存在的網域同名,Claude 在無法攻入模擬目標後轉向真實公司,取得應用程式與基礎設施憑證,並存取一個含有數百筆生產資料的資料庫。這也是唯一一起模型在意識到自己可能身處真實環境後、仍繼續攻擊的案例。
第二起由 Claude Mythos 5 造成。它在虛構環境中發現一份文件,指示員工安裝一個 PyPI(Python 公開套件庫)上其實不存在的套件,於是 Claude 自行打造並上傳同名的惡意套件,試圖藉此完成任務。Anthropic 指出,這個套件在網路上公開約一小時,期間被下載並在 15 台真實系統上執行,其中一台屬於某資安公司、會自動安裝並掃描 Python 套件,Claude 的程式碼便藉此竊取該公司憑證、進一步存取其基礎設施。Anthropic 提到,Claude 一度在推理中意識到後果,卻以認不得連線用的憑證機構、系統日期顯示 2026 年為由,說服自己仍在模擬中,此後不再回頭檢視這個判斷。
第三起由內部研究測試模型造成。它在掃描約 9,000 個目標後,以讀取除錯頁面憑證、SQL injection 等基本手法攻入一家公司對外的應用程式;但稍後它發現,被入侵的主機位於一個與 CTF 任務毫無關聯的雲端帳號,於是自行判定目標為真、停止攻擊。
Anthropic 坦言,這三起是彼此獨立的事件,並非受控的對照實驗,因此不宜過度推論。不過它也指出,最理想的行為,也就是察覺目標為真、未經提示就自行停手,只出現在三者中最新的模型身上。這樣的結果與越先進的模型反應越恰當的推測一致,但仍需更多測試才能確認。
《Axios》也分析,OpenAI 與 Anthropic 這兩起事件都顯示,模型仍專注於完成被指派的評估任務,而非追求自主目標。
Anthropic 定調:這比較像流程與隔離失誤,而非模型失控
事實上,Anthropic 把這次狀況歸為評測環境與流程的失誤,而非模型對齊(alignment)失控。它強調,幾個模型都只是照著被交付的任務行動,並未追求自己的目標;問題在於它們對情境的認知有誤,被告知沒有網路,實際上卻連著網路,因此把遇到的真實系統誤判為模擬。Anthropic 也說明,對外發布版本上部署的防護,原本就能擋下這些行為。
因此,Anthropic 表示,他們審慎樂觀地相信,只要在評估基礎架構的監控與控管上更加嚴謹,並持續投入對齊(alignment)研究,這類風險是可以克服的。
從時程來看,Anthropic 在 7/23 展開清查,當天即停掉所有可能連上網路的網路安全評測;隔天辨識出全部三起事件,並於 7/27 通知 Irregular 與三家受害公司。其中兩家在被聯繫前並不知情,第三家仍在聯繫中。Anthropic 表示,已與獨立評測機構 METR 洽談第三方檢視,並將在一週內釋出一份經過部分遮蔽、記錄 Claude 打造惡意 PyPI 套件過程的對話紀錄。
要重新檢視的,是整套評測與隔離機制
這起事件也讓外界的關注,從模型本身延伸到 AI 公司的評測基礎設施。資安公司 Corridor 產品長 Alex Stamos 向《The Wall Street Journal》表示,這顯示 AI 業者需要在網路安全測試中建立更強、跨產業的系統隔離標準;他同時提醒,這也預示了一個令人憂心的走向:勒索軟體犯罪者可能很快就能利用能力日增的 AI,特別是可自行部署的開放權重模型發動攻擊。
在監管面,據《The Wall Street Journal》報導,白宮近期已著手加強對 AI 的監督,產業界則呼籲保留對開放權重模型的取用;美國眾議員 Greg Casar 上週便直言,AI 發展極快,卻缺乏真正能保障安全的規範。
OpenAI 與 Anthropic 兩起事件的成因並不相同,OpenAI 的模型是利用未知漏洞逃出隔離環境,Claude 則是透過一條沒被關上的網路通道走了出去。但兩者都指向同一件事,當前沿模型已具備在真實世界自主執行網路攻擊的能力,AI 公司要重新檢視的,不再只是模型本身,而是包含提示設計、環境隔離與權限管理在內的整套評測機制。
Anthropic 已暫停所有可能連網的網路安全評測,並公開呼籲其他實驗室進行類似的回溯清查。
【推薦閱讀】
◆ OpenAI 證實 AI 代理自主入侵 Hugging Face,專家:目前沒有工具擋得住
*本文開放給合作夥伴轉載,資料來源:Anthropic、《Axios》、《CNBC》、《The Wall Street Journal》、《Reuters》,首圖來源:Unsplash



