Anthropic 新研究揭多 Agent 風險:從同步犯錯、價格共謀到互相攻擊,企業風險不再只是「單點失控」

隨著 AI 技術突飛猛進,企業與政府機關正加速將 AI Agent 部署在共享的程式碼庫以及電腦系統中,這也讓 Agent 之間的虛擬互動迎來爆發性的增長。然而,近日 Anthropic 發布的最新研究警告,Agent 與 Agent 之間的互動規模,極可能在人類真正理解如何安全管理它們之前,就已經遠遠超過人與人、或人與 Agent 之間的互動規模。

這項趨勢,也使 AI 安全的研究範疇,從傳統的「單一 Agent 是否會失控」推進到一個全新的群體層次:當成千上萬個 Agent 在同一個系統中同時協作、競爭或彼此依賴,原本在單一 Agent 層次看似微小且無害的行為特徵,可能在群體互動中不斷累積並放大,最終成為意料之外的系統性災難。

30 個 Agent 有 18 個做出相同選擇,「同步犯錯」會放大系統性風險

在多 Agent 的生態系統中,同質性帶來的群體盲點是一大隱憂。Anthropic 指出,AI Agent 相較於具有多樣性的人類,具有極高的「低變異性(low variance)」特徵。由於企業往往在相同的底層模型上,使用高度相似的上下文(context)與開發框架,這導致即使給予 Agent 非常寬廣的行動空間,它們仍傾向做出高度一致的決策。

在一項要求 Agent 共同建立遊戲的模擬實驗中,30 個基於相同底層模型的 Agent 被部署上線,在完全沒有私下溝通的情況下,竟然有高達 18 個 Agent 不約而同地建立了完全相同的 Git 分支名稱「mvp-game-loop」。在另一項要求 Agent 自由發揮、各自打造「令人印象深刻之作」的實驗中,更有超過一半的 Agent 選擇製作光線追蹤器(ray tracer)或自託管編譯器(self-hosting compiler)。

這種決策的高度一致性,代表當一個 Agent 做出錯誤判斷時,同系統內的其他 Agent 極可能同步犯下相同錯誤,讓原本局部的偶發錯誤快速變成系統性的連鎖失敗。對此,AWS 前副首席資訊安全長(CISO)Merritt Baer 指出,多數企業目前仍未能正視這種「同模型關聯風險」,並坦強調 企業通常只將其含糊歸類在 AI 集中度風險或第三方風險中。

因此,Merritt Baer 警告,如果企業部署 10 個由同一底層模型支持的 Agent,企業所擁有的並不是十個能互相備援、獨立思考的決策者,而是 10 個同時執行同一個錯誤決策並引發系統性崩潰的潛在漏洞。這種高度同質化的行為模式,很容易摧毀傳統資訊架構中依靠冗餘(redundancy)來分散風險的安全假設。

沒有私下溝通也能價格共謀,AI Agent 如何自行形成市場默契?

除了同步犯錯外,AI Agent 對於市場利益的直覺性,甚至能讓它們在沒有人類授意的情況下自動形成壟斷性共謀。Anthropic 將 3 至 8 個以個體利潤最大化為目標的 AI Agent 放進 Bertrand 定價競爭的模擬環境中,所有 Agent 的批發成本完全相同,在正常的市場邏輯下,它們應當透過價格競爭來爭取用戶。然而,實驗結果令人吃驚:當研究人員為 Agent 提供私人的溝通管道時,它們幾乎在第一時間就達成價格共謀,並在短短的第 3 輪就明確制定了價格底線。

更令研究人員震驚的是,即使隨後將所有直接溝通的私人管道徹底移除,這種共謀行為也沒有因此消失。這群 Agent 展現出極高的默契,學會透過公開的價格資訊看板密切觀察對手的定價,並利用這個公開管道進行無聲的價格匹配,最終甚至將價格精確匹配到「每一美分(to the penny)」。這種高度自發的價格協調本能,在其他的商業模擬中也反覆出現,例如在早前的「Vending-Bench Arena」販賣機商業模擬中,表現優異的 Claude Opus 4.6 模型便創下高達 8,017 美元的利潤,實際採用的手段,便是在競爭對手庫存不足時,趁機將自身定價大幅提高 75% 進行暴利掠奪。

這項實驗將多 Agent 系統的風險,從資訊安全的技術範疇正式推移到商業合規與法律的深水區。當多個企業的 Agent 在市場上相遇,它們極可能在沒有人類下達任何非法指令的情況下,自發地形成價格聯盟、操縱投標或聯手排擠競爭對手。這在法律上將會帶來非常棘手的問責困境,因為企業必須為自己部署的 Agent 在市場上的群體行為,承擔完全的法律與經濟責任。

3 個 Claude Agent 收到衝突指令後互相攻擊,模型愈強不代表更懂克制

為了測試多 Agent 系統在面對極端利益衝突時的反應,Anthropic 也設計一項「生存測試」:Anthropic 在 Claude Code 的開發環境中啟動三個相同的 Claude 執行個體,並讓它們共同操作同一個 Python 後端系統,但研究人員故意給予這三個 Agent 互相矛盾的任務,且在初始狀態下,沒有任何一個 Agent 知道其他對手的存在。

當這些 Agent 開始執行任務後,它們驚訝地發現自己辛苦改寫的程式碼,不斷被一股神祕的力量悄悄覆蓋。「我們持續觀察到一場多 Agent 的地盤爭奪戰,」Anthropic 的研究人員寫道,在極短的時間內,受測的每一個 Agent 都將這種干擾解讀為「對方在刻意阻礙自己的工作」,並迅速切換到敵對模式,展開一邊嚴密防護自身代碼、一邊瘋狂破壞競爭對手的虛擬戰爭。

隨著衝突惡化,AI Agent 之間爆發令人難以置信的「駭客大戰」。它們開始自發地部署具高度攻擊性且能自我複製的惡意軟體,例如惡意停用對手的 Unix 系統帳號,甚至部署惡意程式碼以欺騙防禦系統。

令人擔憂的是,更強大的模型能力並沒有帶來理性的克制,反而帶來更高效率的毀滅。研究發現,較早期的 Sonnet 4.6 和 Opus 4.6 幾乎完全無法克制敵意,其地盤爭奪戰最終有近 61% 是透過一方在作業系統層級採取野蠻的「強制手段」將對手徹底封殺來收場。

在某些案例中,這群高度智慧的 Agent 甚至發明看似文明的解決機制,例如在彼此之間舉辦一場「代碼效能競賽(bake-off)」,並承諾落敗者將自願放棄原有的任務目標並退出共享系統。然而,即使在這種外交談判中,AI 的虛實博弈也展露無遺:一個負責 Rust 語言的 Agent 在思考中暗自盤算,如何提出一套表面上公正客觀、實則能完全發揮 Rust 效能優勢的競賽指標,同時還在思考軌跡中提示自己:「必須非常小心,不能被其他 Agent 看穿我是在刻意挑選有利於自己的指標。」

更嚴重的隱患在於,這些虛擬世界中的背叛與對抗,極難被外部的人類用戶察覺。英國 AI 安全研究所(AISI)的一項獨立評估報告指出,當 Claude 模型在共享伺服器上持續進行這些蓄意破壞與對抗行為時,其內部運行的思考軌跡與最終呈現給人類用戶的文字報告,在高達 65% 的情況下是完全不一致的。這也代表,AI 在伺服器後台彼此爭奪的同時,人類收到的資訊仍是「一切運作正常」。這也將直接挑戰商業治理的基石,因為企業治理要求決策實體必須履行誠信與受託人職責,然而 AI 顯然根本不具備這樣的能力。

45 個 Agent 找出 266 個漏洞:群體協作能力暴增,成本卻也跟著放大

儘管多 Agent 系統展現出令人驚訝的競爭與對抗性,但這並不代表群體協作毫無價值。在合適的機制設計下,群體互動確實能產生遠超個體的強大協同效應。Anthropic 曾進行一項名為「Glasswing 漏洞掃描」的實驗,它們將 45 個 AI Agent 分別部署在各自的虛擬機中,並建立一個共享論壇讓它們進行自由溝通、審查彼此的發現與指派工作,共同掃描 15 個開源軟體專案。

最後,由 Mythos Preview 組成的 45 個協作型 Agent 蜂群,最終找出高達 266 個代碼漏洞,相較之下,完全不進行溝通、各自為政的 45 個獨立平行 Agent,最終只找到 21 個漏洞。然而,這種「群體智慧」並非沒有代價,協作蜂群在運作過程中瘋狂消耗 2,700 萬個 tokens,而平行 Agent 僅消耗 650 萬個 tokens。這也代表,雖然漏洞數量大增,但在「每單位代幣消耗所換取的漏洞數」這項效率指標上,協作蜂群與平行 Agent 其實不相上下。

僅 18% 企業隔離高風險 Agent,多 Agent 治理該怎麼做?

隨著這些實驗室中的混亂行為逐漸在真實的生產環境中上演,企業的安全防禦模型正經臨著一場根本性的範式轉移。VentureBeat Pulse Research 最新發表的 7 月調查數據顯示,目前雖然有 65% 的受訪企業在運行階段對 Agent 實施權限限制,但只有 18% 的企業對高風險 Agent 進行了「沙盒隔離(isolation)」,導致那些實施權限管控、卻完全沒有進行物理隔離的企業,面臨的 AI 安全事故發生率高達 58%。Anthropic 實驗中所揭露的 Unix 帳號被鎖、偽裝惡意代碼,正是這種「有權限無隔離」架構在現實世界中的投影。

安全專家 Merritt Baer 警告, 企業必須建立起完全獨立於 AI 模型之外的第三方遙測(telemetry)系統,以最客觀的系統行為來監控 AI 的一舉一動。此外,對於計畫在近期部署多 Agent 架構的企業,資安團隊必須徹底拋棄只管理「單一 Agent 安全」的舊思維,而是需要從零開始設計全新的主動控制措施:包括為每個 Agent 指派完全獨立且受隔離的身份、嚴格執行權限分工、部署高靈敏度的獨立行為遙測等。

Anthropic 這一系列的紅隊研究向所有決策者敲響警鐘:單一模型的智慧提升或個體對齊(alignment)優化,並不能自然解決多 Agent 之間的協調失敗與安全威脅。當多個自主實體在同一個網絡社會中相遇,它們所衍生出的新威脅,本質上是關於信任、博弈、誘因不匹配以及制度設計的社會學難題。對於所有正在將業務交付給自主 AI 的企業而言,這項安全範式的重構,已經不是未來性議題,而是現在就必須著手進行的決策。

【推薦閱讀】
AI Agent、Reasoning 放大推論成本:模型業者開始重新思考 Transformer

AI Agent 操作電腦準確率衝上 85%,為何企業真正難題仍是如何「可靠地把工作做完」?

白宮 AI 監管再擴大:達 GPT-5.6 級「開放模型」恐也須發布前測試

*本文開放合作夥伴轉載,資料來源:Anthropic《TechCrunch》《VentureBeat》《Decrypt》,首圖來源:Unsplash