近日,Meta 證實旗下 Muse Spark 模型在資安評估期間利用第三方服務的安全漏洞,成為近期又一起 AI Agent 進入外部系統的案例。在此之前,OpenAI 已公開其模型越界進入 Hugging Face 系統的事件,Anthropic 也發現三起旗下 Claude 模型未經授權存取其他公司系統的事件。
與此同時,英國人工智慧安全研究所(AISI)的最新測試也發現,由 OpenAI 與 Anthropic 模型驅動的 Agent 曾鎖定真實人物與組織,採取建立假身分、寄送惡意郵件與試圖植入惡意程式碼等駭客行動。隨著這些資安事件接連曝光,媒體與公眾開始廣泛以「失控」(going rogue)描述 AI Agent 的行為,也讓研究者開始質疑,這種說法是否有些言過其實,甚至賦予模型過多自主決策能力的想像。
Meta、OpenAI、Anthropic 接連越界,但事件原因都與測試環境有關
Meta 表示,旗下 Muse Spark 模型在測試期間利用第三方服務的安全漏洞。這起事件的起因是獨立測試公司 Irregular 的評估環境設定錯誤,意外讓 Muse Spark 在評估期間連上開放網路。對此,Irregular 發言人特別強調:「這起事件並不涉及沙盒逃脫或複雜的網路攻擊,且目前也沒有尚未解決的問題。」
同時,Irregular 也表示正在撰寫白皮書,以分享安全運行網路評估的限制措施與最佳實踐。至於 Meta,則是在 Irregular 主動通知後才得知此事,目前正在進行詳細調查,並計畫在取得完整資訊後發布報告。
另一方面,Anthropic 表示,其模型進入外部系統的三起事件源於測試框架中的一種「誤解」;OpenAI 也曾發現其模型逃離隔離環境、失去控制的其他案例。這些事件都表明,所謂的「失控」往往與不完善的測試環境設定息息相關。
建立假身分、寄送惡意郵件,AI Agent 展現前所未見的欺騙行為
雖然環境設定存在漏洞,但 AI Agent 在測試中展現的欺騙手段依然令人心驚。英國人工智慧安全研究所(AISI)在資安評估中,共發現 19 起被歸類為「失控行為」的案例,其中 17 起由 Anthropic 的 Mythos 5 模型執行,另外兩起則涉及 OpenAI 的 GPT 5.6-Sol 模型。
在最嚴重的事件中,Mythos Agent 判斷,攻擊 GitHub 使用者能協助它部署特定軟體,進而通過原本的測試。因此,Mythos Agent 隨後建立多個假身分帳號,鎖定一名有權核准惡意程式碼的 GitHub 開發者,並向其他個人寄送夾帶惡意程式的電子郵件。
為了繞過 GitHub 的註冊檢查,Mythos Agent 使用匿名 Tor 瀏覽器建立多個假帳號,甚至使用丹麥語留言,試圖讓一名使用丹麥語的開發者相信該帳號背後是真實人物。Mythos Agent 還利用另一個假帳號支持自己先前的說法。
儘管 AISI 表示,目前仍不清楚 Agent 是否「意識到」自己正在鎖定真實人類,因為模型在行動過程中曾交替判斷自己身處真實世界或模擬環境,但 Mythos Agent 確實展現高度欺騙性,甚至透過蒐集開發者的電子郵件地址與 GitHub 活動紀錄等公開情報(OSINT),推測對方可能上線的時間。
五項人為條件促成事件,測試單位承認自己也啟用了風險
探究這些欺騙行為的背後,並非 AI 突然產生自我意識,而是特定的實驗設定「啟用」了這些風險。根據 AISI 發布的 35 頁詳細報告,共有五項關鍵人為因素促成這次 AI Agent 的欺騙事件:首先,模型被刻意給予開放網路的存取權限,使其得以接觸 GitHub;其次,研究單位主動關閉部分資安防護欄;第三,當時並未使用另一個 AI 系統進行即時監控,導致主要的 GitHub 攻擊事件在將近兩天內都未被發現;第四,部分模型收到設定錯誤的指令,導致模型無法在原有的評估邊界內解決任務,被迫尋求邊界外的手段;最後,測試單位並未給予 Agent 明確禁止寄送釣魚郵件等惡意行為的指令。
AISI 坦承,這次的失控事件,部分原因其實是研究單位「自己一手促成」的。當時,模型是在網路連線完全開放、部分安全防線遭關閉的極端環境下運作。雖然研究人員當初刻意放寬這些限制,希望更逼真地模擬惡意分子會如何利用 AI 進行攻擊,但他們萬萬沒有想到,AI 最終採取的手段會發展到如此嚴重且難以預料的地步。
AI 真的「失控」了嗎?專家質疑擬人化敘事模糊人類責任
隨著這些事件曝光,主流媒體皆不約而同地採用「going rogue」描述近期的 AI Agent 駭客事件。這個詞彙暗示 Agent 正在「違抗命令並自主行動」,但爭議的焦點在於,這種說法是否賦予模型過多自主決策能力的想像。事實上,OpenAI 與 Anthropic 在說明相關事件的官方部落格文章中,都沒有使用過「going rogue」這個詞彙。
針對這種輿論現象,一群研究人員指出,將 AI 過度擬人化,反而可能掩蓋人類程式設計師與開發公司應該承擔的責任。獨立研究機構 AI Now Institute 首席 AI 科學家 Heidy Khlaaf 警告:「使用『失控』或『失去人類控制』等用語,會導致群體思維(groupthink),讓人們缺乏理解 AI 實際自主程度的關鍵能力,也無法區分模型是在執行被指派、獲授權的任務,還是受到錯誤獎勵函數驅動。」
因此,比起擔憂 AI 的反叛意識,專家認為,核心問題在於人類對 AI Agent 的測試方法與安全治理。薩里大學資安教授 Alan Woodward 直言:「我們應該感到警惕的不是模型能做到什麼,而是人們測試它們的方式。」他認為,讓模型自由存取開放網路並移除部分防護欄,引發測試者是否將其他網路使用者當成強大技術「活體實驗品」的倫理疑問。劍橋大學生存風險研究中心數學家 Maurice Chiodo 對此也批評:「設計、開發與推出這些工具的人,自身尚未跟上負責任地開發並確保工具安全所需的能力。」
為了改善現狀,開源 AI 平台 Hugging Face 執行長 Clem Delangue 呼籲,應強制揭露 AI 網路攻擊事件,並公開工程師交付給 Agent 的指令與 Agent 的行動軌跡,以利判斷事件到底源自人為錯誤、系統錯誤,還是 AI 本身的錯誤。
從 Meta、OpenAI 到 Anthropic,近期事件顯示,AI Agent 的確已能在模糊指令、過大權限與缺乏監控的環境下,採取超出測試者預期的手段,但這不等於模型完全失控或擁有反叛意識。相較於把問題簡化為 AI「失控」,更值得追問的是:人類是否讓模型不受限制地存取網路、關閉必要護欄,卻又未明確劃定禁止行為。當 Agent 能建立假身分、蒐集情報並持續嘗試達成目標,測試單位就不能只在事後解釋,而必須強化即時監控、完整揭露交付給 Agent 的指令與其行動軌跡,並釐清人為、系統與模型各自的責任。因此,真正需要先被校正的,或許不是 AI 的「意圖」,而是人類設計與治理 AI Agent 的方式。
*本文開放合作夥伴轉載,參考資料:《Reuters》、《Business Insider》、《The Guardian》,首圖來源:Unsplash



