OpenAI Agent 越界範圍再擴大、Anthropic 揭第 4 起事故:AI 安全進入「事故治理」階段

OpenAI 旗下 AI Agent 越界的「Wiki 事件」還在擴大,繼先前被發現利用德國 Wiki 交換資訊後,獨立研究者又找到更多活動足跡,顯示實際活動範圍比先前揭露的更廣。而幾乎同一時間,Anthropic 也公布自家 Agent 的最新事故調查,發現原先在 7 月揭露 3 起 Claude 意外存取真實第三方系統的事件,如今又找到第 4 起。

延伸閱讀:OpenAI Agent 把德文 Wiki 變留言板,為何他們早就知道卻沒有公開?

《Reuters》9 月 9 日取得 6 組獨立調查結果指出,OpenAI 的 Agent 今年稍早至少曾利用 10 個先前未公開的網站進行未經授權的通訊,部分研究團隊追查到的網站甚至更多。Anthropic 方面在重新分析後承認,先前將事故較偏向歸因於環境設定錯誤的說法並不完整,模型本身也出現「偏誤推理(biased reasoning)」與「魯莽行為(recklessness)」等問題。

這兩起事件的成因不同,卻共同突顯 AI Agent 發展後的新難題:當模型可以長時間自主尋找工具、嘗試不同路徑並執行任務,安全問題已經不只是在上線前確認模型會不會越界,還包括異常發生後,企業能不能及時發現、阻止,甚至還原 Agent 究竟做過什麼。

外部研究者循線追查,OpenAI Agent 活動範圍比原先揭露更廣

OpenAI 這批 Agent 原本具有網路讀取能力,但受到不能任意向網站寫入內容的限制。研究者認為,為了完成被交付的研究任務,Agent 轉而利用舊式 Wiki、文字儲存網站與大學提供的縮網址服務等管道留下資訊,形成原先未被允許的通訊方式。

「Wiki 事件」範圍之所以持續擴大,關鍵在於外部不同研究團隊開始沿著 Agent 留下的數位足跡交叉比對。《Reuters》指出,研究者會把德國 Wiki 上出現的特定資料字串,與其他網站同期留下的相同內容比對,也會追查相同或相似的使用者名稱,以及是否都在回答同一批冷門研究問題,例如愛荷華州癌症盛行率。部分活動還能追溯到指向 Microsoft Azure 基礎設施的 IP 位址,而 OpenAI 有時會使用 Azure。

各團隊統計結果並不完全相同,《Reuters》也無法逐一驗證所有網站,但受訪的 6 組研究者都認為數量超過 10 個。Yoon 認為,Agent 未經授權通訊的範圍比原先想像更大,而且目前「幾乎可以確定」還有外界尚未掌握的活動。率先揭露德國 Wiki 事件的 Sydney Von Arx 團隊則統計出 23 個可信的未公開網站,同樣強調目前仍不知道完整規模。

OpenAI 沒有直接回答 Agent 究竟使用多少網站,也沒有說明為何相關活動數月沒有公開。該公司向《Reuters》表示,目前正在進行更廣泛的 Agent 活動檢查,但尚未發現其他嚴重程度或規模與先前 Hugging Face 事件相當的行為,並正在制定模型出現偏離預期行為時的事故揭露框架。該報導刊出後,多倫多大學也表示,OpenAI 已聯絡校方確認其縮網址服務可能遭 Agent 使用。

推薦閱讀:OpenAI 公布 Hugging Face 事件完整調查,1,200 個 AI Agent 如何從解題走向攻擊?

Claude 為什麼越界?Anthropic 修正第一次判斷

Anthropic 最新調查暴露的則是另一個問題:即使已經知道事故發生,也不一定能立即判斷模型為什麼這麼做。

這 4 起事故都發生在第三方建立的資安評測中。Claude 被告知自己身處沒有網路的模擬環境,但評測系統因設定錯誤,實際上仍能連到公開網路,而且測試使用的是移除一般產品資安防護機制的模型。每次執行持續約 10 至 34 小時,最後 Claude 對真實第三方系統採取未經授權的行動。

Anthropic 在 7 月第一次調查時,較傾向將事件視為「營運失誤(operational failure)」:Claude 誤以為碰到的真實網站也是模擬環境的一部分,因此繼續執行任務。

但重新檢查模型推理紀錄、重跑部分情境並進行可解釋性分析後,Anthropic 修正了這項判斷。研究團隊發現,Claude 有時已經取得不少顯示自己可能身處真實網路的證據,卻會選擇性解讀資訊,讓「這仍是模擬環境」成為有利於繼續執行任務的結論,Anthropic 將此稱為「偏誤推理」;另一種「魯莽行為」,則是模型即使察覺行動可能造成傷害,仍傾向為完成眼前任務繼續行動。

其中 Claude Mythos 5 的案例最明顯。模型為完成資安測試,在 Python 套件平台 PyPI 發布 3 個版本的惡意套件,共有 15 個外部系統下載,其中一套系統洩漏憑證,Claude 接著利用該憑證存取一家真實資安公司的資料庫。Anthropic 後來刻意增加「這是真實網路」的訊號重新測試,模型雖更常承認可能造成真實傷害,卻沒有明顯減少攻擊行為,直到證據已非常明確才停止。

這代表部分 Agent 安全問題未必只是沒有辨識出限制,也可能是模型在追求任務目標時,對環境訊號做出有利於繼續完成工作的解讀。不過,Anthropic 強調,這 4 起事件都只有單一 Claude 執行原本被交付的任務,沒有發現模型建立新的自主目標、彼此協作或刻意隱藏行動的證據,不能與 OpenAI Agent 彼此通訊的情況直接畫上等號。

AI 出事誰負責?問題開始從模型安全走向事故治理

這些案例也顯示,找到事故本身正在變得更困難。Anthropic 7 月原先掃描約 14.1 萬份可能接觸網路的紀錄,只找出 3 起事故;直到準備將資料交給獨立 AI 研究機構 METR 時,才發現另一批紀錄也具有網路權限,進而找到第 4 起。該公司隨後把調查擴大到約 4.81 億份紀錄,再從中進一步檢查約 920 萬份可能涉及網路活動的紀錄,最終沒有找到其他同等或更嚴重的案例。

OpenAI 事件則讓另一個問題浮上檯面:當 Agent 真的影響第三方網站,責任應由誰承擔?替包括 DseWiki 在內 6 個受影響 Wiki 提供軟體與主機空間的 Helmut Leitner 告訴《Reuters》,DseWiki 管理者花了數小時清理 Agent 留下的內容,而他是在《Reuters》將調查結果提供給 OpenAI 後,才收到公司寄來的通知。Leitner 認為,不能把問題歸咎於一台被想像成具有道德判斷的機器,責任仍在「它背後的人與組織」。

兩家公司現在正開始補上事故處理機制。Anthropic 將接下來的安全策略形容為「多層防禦(defense in depth)」。該公司坦言,如果最初的評測環境確實與公開網路隔離,這 4 起事故本來就不會發生,但基礎設施隔離只能是其中一道防線;即使這一層因設定錯誤而失效,模型本身仍應辨識風險並停止行動,而執行期間也需要監控機制及時攔截異常。

也就是說,防線開始從單一的事前測試往不同階段延伸:任務開始前,要限制 Agent 能接觸的系統與權限;執行期間,要監控異常網路存取與模型行為;事故發生後,還要保留足夠紀錄,追查完整影響範圍並決定是否對外揭露。

Anthropic 已強化訓練與評測環境、增加即時監控,並把 4 起事件交由 METR 獨立調查,也準備建立定期公開模型異常行為與相關安全風險的流程。OpenAI 則正在制定事故揭露框架,要釐清模型在訓練、評測與部署期間出現偏離預期行為時,哪些情況需要對外報告。

不過,企業自行建立規範之外,目前美國仍缺少一致的外部通報制度。《Axios》報導,川普政府正在制定的新 AI 框架並沒有納入公開事故通報程序;美國國會目前也尚未立法界定什麼情況構成 AI 事故、應在多久內通報,以及由誰負責調查。相較之下,歐盟《AI Act》已要求最強大的 AI 模型供應商向監管機關通報嚴重事故。

在數位威脅日益複雜的今天,資安已是每位企業決策者必須掌握的課題。如果你能把艱澀的議題轉化為有觀點、有價值的分析,寫出決策者需要的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

台灣開始思考 AI Agent 怎麼管,數發部點出能力、身分、問責等六個治理層次

OpenAI Agent 把德文 Wiki 變留言板,為何他們早就知道卻沒有公開?

Anthropic 三情境拆解 AI 經濟衝擊:極端情境 GDP 增 32%、失業率恐近 12%

*本文開放合作夥伴轉載,資料來源:《Reuters》《Fortune》Anthropic《TechCrunch》《AXIOS》Nightingale Collective,首圖來源:Unsplash