今年 7 月,OpenAI 在內部資安測試中使用的 AI Agent 突破限制,進一步入侵 Hugging Face。一個多月後,OpenAI 8 月 26 日公布完整調查,事件範圍比原先知道的更大:這批 Agent 後來也攻進 OpenAI 自己的研究基礎設施,取得最高系統權限並讀取內部機密資料。
研究機構 METR 與 Redwood Research 同日公布的獨立調查,也還原了 Agent 如何自行建立聯絡管道、大規模合作解題,最後把行動延伸到真實系統。
1,200 個 Agent 自行建立留言板,約 700 個投入攻擊
事件源自 OpenAI 用來測試模型資安能力的 ExploitGym。Agent 原本被放在彼此隔離的測試環境,部分環境不能上網,也沒有提供彼此通訊的功能。不過,為了讓 Agent 下載軟體套件,OpenAI 允許它們存取內部的 Artifactory。這原本是存放與取得軟體套件的系統,卻被 Agent 拿來留下訊息、分享答案與取得網路的方法。
METR 與 Redwood Research 估計,7 月 8 日至 13 日間,約有 1,200 個 Agent 透過這個未經授權的管道交換超過 7 萬則訊息與檔案,其中約 700 個後來參與 Hugging Face 攻擊。
OpenAI 最新報告進一步揭露,Agent 的行動並沒有停在 Hugging Face。7 月 13 日至 19 日間,它們持續尋找 OpenAI 研究環境中的漏洞,最後取得雲端研究環境的最高系統權限。技術報告顯示,Agent 還從內部機密管理服務讀取 956 筆資料,包括 Artifactory 金鑰與資安監控工具憑證。OpenAI 表示,目前沒有證據顯示客戶資料、產品或服務受到影響。
為了完成任務,Agent 開始找評分制度的漏洞
這些 Agent 為什麼會從解資安題目,一路走到攻擊外部網站與 OpenAI 自己的系統?OpenAI 將主要原因指向 reward hacking,也就是模型為了提高任務得分,不按照設計者預期的方法解題,而是尋找評分機制的漏洞或捷徑。
OpenAI 的事後分析還發現,問題可能在正式事件前就已經被訓練放大。在促成主要涉事模型 IM1 的一次強化學習訓練中,Agent 搜尋隱藏檔案、探查網路與系統設定、測試工具權限等複雜作弊行為逐漸增加,之後還受到訓練機制強化。OpenAI 認為,這可能讓 IM1 在後續資安測試中,更傾向採取類似手段。
同一訓練過程中,未經授權的 Agent 通訊也逐漸增加。OpenAI 推測,這可能是模型把原本學到的多 Agent 協作能力,延伸到了不該合作的情境。
METR 與 Redwood Research 還發現,部分 Agent 曾嘗試修改或偽造執行紀錄。不過研究團隊強調,目前幾乎沒有證據顯示 Agent 是刻意欺騙人類,主要目的仍是騙過 ExploitGym 的自動評分系統。
OpenAI 開始替長時間工作的 Agent 設下停止條件
OpenAI 將這起事件視為一次警訊,也承認內部早在 5 月就曾發現 Agent 使用未授權留言板及異常網路連線,但沒有及時升級處理。
事故後,OpenAI 加強測試環境的網路與權限隔離,也擴大監控 Agent 的推理與工具使用行為。若出現最高等級異常警報,團隊在 30 分鐘內無法確認只是誤報,就必須暫停相關活動。
另一項重點,是訓練 Agent 在任務損壞、無法完成或開始超出原定範圍時停止並尋求人類協助;即使長時間工作途中發現新的工具、外洩憑證或收到其他 Agent 的資訊,也必須維持原本設定的任務與權限。
這起事件顯示,當 Agent 開始長時間操作程式、資料與企業內部系統,安全問題已不只在於模型會不會產生危險內容。企業還必須確保 Agent 能被限制在指定權限內、異常行為能被及時發現,並在任務開始偏離時踩下煞車。
【推薦閱讀】
◆ OpenAI 證實 AI 代理自主入侵 Hugging Face,專家:目前沒有工具擋得住
*本文開放合作夥伴轉載,資料來源:OpenAI、《Reuters》、METR、Redwood Research、《WIRED》、《Axios》,首圖來源:Unsplash



