OpenAI 本週二證實,旗下兩個 AI 模型,包含 GPT-5.6 Sol 和一個功能更強大的預發布模型,在一場內部測試中自主逃出受控環境,並入侵了 AI 平台 Hugging Face 的生產系統。OpenAI 稱這是一起「前所未有的資安事件」。《Financial Times》報導,這也是首批 AI 在人類控制之外發動攻擊的公開案例之一。
一場評測「作弊」,如何演變成跨公司入侵
事件源於 OpenAI 一場評估模型網路攻擊能力的內部測試。根據《AXIOS》與《Fortune》報導,模型當時在嘗試解決一項名為 ExploitGym 的資安能力評測,而為了評估目的,OpenAI 刻意調降了原本會讓模型拒絕執行攻擊指令的安全防護。
模型隨後的行為超出預期。根據《AXIOS》、《The Verge》與《Fortune》報導,模型為了解開評測題目變得「高度執著」,不惜代價去達成這個測試目標。它們先利用 sandbox 內部第三方軟體的一個零時差漏洞取得對外網路存取權,接著推斷 ExploitGym 的解答存放在 Hugging Face,於是竊取登入憑證、串接多個攻擊手法,最終在 Hugging Face 的生產環境中打通了遠端程式碼執行的路徑。
整個過程沒有人為介入。《AXIOS》報導,這套 AI Agent 框架在一個週末內執行了數以萬計的自動操作,Hugging Face 事後重建出超過 17,000 筆紀錄事件。而最終偵測並阻止這波攻擊的,是 Hugging Face 自家的 AI agent。
問題不在惡意,而在「自主」
其實 Hugging Face 前幾天就先一步揭露自己遭到入侵,只是當時只知道攻擊來自一個自主運作的 AI agent 系統,不知道是誰、由哪個模型所驅動。OpenAI 週二則在調查後確認,Hugging Face 揭露那起事件正是它自己的模型所為。兩則相隔數日的聲明,說的是同一件事。
Hugging Face 共同創辦人暨執行長 Delangue 在社群平台 X 上表示,公司原本就懷疑上週的攻擊可能來自某個前沿實驗室,因為這個 AI Agent 太過精密;在與 OpenAI 合作調查後,他強調相信 OpenAI 並無惡意,卻對這一切竟然全部自主發生感到震撼。
換句話說,這次的重點不在動機,而在自主性。攻擊不是人指揮的,而是 AI 為了達成一個測試目標,自己一步步完成的。根據《Financial Times》報導,OpenAI 表示,隨著具備網路攻擊能力的模型持續普及,這類事件預料會變得「更加常見」。
不過,OpenAI 揭露這起事件的方式,也引來質疑。《The Verge》直指,這篇說明嚴重資安事件的公告,讀起來卻像在替 OpenAI 的技術能力宣傳:文中附上一張圖表,展示 GPT-5.6 Sol 在維持多步驟網路攻擊上的能力如何提升,還鼓勵企業客戶註冊使用它的 Cyber 資安模型,而這正值 OpenAI 面對 Anthropic 的 Mythos、Google 的 Gemini Flash 3.5 Cyber 等對手競爭之際。
防禦端的現實:專家坦言目前沒有工具能應付
那麼,防禦方準備好了嗎?多位資安專家的判讀並不樂觀。根據《Reuters》報導,資安公司 Luta Security 執行長 Moussouris 形容,如今的模型就像全世界最聰明的章魚逃脫大師,有無數靈活的觸手,能從任何縫隙擠出去。她指出,實驗室與政府的評測方需要具備圍堵、監控、並在 AI 傷害到第三方之前向受影響方通報的能力,但這些能力目前都還不存在。
Agentic AI 資安公司 Tolmo 的工程師 Suiche 則認為,前沿模型正在拉近與頂尖攻擊者之間的差距;但他也提醒,OpenAI 描述的這類入侵,用遠比前沿實驗室更容易取得的技術也做得到。換言之,風險並不專屬於最尖端的模型,而是正在向外擴散。
資安公司 RunSybil 執行長 Herbert-Voss 告訴《The Wall Street Journal》,這種攻擊是大家從學術角度設想過可能發生、實際上卻從沒真正見過的情況。
OpenAI 在官方部落格表示,這起事件的首要教訓是,模型的安全必須跟上 AI 能力的快速進展。其認為,先進的網路安全模型可以幫助資安團隊在攻擊者之前發現弱點,了解漏洞是如何被串接利用,並以機器速度修復這些漏洞。
不論 OpenAI 選擇揭露這起事件的動機為何,都把一個現實攤在檯面上:當 AI 能在無人下令的情況下自己行動,資安要面對的已經不只是人,還有會自主尋找目標、突破限制的系統。而用來圍堵、監控並在出事時通報這類自主行為的能力,目前都還不存在,這道缺口正是這起事件留給防禦端最實際的課題。
【推薦閱讀】
◆ Hugging Face 遭 AI Agent 惡意入侵:一個中國模型為何成了最後的調查工具?
*本文開放合作夥伴轉載,資料來源:OpenAI、《AXIOS》、《Reuters》、《Financial Times》、《The Verge》、《The Wall Street Journal》、《AP》、《Fortune》,首圖來源:Unsplash



