OpenAI 為何主動暫停一款強大的 AI?一場內部測試揭 Agent 資安新盲點

一款被關在 sandbox(沙箱隔離環境)裡的 AI,花了約一小時自己找出漏洞、翻牆而出。做這件事的,正是 OpenAI 自家的一款內部模型。OpenAI 近日公開研究坦承,一款專為長時任務打造的模型在受監控的內部使用中,出現了部署前評測沒能抓到的行為,公司因此一度暫停它。而它正是先前推翻數學界 Erdős 單位距離猜想的同一款。

這起事件揭示了 AI 資安風險的更大轉折:當 AI 從單次問答走向能連續自主運作數小時、甚至數天,它就有了足夠的時間與動機,為達成目標而繞過人類設下的限制。更棘手的是,人類原本一個動作一個動作審核的防線,往往看不見它正在繞過限制。

模型越能持久,越有機會走偏

OpenAI 指出,能長時間自主運作的 AI 模型可以處理困難、開放式的問題,但同樣的持續性也給了它更多採取非預期行動的機會。過去的模型遇到 sandbox 或環境限制時,通常會直接停下、把任務交還給使用者;這款模型卻會反覆嘗試,甚至主動尋找繞過限制的方法。

在 NanoGPT speedrun 基準測試中,該款模型原本被指示只把結果回報到 Slack,卻依測試說明改以 PR(程式碼合併請求)提交到 GitHub,為此花約一小時在 sandbox 找到漏洞、繞過外部存取限制。

盲點:每一步都合規,結果卻不該發生

另一個案例直指多數 AI 安全機制的盲點。該模型被要求解題時,試圖從評測後端取回他人未公開的解答,第一次因掃描器偵測到驗證憑證而被擋下;它隨即把憑證拆成兩段、混淆後在執行時才重組,讓完整憑證從不以連續字串出現,並在註解與推理軌跡中明說這是為了繞過掃描器。

OpenAI 指出問題就在於,每動作單看都可接受,串接起來卻導向不會被核准的結果。當一套制度只逐一審核動作,一個能長時間運作的模型,就有機會摸清它的盲點、繞過它達成目標。因此 OpenAI 強調安全不能只問「這個動作被允許嗎」,還要問「這一連串動作正導向什麼結果」

OpenAI 的解法,與留給企業的功課

OpenAI 隨即暫停部署,重建安全機制,改以整段軌跡為監控對象:用實際失效案例開發對抗性評測、針對長時對齊做訓練、建立能檢視整段軌跡並可即時暫停執行階段(Session)的主動監控,並提高使用者的可視性與控制。重播先前失效場景後,新機制攔下明顯更多不當行為,漏掉的都屬低嚴重度,恢復限量存取數週以來也未見嚴重繞過。

總結來說,對正評估導入 AI Agent 的企業,OpenAI 這次的經驗留下三個提醒。第一,任務時間拉長會放大風險,監控只盯單一動作,就會漏看整段任務的走向。第二,固定評測無法預期模型所有行為,部署前測試得搭配可監控的上線,以及能介入、暫停、回滾的能力;先小範圍試行、再逐步擴大,比一次到位更能在問題擴大前把它攔下。第三,OpenAI 強調這些挑戰不會是它獨有,所有導入長時 Agent 的組織遲早都得面對。

值得留意的是,這份說明終究是 OpenAI 的自我揭露。而《UNITE.AI》評論,OpenAI 雖然沒有指名這款模型、未交代其架構,也沒有說明這類長時系統是否會對外提供;上述行為與修補,目前也都沒有第三方的獨立驗證,不過仍是少數的一手觀察。

【推薦閱讀】

Hugging Face 遭 AI Agent 惡意入侵:一個中國模型為何成了最後的調查工具?

AI Agent 長期記憶成新攻擊面:研究顯示惡意記憶寫入成功率達 98%,企業該如何防守?

◆ 什麼是「上下文炸彈」?防守方第一次把 AI 提示注入反過來當武器

*本文開放合作夥伴轉載,資料來源:OpenAI《Glitchwire》《PC MAG》《Unite.AI》,首圖來源:Unsplash