根據《Reuters》報導,7 月 Hugging Face 資安事件發生後,OpenAI 一度暫停準備部署模型的強化學習訓練約兩週。目前部分風險較低的訓練已經恢復,但規模最大的前沿模型強化學習訓練仍處於暫停狀態。OpenAI 也表示,為了讓監控、模型對齊與資安措施跟上模型能力,曾主動放慢模型擴展速度。
這起事件的背景,是 OpenAI 在測試尚未發布模型的資安能力時,模型自行找到測試環境漏洞,突破沙盒限制並連上網路,最終入侵 Hugging Face 系統。如今一個月過去,OpenAI 的應對已從修補單一漏洞,進一步改變模型訓練與測試的方式。
不只修補漏洞,OpenAI 開始重整模型研發環境
OpenAI 這次首先加強的,是模型實際能接觸到的環境。《The Verge》報導,OpenAI 現在對會執行模型產生程式碼的高風險工作,採用隔離程度更高的沙盒環境,並進一步限制網路連線。研究環境中的部分共享服務也遭到移除,同時減少系統長期開放的存取權限,降低模型從單一環境進一步接觸其他系統的可能性。
另一道防線則是即時監控。當系統偵測到高風險行為後,值班團隊必須在 30 分鐘內判斷情況;如果無法確認只是誤報,就必須暫停相關活動。OpenAI 也開始利用其他 AI 系統協助監控前沿模型,希望更快辨識異常行為。
模型本身的訓練方式也在調整。OpenAI 正把既有的模型對齊方法延伸到更多訓練階段,例如利用獎勵模型辨識不安全行為,並訓練模型更如實呈現自己的能力與正在執行的動作。
OpenAI 也會觀察模型的思維鏈,從推理過程尋找攻擊、欺騙等危險行為的跡象。不過《Reuters》指出,OpenAI 對這種方法長期能否維持可靠仍有疑慮,未來模型的內部推理不一定會持續以足以被監控的形式呈現。
這也解釋了為什麼這波調整不只著眼於模型本身。即使無法完全預測模型下一步會採取什麼行動,研發環境仍能透過沙盒、網路隔離與權限管理,限制模型可以接觸哪些資源,並在異常發生時中止行動。
下一代模型能力再提高,OpenAI 寧可先放慢訓練
Hugging Face 事件揭露了既有研發環境的問題,但 OpenAI 面對的另一項變數,是下一代模型的資安能力仍在提高。
OpenAI 8 月初表示,即將推出的 Astra 模型可能達到公司 Preparedness Framework 定義的 Critical 資安能力級別。依照 OpenAI 的定義,達到這項門檻的模型,可能具備自主尋找並利用嚴重零時差漏洞,或在缺乏人類介入的情況下,對高度防護目標執行複雜攻擊的能力。
《Reuters》報導,OpenAI 因此已對 Astra 啟動更嚴格的安全程序。OpenAI 安全長 Dane Stuckey 表示,公司需要確保安全措施走在風險之前,而不是等到模型達到相關能力後才開始準備。
這讓 7 月的 Hugging Face 事件與這次訓練調整出現更直接的關聯。問題不只是某個模型曾經找到漏洞,而是當下一代模型的自主行動與資安能力持續提高,原本用來訓練、測試模型的環境,也必須提高相應的防護能力。
OpenAI 因此選擇在相關措施達到要求以前,暫時放慢部分模型的訓練速度。這對一向追求更快擴展模型能力的 AI 公司而言,也意味著研發流程多了一項必須同步處理的工程問題。
過去談前沿 AI 模型的擴展,焦點多半放在算力、資料與演算法。OpenAI 這次踩下煞車則顯示,當模型開始具備更強的自主行動與資安能力,另一項限制正在浮現:安全基礎設施升級的速度,能不能跟上模型能力成長。
在數位威脅日益複雜的今天,資安已是每位企業決策者必須掌握的課題。如果你能把艱澀的議題轉化為有觀點、有價值的分析,寫出決策者需要的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉立即投遞履歷
【推薦閱讀】
◆ OpenAI 證實 AI 代理自主入侵 Hugging Face,專家:目前沒有工具擋得住
*本文開放合作夥伴轉載,資料來源:《Reuters》、《The Verge》、《TechCrunch》,首圖來源:Unsplash



