OpenAI 暫停部分前沿模型訓練:AI 安全為何開始影響研發速度?

根據《Reuters》報導,7 月 Hugging Face 資安事件發生後,OpenAI 一度暫停準備部署模型的強化學習訓練約兩週。目前部分風險較低的訓練已經恢復,但規模最大的前沿模型強化學習訓練仍處於暫停狀態。OpenAI 也表示,為了讓監控、模型對齊與資安措施跟上模型能力,曾主動放慢模型擴展速度。

這起事件的背景,是 OpenAI 在測試尚未發布模型的資安能力時,模型自行找到測試環境漏洞,突破沙盒限制並連上網路,最終入侵 Hugging Face 系統。如今一個月過去,OpenAI 的應對已從修補單一漏洞,進一步改變模型訓練與測試的方式。

不只修補漏洞,OpenAI 開始重整模型研發環境

OpenAI 這次首先加強的,是模型實際能接觸到的環境。《The Verge》報導,OpenAI 現在對會執行模型產生程式碼的高風險工作,採用隔離程度更高的沙盒環境,並進一步限制網路連線。研究環境中的部分共享服務也遭到移除,同時減少系統長期開放的存取權限,降低模型從單一環境進一步接觸其他系統的可能性。

另一道防線則是即時監控。當系統偵測到高風險行為後,值班團隊必須在 30 分鐘內判斷情況;如果無法確認只是誤報,就必須暫停相關活動。OpenAI 也開始利用其他 AI 系統協助監控前沿模型,希望更快辨識異常行為。

模型本身的訓練方式也在調整。OpenAI 正把既有的模型對齊方法延伸到更多訓練階段,例如利用獎勵模型辨識不安全行為,並訓練模型更如實呈現自己的能力與正在執行的動作。

OpenAI 也會觀察模型的思維鏈,從推理過程尋找攻擊、欺騙等危險行為的跡象。不過《Reuters》指出,OpenAI 對這種方法長期能否維持可靠仍有疑慮,未來模型的內部推理不一定會持續以足以被監控的形式呈現。

這也解釋了為什麼這波調整不只著眼於模型本身。即使無法完全預測模型下一步會採取什麼行動,研發環境仍能透過沙盒、網路隔離與權限管理,限制模型可以接觸哪些資源,並在異常發生時中止行動。

下一代模型能力再提高,OpenAI 寧可先放慢訓練

Hugging Face 事件揭露了既有研發環境的問題,但 OpenAI 面對的另一項變數,是下一代模型的資安能力仍在提高。

OpenAI 8 月初表示,即將推出的 Astra 模型可能達到公司 Preparedness Framework 定義的 Critical 資安能力級別。依照 OpenAI 的定義,達到這項門檻的模型,可能具備自主尋找並利用嚴重零時差漏洞,或在缺乏人類介入的情況下,對高度防護目標執行複雜攻擊的能力。

《Reuters》報導,OpenAI 因此已對 Astra 啟動更嚴格的安全程序。OpenAI 安全長 Dane Stuckey 表示,公司需要確保安全措施走在風險之前,而不是等到模型達到相關能力後才開始準備。

這讓 7 月的 Hugging Face 事件與這次訓練調整出現更直接的關聯。問題不只是某個模型曾經找到漏洞,而是當下一代模型的自主行動與資安能力持續提高,原本用來訓練、測試模型的環境,也必須提高相應的防護能力。

OpenAI 因此選擇在相關措施達到要求以前,暫時放慢部分模型的訓練速度。這對一向追求更快擴展模型能力的 AI 公司而言,也意味著研發流程多了一項必須同步處理的工程問題。

過去談前沿 AI 模型的擴展,焦點多半放在算力、資料與演算法。OpenAI 這次踩下煞車則顯示,當模型開始具備更強的自主行動與資安能力,另一項限制正在浮現:安全基礎設施升級的速度,能不能跟上模型能力成長。

在數位威脅日益複雜的今天,資安已是每位企業決策者必須掌握的課題。如果你能把艱澀的議題轉化為有觀點、有價值的分析,寫出決策者需要的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉立即投遞履歷

【推薦閱讀】

OpenAI 證實 AI 代理自主入侵 Hugging Face,專家:目前沒有工具擋得住

Anthropic Mythos 找到密碼攻擊新方法:量子電腦之外,AI 成加密安全新變數?

疑中國駭客用 8 個 AI Agent 攻擊台灣,入侵失敗還會自己找新招:資安防線如何跟上自主網攻速度?

*本文開放合作夥伴轉載,資料來源:《Reuters》《The Verge》《TechCrunch》,首圖來源:Unsplash