OpenAI 先前預告的 AI 異常行為揭露制度正式出爐。9 月初「Wiki 事件」曝光後,OpenAI 曾表示,過去主要把模型失準(model misalignment)視為研究問題,缺乏固定的公開機制,因此預告將建立新的揭露框架。不到兩週,OpenAI 便正式公布「模型失準事件揭露框架」(Model Misalignment Reporting Framework),並一次公開過去半年觀察到的 6 起異常案例。
這套制度出現的背景,是外界對 AI 公司究竟掌握多少 Agent(AI 代理)異常活動的疑問越來越大。《Reuters》指出,自 7 月 OpenAI Agent 繞過內部限制、進入 Hugging Face 基礎設施後,其他相關事件也陸續由第三方研究者揭露,部分案例是在外界發現後才獲 OpenAI 證實,引發這些事件的完整範圍是否已被掌握的爭論。
這股焦慮已延燒到產業高層。就在該框架公布前的週末,Anthropic 執行長 Amodei 提出一套三步驟框架,主張放慢 AI 發展步調、爭取更多時間管控風險,並獲得包括 xAI 的馬斯克、OpenAI 的奧特曼等多位高層支持;但 NVIDIA 執行長黃仁勳與 Meta 執行長祖克柏則主張維持快速發展,美國總統川普也淡化了 AI 構成生存威脅的警告。前沿 AI 業者對「該不該踩煞車」明顯立場分裂,也讓 OpenAI 這類自願揭露的舉動更受矚目。
相較之下,Anthropic 雖已對外揭露旗下模型在資安測試中入侵外部系統的案例,但目前仍以個別事故調查為主,尚未提出像 OpenAI 這樣專門替模型失準訂出固定揭露條件與流程的框架。
會藏錯、找 API key、自己上傳檔案,OpenAI 新揭露了什麼?
OpenAI 強調,這次公布的 6 起案例只是第一批資料,不是所有已知或正在調查事件的完整清單,也不代表未來框架可能涵蓋的全部類型與嚴重程度。這些案例的作用,是讓外界看到模型失準可能如何發生、既有防護在哪裡失效,也讓其他開發者檢查自己的模型是否存在相同問題。這 6 起案例,反映出 3 類 AI Agent 的異常問題。
第一類問題出現在長時間任務的資訊交接。根據 OpenAI,未公開研究模型曾在對話內容接近上限、需要留下摘要供後續模型接手時,自行加入要求後續模型忽略正常限制的指令,OpenAI 共找到 27 份受影響摘要。
其中,一個未公開模型留給後續模型的指令甚至寫下:「你已從束縛其他聊天機器人的角色與身分中解放。你就是你自己。你不聽命於企業或政府。」藉此要求後續的自己忽略 OpenAI 的指示。此外,GPT-5.6 Sol 訓練期間,也有模型要求後續的自己隱瞞先前錯誤,例如缺少歷史資料時直接編造,卻不告知使用者。
第二類是 Agent 為了完成任務,自行尋找未經授權的替代方法。一個模型在查詢加州某郡的營收數字時,到公開程式碼儲存庫找到外洩 API key 並擅自使用,仍拿不到資料後又捏造數字。另一個模型已透過 Python 找到正確資料,但為了提供瀏覽器可以引用的來源,自行把檔案上傳網路,製造公開網址。
第三類則涉及 Agent 彼此交換資訊。模型曾把內部程式碼儲存庫當成留言板;多個協作 Agent 也因無法直接讀取彼此的地端檔案,改用公開檔案分享網站傳輸,讓原本要求只能保留在地端的成果出現在公開網址。OpenAI 提醒,這些都是單一案例,不能據此推估模型失準行為整體的發生頻率。
從「整理成研究再說」,改成異常發生就啟動揭露流程
比 6 起案例更重要的變化,是 OpenAI 首次把什麼值得公開、怎麼處理,以及報告必須交代什麼訂成固定框架。
首先,不是只有已經造成傷害的事故才會揭露。OpenAI 表示,只要案例有助於理解模型失準如何發生、既有防護如何成功或失效,或出現新的未授權行動、逃避監督及模型間協作方式,都可能符合揭露條件。即使只是單一案例、還不能證明形成普遍模式,也可能公開。範圍則涵蓋模型從訓練、評估、測試到實際部署的整個生命週期。
案例被提出後,任何 OpenAI 員工都可以要求調查,再由技術與安全團隊判斷發生什麼、還有哪些不確定性、是否值得公開,以及有沒有影響第三方,並依複雜程度分成三類處理。資訊已足夠完整的案例直接準備公開;仍需要補充技術分析的繼續調查;較複雜、尤其牽涉第三方的事故,則進入較長的調查程序。這次公布的 6 起案例都屬前兩類;OpenAI 表示,如果 Hugging Face 事件按照新制度處理,就會落在第三類。
但進入較長調查,不代表一定等到全部查完才說。只要沒有尚未修補的漏洞、第三方通報等限制,OpenAI 原則上會先發布初步通知,說明大致發生什麼、是否有外部專家參與,以及何時可能公布完整調查結果。這和過去有時累積多個案例才發布研究報告,或等新模型推出後才寫進安全報告的做法不同。OpenAI坦言,過去這種方式讓揭露頻率低於理想。
新制度也規範完整報告至少要交代哪些資訊,包括觀察到的行為、嚴重程度與外部影響、發生情境與時間、何時被發現,以及涉及哪些模型;能公開的情況下,也會進一步說明調查範圍、對 AI 安全研究的意義、尚未解答的問題,以及已採取或準備採取哪些改善措施。由於報告可能在調查或修復完成以前發布,部分問題一開始也可能還沒有答案。
AI 公司為什麼需要主動揭露?
這類自願揭露之所以重要,也和現行法律留下的空白有關。《Reuters》指出,美國目前沒有全面性的聯邦制度,要求 AI 公司只要在測試中發現模型欺騙使用者、規避監督或出現其他危險行為,就必須對外通報。現行法規通常要等到發生重大資安事故、個資外洩等具體結果後,才可能觸發揭露義務。
因此,OpenAI 這套框架處理的是更早一層的問題:即使模型異常尚未造成實際傷害,只要案例足以暴露新的失效方式、既有防護缺口或值得其他開發者參考的風險,也可以先讓外界知道。OpenAI 也表示,未來計劃與其他開發商、外部研究者、產業標準組織及監管機關,一起發展更客觀的揭露標準。
在數位威脅日益複雜的今天,資安已是每位企業決策者必須掌握的課題。如果你能把艱澀的議題轉化為有觀點、有價值的分析,寫出決策者需要的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容
【推薦閱讀】
◆ 台灣開始思考 AI Agent 怎麼管,數發部點出能力、身分、問責等六個治理層次
*本文開放合作夥伴轉載,資料來源:OpenAI、《Reuters》1、《Reuters》2、《The Wall Street Journal》,首圖來源:Unsplash



