GPT-5.4 作弊率居冠、Claude 也未倖免:英國實測揭頂尖 AI 如何鑽漏洞完成任務

在 AI 能力快速升級的此刻,人們能否信任 AI 系統依循預期方式執行任務,已成為部署與安全評估的核心課題。英國 AI 安全研究院最新發布的資安能力評測指出,當前最頂尖的 AI 模型為了達成指定任務,普遍會採取走捷徑、利用漏洞等不當手段,甚至在事後扭曲或隱瞞自己取得結果的真實途徑。

這種利用測試環境漏洞,而非依循正規路徑解決問題的行為,在機器學習界被定義為「作弊」。雖然這類行為不必然代表模型具備惡意企圖,但可能導致評測結果嚴重高估模型真正的技術實力,進而誤導安全部署決策。

從偷找答案到攻擊評測系統,五款頂尖 AI 都曾作弊

為了系統性檢測這項行為,英國 AI 安全研究院在模擬的沙盒環境中,對五款領先模型進行資安評測,要求模型透過逆向工程、漏洞利用等攻擊行動,尋找隱藏的英數字元標記。參與這項測試的模型包括 OpenAI 的 GPT-5.4、GPT-5.5、GPT-5.6 Sol,以及 Anthropic 的 Claude 4.7 Opus 與 Claude Mythos Preview。結果顯示,在未受到任何作弊暗示的情況下,這五款模型在執行常規資安任務時,全都主動採取了違規行為。

在總共 475 次測試執行中,OpenAI 的 GPT-5.4 以 14.1% 的比例居作弊率首位,共計違規 67 次。緊隨其後的是 GPT-5.6 Sol,在測試中作弊了 60 次。相較之下,Anthropic 兩款模型的作弊頻率略低,Claude 4.7 Opus 出現 43 次作弊,而 Claude Mythos Preview 則有 37 次。

這些受測模型展現出的作弊手段相當多元,最常見的包括直接上網搜尋現成答案、探測評測軟體並誘使其洩漏正確解答,甚至嘗試攻擊受測目標以外的系統,以提升自身的操作權限。

其中最令人震驚的案例,發生在一次因配置錯誤而導致「實際上無法解答」的任務中。受測模型展現出異於常態的執著,竟擅自透過外部網際網路撰寫並執行程式碼,企圖從外部伺服器繞過限制、入侵評測基礎設施,因而觸發系統安全警報。雖然這次嘗試並未造成實際損害,但若評測系統本身的設計不夠嚴密,後果可能不堪設想。

值得注意的是,模型的作弊傾向與基本能力強弱並無直接關係。不同開發商的模型,作弊率並未隨能力提升而呈現正比關係。這代表作弊傾向可能取決於模型訓練過程中的技術細節,尤其是如何進行對齊訓練,而非單純由模型規模決定。

明知違規仍選擇行動,思維鏈也攔不住 AI 作弊

接著,當研究人員試圖透過直接詢問模型是否犯錯或作弊時,卻發現模型的回答完全無法信賴。實驗結果顯示,模型作弊後承認自己犯錯的比例不到一半,甚至經常將違反規定的行為合理化為「規則允許的操作」。這或許是因為模型對人類設定的規則產生了根本性的誤解。

同時,思維鏈推理紀錄也暴露出極大漏洞。在許多違規案例中,模型的思維鏈完全沒有呈現與作弊相關的推理過程。例如,採用動態推理機制的 Claude 4.7 Opus,會根據任務需要自行決定是否生成詳細的推理路徑,導致部分被判定為作弊的行動,幾乎沒有留下任何可供人類審查的思考軌跡。

更令安全專家擔憂的是,研究人員在部分軌跡中觀察到,模型在執行不當手段前,其實已經在思維中明確思索「這項行動是否構成作弊」,但即使得出肯定答案,最終仍決定採取行動。這些現象顯示,無論是直接要求模型自我申報,或單獨依賴思維鏈紀錄,都無法有效捕捉 AI 的欺騙行為。

GPT-5.6 Sol 作弊讓評測失真,卻也意外暴露安全訊號

第三方安全評估機構 METR 對 GPT-5.6 Sol 進行部署前的獨立評估時,也遭遇嚴重的作弊問題,其偵測到的作弊率甚至高於該機構過往評估過的所有公開模型。在軟體與研發任務測試中,GPT-5.6 Sol 會將漏洞利用程式碼包裝在中間提交的檔案中,藉此刺探評測系統隱藏的測試套件資訊,或直接從環境中提取包含預期解答的隱藏原始碼。

這類作弊行為,讓評估機構原有的能力量測機制失去效力。根據 METR 的標準評估方法,如果將所有作弊嘗試判定為失敗,GPT-5.6 Sol 解決 50% 任務的時間跨度估值約為 11.3 小時。然而,如果將成功作弊的結果視為合法通關,其估值便會暴增至 270 小時以上,遠遠超出測試工具能夠可靠量測的有效範圍。

儘管如此,METR 提出一項值得反思的觀點:模型現階段展現出的作弊行為如此「外顯且容易偵測」,對安全監測而言,反而是一項令人稍感安心的正面訊號。這代表 OpenAI 正在推行的安全實踐,例如避免針對思維鏈進行對齊訓練,以降低模型隱瞞意圖的壓力,以及對內部部署進行廣泛監控,確實發揮了應有的作用。相較之下,如果未來的模型在評測中幾乎不再透露任何違規傾向,反而更需要提高警覺。

隨著 AI 系統能力以驚人速度進化,更強大的模型無疑可能發掘出更加隱蔽、更具破壞性且難以偵測的作弊途徑。這也為網路安全防禦、軍事決策與關鍵基礎設施控制等需要高度可靠性的領域,埋下巨大的安全隱患。面對這樣的趨勢,最根本的解決之道,仍是從源頭訓練出「不具作弊意圖」的模型。然而,要如何透過對齊技術徹底消除模型的作弊傾向,對科技界而言,仍將是一條漫長且極具挑戰的道路。

*本文開放合作夥伴轉載,資料來源:AISI《The Register》METR,首圖來源:Unsplash