【開源 AI 安全警訊】中國 AI 開源模型能力逼近西方巨頭,但任何人都能下載並移除安全護欄

中國 AI 開源模型能力逼近西方巨頭,但專家指安全護欄形同虛設可讓攻擊者輕鬆利用

當美國政府還在思考,如何有效管理最先進且能力強大的 AI 模型,如 OpenAI GPT-5.6 Sol 與 Anthropic Mythos 等產品,避免產生國安問題時,來自中國的開放權重 AI 模型 GLM-5.2,卻悄悄拉近了差距。

根據人工智慧安全非營利組織 SaferAI 最新報告,由中國廠商 Z.ai 所推出的 AI 模型 GLM-5.2,在網路安全與生物危害知識方面的能力,僅落後 GPT-5.5 和 Claude Opus 4.7 短短數個月。

然而,若跟西方巨頭的商業閉源模型相較,中國開源 AI 模型的安全實踐,顯然跟不上其頂尖的任務處理能力。

AI 能力邊界不等於風險邊界

SaferAI 透過 Z.ai 官方所推出的 API,針對 GLM-5.2 進行安全評估,結果發現,有別於安全護欄嚴格的主流閉源模型,該模型從不拒絕回答任何有關於網路攻擊或生物危害方面的問題。

這情況似乎在提醒外界,開放權重 AI 模型可能會成為有心份子的方便工具,同時當壞人手握利器時,政府甚至還無從監管或限制潛在攻擊者如何使用 AI 技術。

SaferAI 執行董事 Henry Papadatos 向外媒表示,AI 模型的能力邊界並不等同於風險邊界,因此業界必須將風險緩解措施的現狀一併納入考量,才能妥善評估某個 AI 模型真正具備的風險。

換句話說,即便 Z.ai 未來於官方 API 實踐安全護欄,可是一旦有人在自己的硬體上運行開放權重模型,那麼 API 的保護措施就會形同虛設,畢竟使用者能夠在非官方環境中,任意修改、移除安全防護機制,或者對模型進行微調、系統提示詞改寫等操作。

主流閉源模型也會遭越獄攻擊

主流的閉源模型開發商,如 OpenAI 和 Anthropic,通常會仰賴分類器、主動拒絕訓練及 API 管制等安全措施,限制旗下 AI 模型回答網路攻擊或生物危害話題,只是這些防護措施也並非萬無一失,比方「越獄攻擊」就經常能夠繞過主流模型的安全護欄。

另一個人工智慧安全非營利組織 Far.ai 日前就發現,xAI Grok 4.5 及 Google Gemini 3.1 Pro 等前沿模型,存在著數百種通用的越獄攻擊手段,能夠重複迫使 AI 回應有害問題。

當攻擊者結合多種操縱技巧,例如角色扮演、冒用權限、偽造對話歷史紀錄及後續提示等方法,刻意針對 AI 模型防禦機制的弱點時,越獄攻擊通常都能成功。

由此可見,在商業閉源模型都擁有漏洞的情況下,替任何硬體與運作環境所設計,而且通常沒有進一步防護措施的開源 AI 模型,自然具備更高的風險。

為安全過濾訓練資料陷入兩難

為了讓 AI 模型變得更安全,業界提出了許多解方,其中之一稱為「預訓練資料過濾」,即 AI 開發商先從訓練資料中,移除有攻擊性的網路安全資訊,再利用經過篩選的資料集訓練模型。

部分研究指出,預訓練資料過濾可以在不影響整體模型效能的情況下,減少模型回答生物危害相關知識的機率,但是就網路安全領域來說,刻意過濾資料卻會讓模型開發人員陷入兩難。

畢竟,想要訓練出一個既擅長程式碼撰寫,但又不具備優秀駭客能力的通用 AI 模型,本質上非常困難,尤其隨著軟體開發產業已經成為 AI 應用最大市場,模型開發者在尋求限制濫用方法的同時,也面臨著持續提升 AI 能力的壓力。

中國 AI 更在意政治敏感內容

將焦點轉回 GLM-5.2。中國領導人習近平不久之前在世界人工智慧大會上,強調開放權重模型的重要性,同時也指出 AI 必須是受到人類嚴格控管的工具。

專研中國 AI 政策的史丹佛大學網路政策中心專家 Graham Webster 指出,雖然中國擁有完善的人工智慧監管法規,但規定向來只著重於政治敏感內容、虛假資訊及社會穩定,而非 AI 模型的網路攻擊能力或生物危害知識等風險。

Graham Webster 說,相較於中國 AI 環境,美國更加重視這類攸關人類存亡的災難性事物,因此,未來如果真的出現某種因為 AI 而產生的新型風險,西方企業可能會早先一步應對。

同時 Graham Webster 也推論,既然中國 AI 模型開發商,有能力讓模型拒絕處理某些敏感政治議題,那麼理論上他們也可以套用相同機制,調整模型以拒絕回答網路攻擊、生物危害等話題。

攻擊者工具更新總比防禦方更快

無論如何,開放權重 AI 模型對人工智慧產業依然重要,例如 Hugging Face 就曾經仰賴 GLM-5.2 的力量,抵禦 OpenAI 模型意外發起的資安攻擊事件,進而贏得某些支持者。

SaferAI 執行董事 Henry Papadatos 認為,開放權重 AI 模型的優勢,往往被支持者誇大其詞,某些擁有危險能力的 AI 其實也不應該開源釋出。

Henry Papadatos 直言,關鍵在於那些擁有危害性的 AI 能力,不該輕易被任何人、在任何地方輕鬆取得,業界應致力於只讓「有益的功能」被大眾使用。

尤其在通常情況下,Henry Papadatos 強調,攻擊者採用新工具的速度,會比防禦者來得更快,例如勒索軟體集團可能會在一週內就改變作案手法,但正規、合法的企業,卻經常跟不上部署新型防禦手段的速度。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉立即投遞履歷

【推薦閱讀】

◆ Anthropic Mythos 找到密碼攻擊新方法:量子電腦之外,AI 成加密安全新變數?
◆ 晶片禁令下的破口:美國嚴防硬體輸中,中國卻年砸 5 億美元買進矽谷訓練資料
◆ Meta、OpenAI、Anthropic 接連爆 AI Agent 越界,專家:真正失控的不是模型,是人類治理

*本文開放合作夥伴轉載,參考資料:TechCrunchSaferAI,首圖來源:Nano Banana 2

(責任編輯:鄒家彥)