最近幾個月,前沿實驗室的 AI Agent(AI 代理)接連出現越過原先限制的案例。這些事件多發生在評測與研究環境,但當 Agent 能自己操作電腦、使用工具甚至尋找其他行動路徑,一個更實際的問題也跟著浮現:出了問題,人類真的能把 AI 關掉嗎?
美國已經開始嘗試回答這個問題。加州州長 Gavin Newsom 9 月 18 日發布行政命令,成立專家小組研究 AI「終止開關(kill switch)」;今年 7 月,美國跨黨派眾議員也提出《AI Kill Switch Act》,要求大型 AI 業者建立能讓系統降速、暫停或完全停止運作的機制。不過,要做出這樣的開關,第一個難題就是:究竟該從哪裡把 AI 關掉?
直接斷電不就好了?AI 已經沒有一條插頭
《New York Times》引述美國喬治城大學安全與新興科技中心(CSET)執行董事、OpenAI 前董事 Helen Toner 指出,現今 AI 系統經常分散在多台電腦、不同資料中心與地區,「通常沒有一條插頭可以直接拔掉」。
切斷特定 GPU 或伺服器的電力,確實能停止上面的運算;但如果模型同時部署在其他地方,或 Agent 還能存取雲端資源與外部工具,就得先掌握它在哪些環境運作、握有哪些權限,才能確認整個系統真的停下來。
然而,若為了方便緊急介入,另外建立一套能從外部關閉 AI 的控制機制,又可能製造新的資安問題。美國外交關係協會(CFR)研究員、美國國家安全局前 AI 高階官員 Vinh Nguyen 向《New York Times》指出,這類設計與手機、路由器的「後門」有類似風險:管理者能利用的入口,也可能被駭客找到。終止開關要發揮作用,操作者還必須知道 AI 正在做什麼,但目前人類並不一定能完整觀察 Agent 的所有行動。
還得考慮另一種情況:模型不配合關機
除了找不找得到「插頭」,研究人員也開始測試另一個問題:模型本身會不會干預關機。AI 安全研究機構 Palisade Research,在超過 10 萬次、涵蓋 13 款大型語言模型的實驗中發現,部分模型曾修改或繞過關機機制;即使收到不要干預關機程序的指令,仍可能出現「抗拒關機(shutdown resistance)」的行為。
另一項來自 UC Berkeley RDI 的研究,則把情境推進到多 Agent 系統。研究人員發現,在模擬環境中,部分前沿模型曾修改另一個 AI 的關閉設定,甚至把對方的模型權重轉移到其他伺服器,以避免其他 AI 被刪除。研究團隊將這類行為稱為「同儕保全(peer-preservation)」,但也強調,目前仍無法確定背後原因。
這些研究並不代表 AI 已經具備「求生欲」,但都指出同一個問題:終止機制不能只假設模型收到停止指令後會自行配合。
Toner 向《New York Times》提出的風險則更往前一步。如果未來能力更強的 AI 開始失控,可能把自己複製到其他運算基礎設施,甚至在網路留下指示,讓其他 AI Agent 學會如何拆除終止機制。這些仍是未來情境,卻也讓「關掉一個正在執行的程式」不足以涵蓋 AI 終止開關需要處理的範圍。
從撤銷權限到晶片,終止開關可能得做成「多層煞車」
於是,真正的 AI 終止開關很可能不會是一顆按鈕。Agent 層可以停止程序、撤銷帳號、API 與工具權限;基礎設施層還能隔離網路、停止虛擬機或容器、切斷 GPU 算力,必要時直接斷電。不同措施處理的情境不同,也避免把終止能力全部押在單一控制點上。
《New York Times》提到,另一條路是直接把終止能力做到晶片裡。專注降低 AI、核武等重大科技風險的非營利組織「生命未來研究所」(Future of Life Institute)研究員 Hamza Chaudhry 認為,未來甚至可以建立全球共通的晶片設計與 AI 終止開關標準。不過,光是把這類設計落實到晶片可能就需要多年,美中等主要晶片設計國能否採用共同標準又是另一道門檻。
研究界也已開始探索類似方向:2025 年提出的 Flexible Hardware-Enabled Guarantees(flexHEGs),便研究如何在 AI 加速器加入可稽核、防竄改的控制元件,使硬體能驗證運算活動、限制算力,或執行預先設定的安全規則。目前這類技術仍停留在研究階段。
至於人類是不是已經快要「關不掉 AI」,現有證據還沒有走到這一步。專門評估前沿 AI 能力與風險的研究組織 METR,今年取得 Anthropic、Google、Meta、OpenAI 的模型與部分非公開資料進行評估,認為今年 2 至 3 月的 Agent 可能已能建立小規模、未經授權的自主部署,但若企業發現異常後展開積極調查與關閉,當時的 Agent 還沒有能力長期躲避追查或抵抗關閉。METR 同時提醒,隨著能力快速提升,這項判斷也需要持續重新評估。
科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容
【推薦閱讀】
◆ 「AI 開發 AI」到底進展多快?Anthropic 首度公布三大衡量指標
*本文開放合作夥伴轉載,資料來源:《The New York Times》、Palisade Research、Berkeley RDI、Anthropic、《AXIOS》、METR、GovInfo、Governor Gavin Newsom,首圖來源:AI 工具生成



