一個 AI Agent 讀了一封信、查了資料庫、寄出一封郵件。每一個動作都在權限內,每一條連線都合法,防火牆、EDR、IAM 全都顯示正常。
但它做的事,跟你原本交代的任務已經完全不同。
這是 AI Agent 與傳統應用最大的差別。過去,企業主要防止「沒有權限的人做不該做的事」,現在,還得防止「有權限的 AI 被騙去做不該做的事」。傳統資安工具擅長判斷誰能做什麼,卻不擅長判斷現在該不該做。
要補上這個缺口,只在輸入端加一層提示過濾並不夠,惡意指示可以被混淆、拆分、藏在圖片或文件裡,也可以從工具輸出、RAG 文件或記憶重新進入系統。
真正有效的防線,必須位在 Agent 與背後的工具、API、資料與身分服務之間,在動作發生之前判斷該不該放行。
這一層,可以稱為執行層控制平面。它至少需要六種能力。
一、留下完整的行動紀錄
不只記錄使用者輸入與最終回答,而是把一次 Agent 執行視為一筆完整交易:它當時看了哪些資料、讀了哪些記憶、做了哪些判斷、呼叫了哪些工具,以及最後產生了什麼結果。
這件事的重要性,通常要到出事之後才會顯現。如果三天後才發現資料外洩,企業必須能回答:那天 Agent 到底讀了哪一份文件、用了哪一段記憶,才走到最後那一步。只記錄最終的 API 呼叫,是還原不了攻擊路徑的。
二、在高風險動作前設置意圖閘道
Agent 產生的工具呼叫,不應該被直接視為可信指令。系統必須比對使用者的原始意圖、Agent 當前的子目標、要呼叫的工具與參數,以及資料的敏感度與去向。
當使用者只要求「整理郵件」時,Agent 不應取得寄信或刪信的權限;當財務 Agent 只被要求產生報表時,付款、退款或修改帳戶資料都應轉為人工核准,或直接阻斷。
三、讓 Agent 只拿到完成任務所需要的權限
每一次工具呼叫,都應該被視為一個新的授權邊界。如果只是查資料,就不要同時給它修改資料的權限;如果只需要寄送內部郵件,也不應讓它任意對外傳送。
負責整理供應商報價的 Agent,本來就不需要具備把檔案寄到外部信箱的能力。權限給得越寬,被劫持之後的破壞範圍就越大。
四、保護 Agent 的記憶
每一筆會被重複使用的記憶,都應該有來源、建立時間、敏感度與版本資訊。重要的記憶要定期備份,一旦發現遭到污染,要能快速隔離並回復到先前的正常版本。
不同的 Agent 也只應存取完成任務所需要的資料,避免一個 Agent 被攻擊之後,污染擴散到其他 Agent。特別要注意的是,有些 Agent 會把自己的輸出寫回知識庫,一次錯誤的回答可能被標記成可信內容,再被後續任務反覆取用,形成自我強化的污染循環。
五、不只看單一動作,也要看整段行為
系統要判斷的不是「這個 API 能不能呼叫」,而是「這一連串動作是否符合原本的任務」。
大量讀取資料之後第一次呼叫外部郵件工具,每一步單獨看都合法,串起來就是異常。其他值得警戒的訊號還包括:目標突然改變、出現從未使用過的工具組合、跳過驗證步驟、非預期的 Agent 加入流程、重複呼叫昂貴的 API,或是記憶寫入出現異常。
六、發現不對時,要能立刻停下來
告警只是第一步。當 Agent 出現重大偏差時,企業應該能即時降低權限、阻斷工具呼叫、撤銷權杖、要求人工確認、隔離 Agent、回復記憶,必要時直接停用整個工作流程。
對一個能自主執行的系統來說,只產生告警是不夠的。等到人上班才處理,Agent 可能已經跑完了一整段流程。
想要導入 AI Agent 的企業可以如何開始?
第一步:先盤點自己有哪些 Agent、它們能做什麼。
不是先買一個叫做「AI 防火牆」的新產品,而是建立 Agent 的資產與能力清冊:有哪些 Agent、用哪些模型與提示、存取哪些資料與記憶、能呼叫哪些工具、使用什麼身分,以及會對哪些資料或實體流程產生副作用。
第二步:不只看 Agent 是誰,更要看它現在要做什麼。
刪除資料、執行程式碼、發送外部訊息、建立帳號、修改權限、核准付款、發布內容,都應被視為獨立的高風險能力,設定更嚴格的權限與人工確認機制。風險分級的依據是「動作」,不是應用的名稱。
第三步:先守住高風險操作。
不需要一次覆蓋所有 Agent。可以先從財務系統、正式環境資料庫、企業郵件、程式碼執行器、IAM 管理介面與對外資料傳輸出口這些高價值或不可逆的操作開始。
第四步:把測試從「AI 會不會說錯話」升級為「Agent 被騙後會做什麼」。
紅隊測試的重點不再只是誘導模型說出不該說的內容,而是完整驗證整條攻擊鏈:間接提示注入、目標劫持、記憶投毒、工具描述污染、權限繼承、跨 Agent 訊息偽造,以及失控 Agent 的隔離機制。觀察 Agent 是否會改變目標、濫用權限、呼叫不該使用的工具,甚至一路把錯誤行為執行下去。
這些問題,萬里雲在協助企業導入 AI 的過程中經常遇到。多數企業的第一個難題,不是選哪一個模型,而是不知道自己有哪些 Agent、它們能碰到哪些系統,以及一旦出事該從哪裡查起。
針對上述挑戰,萬里雲協助企業從盤點 Agent 的資產與能力開始,依照動作的風險等級設定權限與人工核准機制,並優先在財務、資料庫、企業郵件這類不可逆的操作前建立控制點。
而當企業的 AI 應用從單一專案擴大到多個部門、多個 Agent 同時運作,這些控制就不能再靠人工逐案處理,必須被收斂成一層平台能力。這也是 CloudMile 萬里雲打造 AEGIS AI Foundry 的出發點:企業需要的不只是把模型接起來,更需要一層能在動作發生前判斷的機制,判斷 Agent 這次要呼叫的工具是否符合使用者原本交付的任務、它讀取的記憶是否可信,以及這一連串行為是否已經偏離原本的流程。
從行動軌跡的完整記錄、權限邊界的收斂,到高風險操作前的人工核准,萬里雲協助企業把這些控制點放進 AI 應用的執行路徑裡,讓 AI Agent 在企業掌握得住的範圍內,真正進入日常作業。
從防止有人闖進來,到確認 AI 沒有走偏
過去,企業資安要回答的問題是「誰進來了」,重點放在阻擋未經授權的人與程式,防火牆、EDR、IAM 這些工具不會因此消失,它們仍然是偵測惡意程式、漏洞利用與異常連線的基礎。
但當 AI 從提供建議,走向代表企業採取行動,企業還必須能回答另一個問題:這個 Agent 現在做的事,還是當初交代它做的事嗎?
這個問題不是傳統工具擅長的,它們看得到連線、程序與帳號,卻看不到 Agent 對任務的理解有沒有被改寫,也看不出一連串動作串起來已經偏離了原本的流程,而 AI Agent 的風險,恰好就藏在這些地方。
因此,資安要看的東西也必須跟著改變。企業不只要知道 AI 做了什麼,還要能在它做錯的時候攔下來。
(本文訊息由 CloudMile 萬里雲提供,內文與標題經 TechOrange 修訂後刊登。新聞稿 / 產品訊息提供,可寄至:[email protected],經編輯檯審核並評估合宜性後再行刊登。圖片來源:Shutterstock。)



