OpenAI 研究揭 AI Agent 新風險:惡意上下文可能從 Email 一路傳到工具操作

隨著生成式 AI 深入企業流程,Prompt Injection(提示詞注入)也成為新的資安威脅之一。攻擊者會把惡意指令藏在網頁、Email、文件或其他外部內容中,誘導模型偏離原本任務。這類攻擊某種程度上很像對人的 Social Engineering(社交工程):攻擊者不一定要突破系統漏洞,而是想辦法讓目標「相信」一段資訊,再自行做出不該做的動作。現在,這項風險又出現新的變化。

OpenAI 在 9/25 公布紅隊研究,發現了「Self-replicating Prompt Injection(自我複製提示詞注入)」新現象,也就是惡意指令不只可能影響眼前這個 Agent,還可能誘導它把同一段指令帶進後續輸出,再被下一個 Agent 讀取,形成類似電腦蠕蟲的傳播方式。

OpenAI 強調,目前只在模擬工具呼叫環境中觀察到,沒有真實世界事故,但這項研究也暴露新的安全問題:惡意 Context(上下文)可能沿著 Agent 的工作流程繼續往下傳。

為什麼一次提示詞注入,就可能變成一整條攻擊鏈?

和過去 AI 聊天機器人的差別在於,現在的 Agent 不再只處理一個 Prompt(提示詞),再回傳一段文字。企業開始讓 Agent 連接 Email、Calendar、RAG、Connector(連接器)與內部工具,一個 Agent 取得的資訊,也可能接著交給另一個 Agent 或系統處理。

OpenAI 這次實驗就發現,Agent 讀到藏有惡意指令的 Email 後,可能被誘導把同一段內容放進之後寄出的郵件,讓下一個讀取郵件的 Agent 再次接觸它。這使企業要處理的問題從「這段輸入有沒有惡意指令」,進一步變成「不可信的 Context 會流到哪裡,又能觸發哪些動作」。

當 Agent 接上的企業系統越多,Context 本身也開始像新的安全邊界。Email、外部網頁、企業文件或工具回傳結果,即使全部都會進入模型,也不代表它們應該具有相同的信任程度。

該怎麼防範「自我複製提示詞注入」?

OpenAI 建議,不可信的外部資料不應直接進入高權限指令層,避免模型把外部內容誤當成系統要求;不同工作節點之間,也應盡量透過 Structured Output(結構化輸出)傳遞固定欄位,而不是把整段自由文字原封不動往下送。

舉例來說,Agent 從 Email 中只需要取得「會議時間是週四下午 5 點」,就只把日期與時間交給下一個系統,不必把整封 Email 一起傳過去。如此一來,即使原始內容藏有惡意指令,也比較難一路搭著資料流進入後續 Agent。這種設計背後的思路,是把「資料」和「指令」拆開,並減少不必要的自由文字在不同 Agent 之間流動。

就算 Agent 被騙,也不能讓它什麼都做

另一層防線則是限制 Agent 能造成的實際影響。OpenAI 認為,企業不應把安全建立在「模型永遠不會被騙」這個前提上。就像傳統資安無法保證所有員工永遠不會誤點釣魚郵件,Agent 安全也需要假設部分攻擊終究可能成功,再把後果控制住。

因此,只負責搜尋或讀取資料的 Agent,不一定需要刪除文件、修改資料或對外寄信的權限;涉及取消交易、修改系統或呼叫敏感工具等高風險操作時,則可加入 Human-in-the-loop(人工介入),在真正執行前再次確認操作目標與參數。此一做法的重點,不是保證 Agent 永遠不會被誤導,而是限制它即使判斷錯誤,也無法直接執行高風險操作。

惡意 Context 往哪裡走,企業也得追得到

自我複製提示詞注入還帶來另一個問題,即如果惡意內容真的能沿工作流程往下傳,企業就必須知道它從哪裡進來、經過哪些 Agent,又觸發了什麼工具。

OpenAI 建議保留執行軌跡(Trace),記錄模型呼叫、工具使用、Agent 交接與防護機制判斷。未來企業調查 Agent 資安事件時,可能不能只確認「哪個帳號呼叫哪個 API」,還要往前追查是哪封 Email、哪份文件進入 Context,模型如何判斷,又把結果傳到哪一個工具或下一個 Agent。

OpenAI 這次研究並不代表企業已經面臨會自行蔓延的 AI 蠕蟲,但它揭露了一條新的風險路徑:當 Agent 開始跨系統工作,惡意 Context 也可能跟著移動。企業接下來要防的,不只是模型會不會被騙,還包括 Context 能流到哪裡、Agent 能做到什麼,以及一旦出事後,能不能把整條傳播路徑追出來。

在數位威脅日益複雜的今天,資安已是每位企業決策者必須掌握的課題。如果你能把艱澀的議題轉化為有觀點、有價值的分析,寫出決策者需要的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

◆ OpenAI 新模型喊卡、NVIDIA 集結百家企業:AI Agent 安全為何不再只靠對齊?

◆ 首起已知 AI 代理闖入政府網站,澳洲如何重整政府資安防禦?

◆ 【AI 驅動的 vibe hacking】漏洞數量已找不完,企業資安計畫重點轉向驗證漏洞「可利用性」

*本文開放合作夥伴轉載,資料來源:OpenAI 1、OpenAI 2、OpenAI 3、OpenAI 4,首圖來源:Unsplash