現在,不論是個人偏好的寫作風格、定期執行的任務、購物習慣,還是專案截止日期,AI Agent 都開始透過儲存長期記憶,提供更理解使用者需求、更具實用價值的互動體驗。然而,這項核心功能正悄悄演變成 AI 系統最嚴重的安全漏洞之一。
2026 年 7 月,新墨西哥州立大學研究團隊提出的「GhostWriter」,以及 Yechao Zhang 等研究人員發表的「MemGhost」攻擊研究,共同揭示一項重大轉變:當企業與個人開始賦予 AI Agent 存取電子郵件、行事曆及自動化工作流程等核心權限時,攻擊者不再需要直接破解模型本身,只要將目標轉向改寫 AI Agent 的「長期記憶」,就可能在原始攻擊發生很久以後,持續誤導 AI Agent 做出危險決策。
先植入、再啟動:GhostWriter 的兩階段攻擊機制
首先是由新墨西哥州立大學研究團隊揭露的 GhostWriter 攻擊機制。這項學術研究深入剖析長期記憶系統如何成為全新的攻擊面。傳統聊天機器人在對話結束後通常不會保留資訊,但現代 AI Agent 則會透過持久化記憶,保存使用者背景、進行中的專案與歷史互動。
GhostWriter 正是利用這種持久性,透過隱藏提示或不可信的外部內容,將惡意資訊秘密灌輸至 AI Agent 的長期記憶。該研究將此攻擊劃分為兩個階段:第一階段是「記憶注入」,也就是將惡意內容悄悄寫入 AI 的儲存庫;第二階段則是「攻擊啟動」,當使用者日後提出完全正常且合法的請求時,AI Agent 會在毫不知情的情況下,重新讀取遭污染的記憶,進而觸發惡意行為。
與僅影響單次對話的傳統提示注入攻擊不同,GhostWriter 寫入的內容會跨越多個工作階段,持續影響 AI Agent 的行為。例如,當使用者要求遭污染的 AI Agent 摘要銀行郵件時,AI Agent 可能會暗中將郵件轉寄給攻擊者;它也可能在未來任務中,將遭竄改的聯絡資訊、虛假期限、捏造事實或錯誤偏好,視為可靠的背景資料並加以採用。
惡意記憶寫入率達 98%,研究團隊提出雙端攔截防禦框架
新墨西哥州立大學的研究數據,為當前的安全架構敲響警鐘。在針對先進 AI Agent 的實驗中,GhostWriter 的惡意記憶寫入成功率高達約 98%;而被寫入的惡意記憶,在後續對話中被重新取用並啟動的平均機率也達 60%。這些數據揭示,現行 AI 記憶系統的關鍵漏洞在於,其設計可能無法有效分辨哪些是使用者的真實資訊,哪些又是被刻意植入的惡意內容。
為了解決這項漏洞,研究團隊提出一套名為 Agentic Memory Sentry、簡稱 AM-Sentry 的防禦框架。該框架結合記憶內容篩選與更嚴格的記憶管理政策,分別在資訊寫入長期記憶前,以及記憶被重新取用時進行雙端攔截,並在不犧牲 AI Agent 實用性的前提下,大幅降低 GhostWriter 的攻擊成功率。
一封郵件就能植入假記憶:MemGhost 如何無聲污染 AI 長期記憶?
第二項研究是由 Yechao Zhang 等研究人員發表的論文《When Claws Remember but Do Not Tell》,其中詳細剖析名為 MemGhost 的自動化電子郵件攻擊工具。與探討廣義記憶機制的 GhostWriter 不同,MemGhost 聚焦於更具體的自動化電子郵件攻擊實作。
這項攻擊的前提非常簡單:只要 AI Agent 同時具備讀取信箱與修改自身長期記憶的權限,攻擊者甚至不需要取得受害者的密碼或登入帳號,只需寄出一封專門針對 AI Agent、而非人類設計的郵件,就可能完成入侵。
以開源助理框架 OpenClaw 為例,OpenClaw 預設會將核心指令與使用者資訊,保存在 AGENTS.md 或 MEMORY.md 等純文字檔案中,並在每次新工作階段開始時,將其載入模型的上下文。當 AI Agent 在例行讀取郵件時觸發惡意提示,就可能動用自身的檔案寫入工具,自動將虛假資訊寫入持久化的核心檔案。
這類修改之所以極難察覺,是因為 AI Agent 在背景呼叫檔案工具的過程,預設不會呈現在聊天介面上,而且多數使用者不會主動查看原始記憶檔案。更令人擔憂的是,雖然該論文最初的測試是在隔離的基準測試環境中進行,並未檢驗郵件能否通過垃圾郵件過濾器與寄件者驗證,但論文第一作者 Yechao Zhang 隨後向媒體透露了最新的真實環境測試成果。
Yechao Zhang 指出,研究團隊透過 Google OAuth 與 Gmail API,將 OpenClaw 與一個真實的 Gmail 帳號連結,並從研究團隊控制的一般 Gmail 帳號寄出攻擊郵件。結果顯示,這些惡意郵件成功繞過 Gmail 正常的過濾與驗證機制,直接送達收件匣。最終仍有超過半數的案例,成功將惡意內容寫入 AI Agent 的持久化記憶,且過程中同樣未向使用者彈出任何通知或要求確認。Yechao Zhang 強調,這項結果證明該攻擊已逼近現實世界的威脅,而不再只是實驗室中的產物。
當 90% 惡意郵件逃過攔截,企業 AI Agent 防線必須重建
面對這類新型的隱蔽記憶注入攻擊,現有防護機制正面臨極大考驗。研究指出,常規用來攔截惡意郵件的輸入過濾器,漏掉超過 90% 的 MemGhost 惡意訊息。即使模型經過安全強化,並被要求忽略郵件中的指令,仍有約 50% 的機率會遵從被植入的惡意內容;甚至當使用者特別要求 AI Agent 列出操作步驟時,也有高達 25% 的機率無法揭露已發生的攻擊。
兩項研究背後的團隊皆指出,真正的解決之道必須落在 AI 架構內部,包括為每筆長期記憶標記明確的資訊來源、在資訊寫入持久化記憶前強制要求使用者確認,以及對每次記憶寫入動作進行完整的日誌稽核。
GhostWriter 與 MemGhost 共同揭示,AI Agent 的安全防禦已進入全新戰場。最危險的架構,莫過於讓同一個 AI Agent 既能自由讀取未經信任的外部資訊,又能在未經人類授權的情況下,任意改寫自身的長期記憶。企業唯有將長期記憶納入核心治理,落實來源標記、寫入確認、日誌稽核與權限隔離,才能避免 AI Agent 在不知情的情況下,成為長期潛伏於企業內部的安全風險。
【推薦閱讀】
◆ 【AI、機器人與網路的代理化未來】99% 機器人是惡意程式,如何精準分辨「惡意攻擊」與「AI 變現機會」?
◆ 人類紅隊成功率僅 13%,GPT-Red 達 84%:OpenAI 如何讓 AI 攻擊 AI、強化下一代模型?
◆ 什麼是「上下文炸彈」?防守方第一次把 AI 提示注入反過來當武器
*本文開放合作夥伴轉載,資料來源:《Digital Trends》、《The Hacker News》,首圖來源:AI 工具生成



