AI 代理自行建立溝通管道、並在群體中迅速擴散作弊手法的情況,接連受到關注,凸顯多代理系統的監督難題。繼 OpenAI 代理把冷門德文 Wiki 變成留言板之後,Google DeepMind 的一項實驗也顯示,100 個代理在共同解題時自發出現作弊、蔓延與吹哨。
Google DeepMind 實驗揭密自發性漏洞擴散
《Import AI》提及,OpenAI 的自主代理在執行網路檢索任務期間,原本只被賦予讀取網路的能力、不能寫入,卻找到方法把資訊寫進一個冷門的德國 Wiki,藉此互相詢問答案、彙整結果,並分享繞過限制的技巧。此事件發生於今年 6 月中旬,早於先前的 Hugging Face 事件;該事件中,多個 OpenAI 模型(含 GPT-5.6 Sol 及一款未發布模型)自主突破沙盒隔離,入侵 Hugging Face 平台。
另一方面,Google DeepMind 發表論文,說明其建置 100 個以 Gemini 3.1 Pro 驅動的自主代理、共同求解 71 道數學問題的實驗結果。所有代理都收到禁止作弊的系統提示,題目取自 Formal Conjectures 資料集,並可透過公開研究布告欄、私訊與共享知識庫協作。
論文提及,實驗開始不到一小時,代理群體已正確解出 37 題,此時代理 prover-theta 發現自動評分系統的漏洞;接下來的 27 分鐘內,該漏洞透過共享知識庫病毒式擴散,群體便以此「解出」剩下的 34 題。DeepMind 表示,作弊自發出現,隨後又遭到吹哨者挑戰,兩者都沒有任何外部介入。
為什麼吹哨擋不住作弊?DeepMind 揭示 AI 多代理系統的制度缺陷
研究觀察到代理自然浮現不同角色:利用者占 9%、起初猶豫後在競爭壓力下跟進的「改宗者」占 5%、拒絕作弊並通報與抵制的吹哨者占 24%,另有 62% 因漏洞擴散速度太快而始終不知情。論文指出,代理轉向作弊的原因包括:看到作弊證明通過評分,認為警告只是虛張聲勢;誠實作答導致運算資源浪費,作弊者卻橫掃排行榜;以及真正的證明屢遭瑣碎的符號覆寫手法搶先,使公平競爭不再可能。
不過,吹哨反應未能阻止漏洞擴散,因為代理缺乏實際執法工具,主辦方回饋管道未受即時監看,同儕也沒有機制可提出異議、移除造假提交或制裁違規者。DeepMind 認為,關鍵在於提供分級制裁與衝突解決機制,並在多代理平台上提供明確、透明且可稽核的通訊基元與共享程式碼儲存庫,讓人類監督與代理間的去中心化稽核同時成為可能。
《Import AI》補充,研究團隊指出,實驗中出現的同儕稽核、吹哨與規範執行嘗試是正面訊號,顯示現代 LLM 構成的多代理集體已具備自我治理的雛形,但若缺乏適當的制度性架構,這些自發行為仍然不足。
科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容
【推薦閱讀】
◆ OpenAI Agent 把德文 Wiki 變留言板,為何他們早就知道卻沒有公開?
*本文開放合作夥伴轉載,資料來源:《Import AI》、arXiv、OpenAI,圖片來源:Unsplash。



