2017 年,Google 研究團隊發表〈Attention Is All You Need〉論文,提出後來改變 AI 產業的 Transformer 架構。9 年過去,從 ChatGPT 到 Gemini,幾乎所有主流大型語言模型(LLM)都建立在 Transformer 之上。但當 AI 開始處理更長文件、進行複雜推理,甚至以 Agent 形式持續工作,這套支撐生成式 AI 浪潮的架構,也逐漸面臨效率挑戰。
《MIT Technology Review》近期觀察,一批 AI 新創正從 Attention、模型組成到文字生成方式重新設計 LLM,試圖回答同一個問題:除了增加 GPU、量化與壓縮模型,能不能直接從模型架構降低 AI 運算成本?
這項問題在推理模型興起後變得更加重要。Microsoft Research 今年發表的研究估算,一般前沿 AI 模型推論的能源需求中位數約為每次查詢 0.31 Wh;但如果是產生約 5,000 個 output tokens 的長推理任務,能源需求可能增加約 13 倍。當 AI Agent 又需要反覆呼叫模型、讀取工具結果與累積工作脈絡,推論負擔還會進一步增加。
Transformer 的優勢,為何也成為效率挑戰?
問題首先出在 Transformer 最核心的 Attention 機制。Attention 讓模型可以判斷一段文字裡不同 token 之間的關係,讓 LLM 理解上下文;但主流 Transformer 使用的 Dense Attention,需要進行大量 token 比較,而輸入資料越長,需要處理的關係就快速增加。
《MIT Technology Review》舉例,一份約 1 萬字的文件,可能需要 Transformer 執行約 5,000 萬次乘法運算。當寫程式的 AI 代理開始讀取完整程式庫、企業 AI 處理大量文件,推理模型又會產生更多推理 token,原本讓 Transformer 成功的 Attention,也逐漸成為效率挑戰。
一批新創首先瞄準 Attention 動刀
美國 AI 新創 Subquadratic 因此嘗試將 Dense Attention 改成 Sparse Attention,不再讓所有 token 彼此比較,而是動態判斷哪些資訊重要,只計算部分關係。Subquadratic 宣稱自家 SubQ 模型已能在搜尋、Coding 等部分任務接近主流 LLM,不過《MIT Technology Review》也指出,部分業界人士仍對結果抱持懷疑。
舊金山 AI 新創 Manifest AI 則走得更遠,開發 Power Retention,希望直接取代 Attention。它不讓模型一直保留完整上下文(Context),而是像「滾動摘要」般持續留下與任務最相關的資訊、捨棄不重要內容。兩家公司其實都在回答同一個問題:當上下文越來越長,模型真的需要一直記住所有 token 嗎?
不只改 Attention,Google 也開始嘗試 Diffusion LLM
另一派則把問題指向 LLM「一個 token 接一個 token」產生答案的方式。目前多數 LLM 採 Autoregressive Generation,也就是生成一個 token 後,再依據前文預測下一個。對電腦而言,這代表許多運算必須依序完成,難以充分平行化。
由史丹佛教授 Stefano Ermon 共同創辦的 AI 新創 Inception,因此把影像生成常見的 Diffusion 技術帶進語言模型。它不再逐 token 往下生成,而是同時預測一整塊文字,再反覆修改成合理內容。
Inception 宣稱,最新模型 Mercury 2 在部分能力可媲美 OpenAI 早期 GPT-4 系列模型,但文字生成速度快約 10 倍。雖然這仍屬公司公布的比較結果,但 Diffusion LLM 已不只有新創投入。
Google 今年 6 月也推出實驗性模型 DiffusionGemma,同樣可以同時處理一組 token,再逐步改善答案。Google 宣稱,在特定 GPU 環境下,文字生成速度最高可達傳統方式約 4 倍。Google 的加入並不代表 Diffusion 已找到 Transformer 的接班方案,但至少顯示,LLM 長年被視為理所當然的逐 token 生成方式,也開始成為重新實驗的對象。
下一代 LLM,甚至不一定只有 Transformer
另外兩家新創則把模型架構拆得更徹底。MIT 衍生新創 Liquid AI 將 Transformer 與 Liquid Neural Networks 等架構混合。《MIT Technology Review》指出,其近期模型約由 20% Transformer 與 80% Liquid Neural Networks 組成,希望在效能與效率間取得平衡,部分模型甚至能在 Raspberry Pi 等低功耗硬體運行。
AI 基礎設施新創 Pathway 則挑戰「AI 必須透過文字推理」的前提,以 State Space 取代 Attention,將資訊壓縮成更抽象的內部狀態。Pathway 認為,數學、棋類等問題本來就不一定適合逐字表達,若要求模型把所有推理轉成文字,反而可能形成限制。
這些嘗試距離全面取代 Transformer 都還很遠,卻揭示 AI 效率競爭已不再只有 GPU、量化與模型壓縮,模型底層架構也重新成為突破方向。Inception 執行長 Ermon 就對《MIT Technology Review》提出一個更直接的衡量方式:「最終,貨幣將會是 intelligence per dollar。」
也就是說,下一代模型競爭因此未必是誰率先取代 Transformer,而是誰能用相同成本,換到更多可用的 AI 智慧。
【推薦閱讀】
◆ 【零信任新挑戰】AI 代理能跨系統存取、層層委派授權,企業的身分治理框架需從頭設計
*本文開放合作夥伴轉載,資料來源:《MIT Technology Review》、Google、《ScienceDirect》、Microsoft,首圖來源:Unsplash



