Groq 3 LPX 正式量產:NVIDIA 為何願意讓 GPU「少做一點」?

NVIDIA 去年底取得 AI 推論晶片新創 Groq 的技術後,第一批產品正走向市場。美國時間 8 月 24 日,NVIDIA 宣布 Groq 3 LPX 已正式全面量產,AI 雲端服務商 Nebius 將率先導入,相關機架預計今年上線。

《CNBC》此前報導,NVIDIA 與 Groq 的交易規模約 200 億美元。不過,Groq 官方公布的形式並非收購,而是非獨家推論技術授權。Groq 創辦人 Jonathan Ross、總裁 Sunny Madra 與部分團隊加入 NVIDIA,公司本身則繼續獨立營運。

值得注意的是,Groq 3 LPX 負責的推論工作,原本 GPU 也做得到。既然 NVIDIA 已靠 GPU 主導 AI 運算市場,為什麼還要加入另一種專門處理推論的晶片?

AI Agent 把推論延遲問題放大

原因首先來自 AI Agent 工作方式的改變。一般聊天機器人多半是一問一答,但 Agent 完成任務時,可能反覆推理、寫程式、呼叫工具,再根據結果進入下一步。每一輪產生的新內容,又會加入後續推理的上下文。

NVIDIA 技術文件指出,長時間運作的 Agent 可能經歷數百輪互動,上下文累積到數十萬 token。任務進行得越久,模型需要帶著處理的資訊也越多,如何在長上下文下維持反應速度,因而成為新的推論問題。

在 AI 效能評測機構 Artificial Analysis 的特定測試中,Groq 3 LPX 運行 Gemma 4 31B、10 萬 token 上下文時,每秒可輸出約 3,400 個 token。這項結果不能直接代表所有模型與實際環境,但也說明 NVIDIA 為什麼開始把低延遲視為 Agent 推論的重要需求。

在多輪 AI Agent 工作過程中,每一輪帶入的上下文會持續增加。圖片來源:NVIDIA

不再要求一種晶片把所有工作做完

NVIDIA 的解法也不是單純用 Groq LPU 取代 GPU,而是拆開推論流程。依 NVIDIA 技術文件,Rubin GPU 與 Groq LPU 可以採取不同搭配方式,例如分別處理預填充與解碼,也能進一步把 attention、FFN 等運算交給不同硬體。核心思路不是固定哪顆晶片負責哪一段,而是依模型與工作負載,把不同工作交給更合適的處理器。

這也解釋 NVIDIA 為什麼願意讓 GPU 少做一點。NVIDIA 衡量 Groq 3 LPX 的方式,不只看單顆晶片速度,而是直接計算有限電力能處理多少推論。按照官方針對特定兆級參數模型建立的情境估算,Rubin 搭配 Groq 3 LPX,最高可將每 MW 電力能處理的推論量提高 35 倍,並帶來最高 10 倍的營收潛力。這些是 NVIDIA 自己的估算,並非客戶實際營收,但也透露它如何計算這門生意。

如果 LPU 更適合處理要求即時反應的推論,就交給 LPU;GPU 則集中處理它更擅長的大規模運算。對 NVIDIA 而言,目標不一定是讓每項工作都經過 GPU,而是讓同一座資料中心在有限電力與設備下完成更多 AI 工作。

GPU 少做一點,NVIDIA 想守的反而更多

Groq 也不是單一案例。NVIDIA 同一天再次強調 NVLink Fusion,讓雲端服務商與晶片業者自行設計的 CPU、XPU,也能使用 NVIDIA 的高速互連、機架與相關軟體,與 GPU 組成客製化 AI 系統。

這讓客製晶片崛起與 NVIDIA 之間,不再只是誰取代誰的問題。即使某些 AI 工作交給專用晶片,只要這些晶片仍透過 NVIDIA 的互連、網路、機架與軟體共同運作,NVIDIA 依然可能掌握整套 AI 基礎設施。

Groq 3 LPX 因此不只是 NVIDIA 多了一款推論晶片。它透露的更大變化是,當 AI 運算越來越需要不同晶片分工,NVIDIA 要最佳化的對象正從單顆 GPU 延伸到整套系統;NVIDIA 要守住的,也不再只是每項工作是否跑在 GPU,而是不同晶片最後是否仍由 NVIDIA 串在一起。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉立即投遞履歷

【推薦閱讀】

Broadcom 再籌逾 600 億美元 AI 融資:晶片商為何開始替客戶解決「買算力」問題?

晶片還沒出貨,Anthropic 傳先下單 2.5 億美元:Fractile 憑什麼三個月估值翻六倍?

GPT-5.6 Sol 接 Cerebras 快 14 倍:OpenAI 開始替不同 AI 工作挑晶片

*本文開放合作夥伴轉載,資料來源:《SiliconANGLE》《CNBC》NVIDIA 1NVIDIA 2NVIDIA 3Groq,首圖來源:NVIDIA