NVIDIA 在 8 月 11 日正式推出全新 Nemotron 3.5 Lightning。這是一款專為 AI 代理(Agent)設計的輕量化開放模型,企業不僅可以免費下載、使用與修改,也能直接在個人電腦的單張 GPU 上運行。
然而,這款主打速度與效率的 Lightning 模型,只是 NVIDIA 更大規模開放模型布局的一環。《The Information》披露,NVIDIA 內部正積極研發新一代 Nemotron 4 模型家族,希望讓其中最大的版本在性能上躋身全球頂尖開放模型之列。
NVIDIA 大舉投資開放模型,背後其中一項重要商業考量,是希望透過高品質、相對低成本的模型,讓更多新創與大型傳統企業投入 AI 應用,進一步刺激 GPU 需求。正如 NVIDIA 執行長黃仁勳所說,免費 AI 反而有利於硬體與晶片市場,因為模型使用愈普及,就愈能帶動運算需求。 對 NVIDIA 而言,即使模型本身免費,只要開放模型能帶動更廣泛的 AI 使用,就有機會進一步擴大硬體市場。
不只靠少數 AI 巨頭買 GPU,NVIDIA 用開放模型擴大需求版圖
目前,NVIDIA 相當一部分 GPU 需求來自少數前沿 AI 實驗室與雲端服務業者,包括 OpenAI、微軟與 SpaceX,其中一些公司也正在投入自研 AI 晶片。OpenAI 更是 NVIDIA 晶片需求的重要推動者之一,NVIDIA 對其投資金額已達 300 億美元。
在這樣的背景下,NVIDIA 希望藉由高品質、相對低成本,且針對自家硬體最佳化的開放模型,把 AI 應用進一步擴散到新創公司與大型傳統企業。模型評估平台 Arena 執行長 Anastasios Angelopoulos 就指出,無論最終是哪一家公司做出優秀的開放模型,NVIDIA 都能從中受益。
這套商業邏輯並不要求 NVIDIA 必須直接靠模型本身獲利。相較 OpenAI、Anthropic 等公司提供的專有模型,開放模型較低的取得成本有機會提高 AI 使用量,《The Information》也指出,NVIDIA 的盤算正是透過更多高品質開放模型刺激 AI 採用,進一步帶動 GPU 需求。
不只擴大 GPU 市場,NVIDIA 加碼 Nemotron 還有一層美中競爭盤算
NVIDIA 對開放模型的投入,已反映在龐大的算力支出上。截至今年 4 月,NVIDIA 的多年期雲端服務承諾已增加至 280 億美元,約為一年前的三倍,相關合約延伸至 2031 年初,其中部分算力被用於模型開發與其他研發工作。值得注意的是,NVIDIA 取得部分訓練算力的方式,是向購買自家晶片的雲端服務商租回 AI 伺服器算力,以訓練模型。
除了擴大 GPU 市場的商業考量,NVIDIA 加碼 Nemotron 還有另一層戰略背景。《The Information》報導,NVIDIA 在去年初就意識到,美國開放模型已大幅落後中國領先模型,因此希望基於美國國家利益以及 NVIDIA 自身的商業利益,協助縮小差距。NVIDIA 應用深度學習研究副總裁 Bryan Catanzaro 今年一月也曾表示,投資 Nemotron 對 NVIDIA 的未來「至關重要」。黃仁勳也公開主張,開放權重模型能讓企業更能掌握自身未來、促進競爭並降低價格,同時有助於安全、資安、創新擴散與國家主權。
一邊投資、一邊競爭,NVIDIA 如何用 Nemotron 聯盟化解模型戰場的競合關係?
然而,NVIDIA 大舉跨入模型研發,也把自己推進一個更微妙的競合位置。因為 NVIDIA 自行開發的開放模型,可能與其投資的開放模型新創,以及長期採購大量 NVIDIA GPU 的大型 AI 實驗室形成競爭。
在投資版圖上,NVIDIA 除了大手筆投資 OpenAI,也投資 Reflection AI、Thinking Machines Lab 等希望推動自身模型企業採用的美國 AI 公司。有趣的是,即使存在這層競合關係,NVIDIA 並沒有選擇單打獨鬥,而是透過 Nemotron 聯盟把多家模型與 AI 公司拉進共同開發體系。Reflection、Cursor、Thinking Machines 與 Mistral 等成員,都會提供訓練資料、模型評估協助與設計想法。
例如,新創 Prime Intellect 就為 Nemotron 訓練提供 30 萬個模擬環境,AI 軟體公司 Cognition 也曾與 NVIDIA 討論提供程式碼資料。對部分合作夥伴而言,參與聯盟除了能推動整體開放模型市場,也有機會影響一套未來可直接使用、卻不必自行負擔完整訓練算力成本的模型發展。
NVIDIA 的 Nemotron 雙軌布局:一邊衝 1 兆參數、一邊做輕量 Agent 模型
在具體的產品路線上,NVIDIA 正同時推進不同規模與用途的模型。往大型模型方向看,多位參與 Nemotron 開發的 NVIDIA 員工預期,最大的 Nemotron 4 至少會有 1 兆個參數,約為今年 6 月發布的 Nemotron 3 Ultra 兩倍。雖然這個參數規模仍小於部分中國領先開放模型,但 NVIDIA 同時高度重視模型壓縮技術,希望讓較小的模型也能繳出更高性能。
目前 NVIDIA 已經決定 Nemotron 4 部分預訓練資料與模型架構,但最終規格與發布日期仍未定,也尚未進行最終訓練。部分員工預估,模型最快可能在今年深秋準備就緒,但也有人認為時間可能更晚。
另一方面,剛推出的 Nemotron 3.5 Lightning 則不是一味追求更大的模型規模,而是把重點放在長時間運作的 AI Agent 工作負載。Lightning 採用混合專家模型(Mixture-of-Experts,MoE)架構,總參數約 316 億,但每次推論僅啟用約 36 億參數,希望以較低的運算負擔處理大量、高頻的專門任務。NVIDIA 表示,Lightning 的 Token 產出速度最高可提升 4 倍,完整 AI Agent 任務的完成速度則提高約 30%。
不過,這兩個數字之間的差距,也揭示 AI Agent 的另一項問題:當模型本身已經變快,整體任務不一定能等比例加速。《Wccftech》據此指出,當模型推論速度持續提升,AI Agent 的瓶頸正進一步浮現於編排層(orchestration layer)與 AI 代理執行框架 ,也就是如何拆解任務、選擇模型、管理上下文與安排執行順序的軟體控制層。也正因 AI Agent 面對的問題不只剩模型推論速度,NVIDIA 同步把布局延伸到模型之間的調度。
不是每個任務都要用最強模型,NVIDIA 用 Switchyard 把 Agent 成本降至三分之一
NVIDIA 認為,全天候運作的 AI 代理正逐漸演變成一種「模型系統」:由不同規模與能力的模型共同完成工作,而不是所有任務都交給同一個最強模型。例如,高階前沿模型可以負責規畫與複雜推理,小型模型則處理程式碼審查、工具呼叫、資安警報監控或帳務問題等高頻率任務。
如果所有工作都交由最昂貴的前沿模型處理,成本自然會隨著 Agent 長時間運作快速增加。為此,NVIDIA 同步推出開源模型路由函式庫 NeMo Switchyard,可以在開放模型、專有模型及 NVIDIA 自家模型之間,自動把每個請求導向適合的模型。開發者也能依照品質、延遲與成本等需求調整路由策略,避免每個工作都必須使用最昂貴的模型。
根據 NVIDIA 內部基準測試,在維持前沿模型等級準確度的情況下,NeMo Switchyard 可將任務成本降低至單獨使用 Opus 4.8 的近三分之一。此外,AI 公司 Cognition 將 Switchyard 的分階段路由器整合至 NVIDIA 內部版的 Devin Desktop,結果測試發現,在維持接近前沿模型性能的同時,這套路由機制成功讓平均成本降低了 28%。
雖然新一代 Nemotron 4 的最大版本預計在綜合性能上仍難以直接擊敗 OpenAI 或 Anthropic 的最頂尖前沿模型,且先前最強的 Nemotron 3 Ultra 依然落後於中國的領先開放模型,甚至被排在全球前 40 名之外。然而,對 NVIDIA 而言,這場開放 AI 戰略的勝負手從來就不是為了爭奪「最強模型開發商」的稱號,NVIDIA 真正的商業盤算,是透過自身在開放模型與路由工具上的巨大投入,推動整個開源生態系的蓬勃發展。當全球成千上萬的新創公司與傳統企業都能低成本地跨入 AI 應用的建構時,這股被徹底解放的 AI 應用洪流,最終都將轉化為對 NVIDIA 硬體 GPU 算力的龐大需求,這才是 NVIDIA 在免費開放模型背後,布下的宏大商業藍圖。
【推薦閱讀】
◆ 解除 AI 資安封印:OpenAI 擴大 Daybreak 計畫推「紅藍雙軌」,降低防禦任務拒絕率◆ 模型誰能用、誰能發布、政府何時介入?祖克柏如何用「權力制衡」重寫 AI 安全治理
◆ Gemini ARR 僅 120 億美元,GCP+TPU 潛在規模卻逼近 2,000 億:Google 的 AI 商業重心正在位移
*本文開放合作夥伴轉載,資料來源:《The Information》、《CNBC》、《Wccftech》、《The Decoder》、NVIDIA、《SiliconANGLE》,首圖來源:NVIDIA



