token 最高省 65%!Google 推 Gemini 3.6 Flash 等新模型,成本為何成最大亮點?

Google 在美國時間 7/21 一口氣發表了 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 與 Gemini 3.5 Flash Cyber 三款新模型,但這次最受矚目的不是追求能力有多強,而是主打運行 AI 代理的速度更快、成本更低。其中主力的 Gemini 3.6 Flash,在執行長時程工程任務時,最高可將 token 用量降低 65%,直接瞄準企業大規模部署 AI Agent 時最現實的一道門檻:成本。

效率成主角,token 用量最高降 65%

根據《VentureBeat》報導,Gemini 3.6 Flash 相較前代 Gemini 3.5 Flash,整體輸出 token 用量最高減少 17%;在 DeepSWE 這類衡量代理如何從零完成多步驟工程任務的長時程基準上,token 節省幅度更可達到 65%。Google 解釋,這款模型用更少的推理步驟與工具呼叫,就能跑完同一段多步驟工作流。對按 token 計費的開發者而言,這等於直接壓低了每一次任務的成本。

價格上也拉出明顯落差。以每百萬 token 計算,Gemini 3.6 Flash 的輸入為 1.5 美元、輸出為 7.5 美元;更輕量的 Gemini 3.5 Flash-Lite 更低到輸入 0.3 美元、輸出 2.5 美元。相較之下,前代 Gemini 3.5 Flash 同樣的輸入是 1.5 美元、輸出卻要 9 美元,而 Gemini 3.1 Pro Preview 更達到輸入 2 美元、輸出 12 美元。也就是說,光是輸出這一項,新的 3.6 Flash 就比前代便宜了約六分之一。加上新模型本身就設計成用更少的 token,實際帳單可能還會低於單看牌價的預期。

成本之所以在此刻變成主角,與 AI 應用的焦點轉移有關:AI Agent 一旦要規模化,token 花費就成了現實考量。《Business Insider》就指出,越來越多公司意識到大量消耗 token 未必換得最好結果,因而回頭改用更具成本意識的模型。

當客戶開始精打細算,這正是 Google 看準的戰略切口。Google 執行長 Sundar Pichai 先前就公開強調價格優勢,表示企業若把多數 AI 工作負載轉移到 Gemini 模型,一年可省下超過 10 億美元。

三款模型各司其職,連資安都用低價切入

這波三款模型被 Google 切成不同用途。Gemini 3.6 Flash 被定位為挑大樑的主力,強化了程式開發、多模態處理與知識工作的表現,適合複雜文件解析、圖表與資料分析、長篇報告草擬等吃重任務,同時把 token 用量壓下來。

Gemini 3.5 Flash-Lite 走的是另一條路,主打高吞吐量與極低延遲的大量任務,是 3.5 系列中最快、最便宜的版本。據獨立評測機構 Artificial Analysis 的數據,它每秒可處理約 350 個輸出 token,約為前代 Gemini 3.1 Flash-Lite 的兩倍速度,適合代理式搜尋與海量文件處理這類高頻任務。

第三款 Gemini 3.5 Flash Cyber 則是高度專門化的部署,經過微調專門用來找出並修補軟體資安漏洞,並直接整合 Google 的程式修補代理 CodeMender。值得注意的是,Google 把低價策略也帶進了資安這個相對高階的領域,官方表示這款模型在 CyberGym 基準上達到接近前沿的水準,效能逼近 Anthropic 的 Mythos 模型,但主打比大型資安模型更低的單位 token 成本。

考量到資安 AI 的雙用途風險,攻擊者同樣可能加以利用,Google 初期僅透過限量試辦,將 Gemini 3.5 Flash Cyber 開放給政府與信任的合作夥伴。

旗艦 3.5 Pro 尚未出場,Google 一邊卡位一邊備戰

這批更新全數集中在輕量、低成本的模型線,真正被市場等待的旗艦 Gemini 3.5 Pro 則尚未登場。Pichai 在 5 月 Google I/O 開發者大會時曾提及,Gemini 3.5 Pro 原計劃於 6 月發布;如今 Google 表示這款模型仍在與合作夥伴測試階段,會在準備好時釋出,但未給出明確時程。

《Reuters》進一步指出,延遲的原因是這款模型未達內部目標,尤其是在程式開發這個已成為企業 AI 重要獲利場景的能力上。

這樣的空窗,放在競爭態勢下更顯得敏感,其對手已經接連推出更強的前沿模型:Anthropic 已釋出 Mythos 5 與 Fable 5,OpenAI 也推出了 GPT-5.6。《Business Insider》指出,截至這波發表,Google 尚無任何一款模型擠進 Artificial Analysis 綜合排行榜的前十名。

不過面對此態勢,Google 似乎是選擇兩手並進:一手用價格與效率先行卡位,趁企業控管 token 支出的時機搶下部署場景;另一手則同步佈局下一輪:Google 表示已啟動 Gemini 4 的預訓練,並稱這是規模最大的一次。

《CNBC》也報導,Google 正在開發一款專用晶片,據稱可將 Gemini 執行效率最高提升 10 倍,進一步壓低服務 AI 的成本。從自家客製晶片、雲端基礎設施,到軟硬體整合設計,Google 押注的是一條靠整體效率而非單點算力取勝的路線。至於旗艦模型補位之後會如何發展,仍是接下來值得持續追蹤的關鍵。

【推薦閱讀】

OpenAI 證實 AI 代理自主入侵 Hugging Face,專家:目前沒有工具擋得住

4 個人,服務 75 萬名客戶:研究揭 AI 原生企業正在改寫「請更多人」老規則

OpenAI、Anthropic 不再獨占最強 AI?中國 Kimi K3 讓開源模型站上 Frontier 戰場

*本文開放合作夥伴轉載,資料來源:Google《CNBC》《VentureBeat》《Reuters》《Business Insider》,首圖來源:Google