Gemini 4 終於登場:一次可輸出 100 萬 token,Google 為何要把 AI 單次工作量做這麼大?

Google 在美國時間 9/30 推出新一代旗艦模型 Gemini 4 Argon,這也是自 2025 年 11 月 Gemini 3 系列後,睽違近一年再更新的最高階模型。而原訂今年 6 月推出的 Gemini 3.5 Pro 最終取消,Google 直接進入 Gemini 4 世代。

《Axios》指出,在這段期間,Google 主要推出速度更快、成本更低的 Flash 模型,OpenAI、Anthropic 則持續更新前沿模型,Gemini 4 因此也肩負 Google 重返最高階模型競爭的任務。Google 將 Argon 稱為目前為複雜工作負載打造、效能最高的模型。其發言人向《Reuters》表示,它在關鍵程式設計與資安測試上的表現,可與 OpenAI Astra、Anthropic Opus 等前沿模型相比。

Argon 並非全面領先,Agent 能力進步更值得看

Google 公布的測試中,Argon 在衡量長時間真實軟體工程任務的 DeepSWE v1.1 拿下 77.9%,高於 Astra 的 74.1% 與 Opus 5.5 的 74.2%;但在測試真實軟體專案除錯與修改能力的 FrontierSWE v2,Argon 僅有 55%,低於 Astra 的 65.5%;在測試 AI Agent 透過終端機完成多步驟開發與系統任務的 Terminal-Bench 4.0,57.4% 也低於 Opus 5.5 的 66.4%。

圖片來源:Google

第三方評測也顯示,Argon 的進步尤其集中在 Agent 能力。Artificial Analysis 指出,過去相對是 Gemini 弱項的 Agent 工作,這一代已有明顯提升:Argon High 在整體 Intelligence Index 得到 53 分;在衡量 Agent 執行企業流程能力的 AutomationBench-AA 更取得 77.5%、排名第一。不過,其他 Agent 測試並非都占優勢,例如 Terminal-Bench 4.0 僅有 57%,仍落後部分 OpenAI、Anthropic 模型。

圖片來源:Artificial Analysis

Output Token 一口氣拉高到 100 萬

比起又一次模型排名,Gemini 4 Argon 還有一項更特殊的設計:Google 將 Output Token(輸出詞元)上限從 64K 一口氣拉高到 100 萬。這和過去常見的百萬 Context Window(上下文視窗)不同,後者代表模型一次能讀進多少資料,Output Token 則決定模型單次能持續產生多少文字、程式碼與其他輸出,也為更長的 Agent 工作流程留下更大的執行空間。

Google 展示的案例也不是生成更長文章,而是處理更大型的實際工作。官方表示,一組 Argon Agent(代理)分析 Google 資料中心的效能資料,自主找出並套用記憶體最佳化方法,目前已釋放超過 300 TiB 記憶體;另一批 Agent 則協助把 C/C++ 程式碼遷移到 Rust,規模一路擴大到超過 80 萬行的 Fuchsia Zircon kernel。

100 萬輸出 token 的意義,因此不只是讓 AI 工作更久,而是放大模型一次能承接的工作規模。原本可能需要拆成多輪模型呼叫、不同工具或由人員中途接手的工作,Google 正嘗試讓模型沿著同一條工作路徑完成更多步驟。

工作單位變大,Google 瞄準哪些企業任務?

這也解釋了為什麼 Argon 的應用場景集中在軟體工程、資安、金融與法律。這些工作的共同特徵,是資料量大、流程長,而且一次任務往往包含分析、判斷到實際產出。Google 也特別強調 Argon 在多步驟金融研究、法律研究與文件草擬等工作上的能力。

《VentureBeat》分析,對程式碼遷移、稽核、法律審查等工作來說,更長的輸出能力可以減少模型中途停下、重新取得脈絡或交回人類處理的次數。對企業來說,真正的差別在於,原本需要多次模型呼叫或人工接手的任務,是否能被壓縮成更連續的 AI 工作流程。

能做更多事,但還沒立即全面開放

不過,Argon 發布後並未立即向所有開發者或消費者開放。Google 先透過 Fairwind Program 提供給經過審核的資安防禦團隊,並參與美國政府的模型預先存取自願機制,之後才預計擴大至付費 API 客戶、企業與 Google AI Ultra 用戶。

Google 也把這種長流程能力率先放進資安場景。Google 表示,Argon 能自行尋找、驗證並修補軟體漏洞;對受信任的資安團隊,還會提供減少部分 Cyber Guardrails(資安防護限制)的版本。另一方面,模型自主執行的工作越長,一旦偏離原本任務,影響也可能跟著擴大,因此 Google 同時強化 Prompt Injection(提示詞注入)防禦、模型行為監測與 Sandbox(沙箱)隔離。

Gemini 4 Argon 接下來真正需要驗證的,因此不是 100 萬 token 能不能跑滿,而是任務拉長之後,AI 能否減少中途接手與工作拆分,同時把錯誤、人工介入與推論成本控制在企業可接受的範圍內。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

◆ OpenAI 推出 Dots 到底新在哪?AI Agent 正從「接任務」走向「接責任」

◆ OpenAI 研究揭 AI Agent 新風險:惡意上下文可能從 Email 一路傳到工具操作

◆ 美國政府打造 AI 服務入口 : America.gov 搭載 Gemini、Grok 整合 2.9 萬個政府網站

*本文開放合作夥伴轉載,資料來源:《AXIOS》、《VentureBeat》、Google、Artificial Analysis,首圖來源:Google