Google 於美國時間 8/13 推出新一代 AI 模型 Gemini 3.7 Flash,距離上一代 Gemini 3.6 Flash 發表僅隔了三週。除了強化程式開發、企業工作流程與 AI Agent 能力,Google 還祭出限時價格策略:今年底以前,Gemini 3.7 Flash API 每百萬 input tokens 為 0.75 美元、output tokens 為 3.75 美元,只有 2027 年起標準價格的一半。
不過另一個變化更值得注意。Google 將 Gemini 3.7 Flash 稱為目前「最聰明的 coding 與 Agents 主力模型(workhorse model,工作馬模型)」。過去 Flash 系列最鮮明的特色是速度、低延遲與較低成本,為什麼到了 AI Agent 時代,Google 反而要讓 Flash 承擔更多複雜的 AI Agent 工作?
Flash 不只求快,Google 補上 Agent 需要的執行能力
答案之一,要看 Gemini 3.7 Flash 這次升級了什麼。Google 表示,Gemini 3.7 Flash 在遇到阻礙時更能調整策略,必要時會釐清使用者意圖,也能更準確遵循指令。Google 特別強調,新模型會在多步驟規劃(multi-step planning)與工具調用(tool calls)投入更多推理,不只是減少執行步驟,而是希望降低重試與人工監督,提高整體執行品質。
這些改變直接反映在 Google 公布的 Agent 與程式開發測試成果。《VentureBeat》整理 Google 數據指出,在測試長時間軟體工程能力的 DeepSWE v1.1,Gemini 3.7 Flash 得分從上一代的 49.0% 提高至 65.3%;測試企業工作流程自動化的 AutomationBench,也從 17.0% 上升至 30.4%。測試 production code quality 的 FrontierCode 1.1,則從 34.4% 提升至 43.6%。
但這不代表 Gemini 3.7 Flash 已經成為能力最強的模型。Google 自己公布的比較中,GPT-5.6 Terra 在 DeepSWE、Terminal-bench 等部分測試仍然領先,Claude Sonnet 5 在 Agent’s Last Exam 的多模態桌面與作業系統任務也有較高成績。
換句話說,Google 要做的不是讓 Flash 在所有項目超越旗艦模型,而是在原本的速度與效率優勢之外,逐步補上規劃、工具使用、錯誤恢復與長流程執行等 Agent 所需要的能力。
為什麼 AI Agent 反而需要一匹「工作馬」?
這也與 AI Agent 使用模型的方式有關。一般聊天機器人可能經過一次問答就完成任務,但 Agent 要真正替使用者完成工作,往往得先理解需求、拆解步驟,再讀取資料、呼叫工具、執行操作、檢查結果,遇到問題後還得修改策略重新執行。模型因此不只要「夠聰明」,還得同時兼顧速度、可靠性、token 使用量與成本,才能被反覆、大量呼叫。
事實上,Google 並不是到了 Gemini 3.7 Flash 才開始把 Flash 往這個方向發展。今年 5 月推出 Gemini 3.5 Flash 時,Google 就已經把「大規模執行 Agent 任務」列為核心定位,主張速度與效能的平衡,讓 Flash 適合長時間、多步驟 Agent 任務。6 月,Google 更把 computer use(電腦使用)直接整合進 3.5 Flash,讓開發者打造能看懂畫面、推理並操作瀏覽器、手機與桌面的 Agent。
到了 7 月底推出 Gemini 3.6 Flash,Google 又把這個方向說得更清楚:企業要大規模部署 Agent,需要更高的 token 使用效率、更低的延遲,以及更可靠的執行能力。因此,3.6 Flash 特別減少不必要的推理步驟、對話輪次與工具調用,希望避免 Agent 陷入反覆執行的迴圈。
三週後的 3.7 Flash,Google 則進一步調整這套思路:不是一味讓 Agent 少想幾步,而是在需要時投入更多規劃與推理,提高每一步的執行品質。
Pro、Flash、Flash-Lite,Google 開始按「工作」分配模型
這也讓 Gemini 不再只是簡單按照模型能力高低排列。Google Cloud 對 Gemini 3.7 Flash 的產品定位,就是把它放在負責深度推理的 Pro 與追求高吞吐量的 Flash-Lite 之間,讓 Flash 承接多步驟編排、程式碼重構與企業 Agent 等需要一定推理能力,又必須頻繁執行的工作。
這樣的分工其實早有跡象。今年 Google I/O 上,Google 執行長 Sundar Pichai 就透露,開發者已經把 Flash 當成日常開發的主力核心,而 Pro 則被用於需要深度推理與多模態能力的工作。
Google 近期甚至把這種分工直接落進 Agent 產品。7 月底更新 Gemini API 的 Managed Agents 時,Google 就將 Gemini 3.6 Flash 設為預設模型。一個 API 呼叫背後,可以讓 Agent 協調推理、執行程式碼、安裝套件、管理檔案與網路搜尋等一連串工作。
因此,與其把 Gemini 模型理解成「Pro 最強、Flash 次之、Flash-Lite 最弱」,Google 現在的產品策略更接近依照工作負載分工:需要最深層推理時使用 Pro,需要大量、高吞吐量任務時有 Flash-Lite,而 Flash 則定位在中間,成為兼顧能力與效率、能反覆執行日常 Agent 工作的「主力模型」。
價格砍半,也是模型策略的一部分
從這個角度看,Gemini 3.7 Flash 的限時價格砍半,也不只是一次促銷。Agent 完成一項工作,背後可能產生多次模型呼叫、推理與工具互動。當企業要讓數十、數百個 Agent 持續執行程式開發、文件處理或企業流程,模型能不能大量使用,就和每次執行需要付出多少成本直接相關。
《VentureBeat》因此指出,企業真正需要衡量的,不只是每百萬 tokens 的價格,而是成功完成一項任務的成本。一款模型即使 token 單價便宜,如果需要不斷重試、頻繁人工介入,最後未必比較省;反過來說,如果 3.7 Flash 能如 Google 所稱,以更好的規劃與執行降低重試次數,價格與能力提升才可能一起轉化成更低的 Agent 營運成本。
Gemini 3.7 Flash 因此不只是 Google 又推出一款更快、更便宜的模型。從 3.5 開始強化長時間 Agent 任務,到 3.6 追求執行效率,再到 3.7 補強規劃與工具使用,Google 正逐步讓 Flash 從追求速度的模型,變成能大量承接 AI Agent 日常工作的主力模型。
當 AI 從回答問題走向實際執行工作,企業選擇模型時要問的問題,也可能從哪個模型最強,進一步變成哪個模型最適合負責哪一種工作。
【推薦閱讀】
◆ token 最高省 65%!Google 推 Gemini 3.6 Flash 等新模型,成本為何成最大亮點?
*本文開放合作夥伴轉載,資料來源:《VentureBeat》、Google、Google Cloud、Artificial Analysis、《Ars Technica》,首圖來源:Google



