Grok 4.6 強攻長時間 AI Agent:企業選模型不能再只看 Token 單價

SpaceXAI 近日推出最新旗艦模型 Grok 4.6。根據第三方模型評測機構 Artificial Analysis,Grok 4.6 在 Intelligence Index 得分 61。這項綜合指標用來比較不同模型的整體智慧表現,Grok 4.6 較前一代 Grok 4.5 High 提升 5 分,不只超越中國 Moonshot AI 的 Kimi K3,也追平 OpenAI GPT-5.6 Sol Max,並列全球第三,僅次於 Anthropic Claude Opus 5 與 Fable 5。

但對企業來說,這次 Grok 4.6 值得注意的不只是模型排行榜又重新洗牌。《VentureBeat》分析指出,相較單純增加幾個 benchmark 分數,Grok 4.6 更重要的變化在於 Agent 行為成本。SpaceXAI 明確將 Grok 4.6 的升級重點放在 long-running agents(長時間執行任務的 AI Agent)、程式開發與知識工作,希望模型不只回答一次問題,而是能持續執行更長、更複雜的任務。

當 AI 從聊天工具逐漸變成能自主工作的 Agent,評估模型的方式也開始改變。除了模型有多聰明、每百萬 Token 要多少錢,另一個更重要的問題是完成一項工作究竟需要跑多少輪、消耗多少 Token、最後花多少錢。

Grok 4.6 不只變聰明,SpaceXAI 開始訓練模型「把長工作做完」

根據 SpaceXAI 官方技術說明,Grok 4.6 可以長時間維持任務狀態,處理研究陌生主題、分析資訊、瀏覽大型程式碼庫,以及將產品構想轉換成可運作的應用程式。為此,SpaceXAI 對 Grok 4.6 進行比前一代更長的補充訓練,並重新產生涵蓋不同推理程度、Agent 執行環境、STEM、軟體工程與知識工作的監督式微調資料;強化學習則進一步涵蓋一般程式開發、知識工作、kernel optimization、網頁開發與 CAD 等 Agent 環境。

這些調整反映 AI 模型的訓練目標正在發生變化。過去使用者問一個問題,模型產生一個答案,重點是這次回答是否正確;但 Agent 可能需要連續執行數十個步驟,過程中使用工具、讀取資料、修改程式,再根據執行結果決定下一步。SpaceXAI 表示,在內部測試中,Grok 4.6 執行較長任務時出現更多自我測試與驗證行為,會在繼續執行前先檢查自己的工作成果。

從評測結果來看,Grok 4.6 在部分 Agent 任務上確實明顯進步。例如 APEX-Agents 主要測試 AI Agent 能否運用瀏覽器、搜尋等工具,完成需要專業知識的實際工作。SpaceXAI 公布的數據顯示,Grok 4.6 在這項測試得分從前代的 47.1% 提升至 57.5%,略高於 GPT-5.6 Sol Max 的 56.7%,但仍低於 Fable 5 Max 的 59.2%。

另一項 AA-Briefcase 則更強調長時間、多步驟的專業工作,不是要求模型回答一道問題,而是讓 Agent 使用瀏覽器、終端機等工具執行完整任務,因此除了工作成果,也能觀察模型完成任務經歷多少輪、使用多少 Token。Grok 4.6 在這項測試的 Elo 分數達 1,577,高於 GPT-5.6 Sol Max 的 1,502,也略高於 Fable 5 Max 的 1,574。

不過,Grok 4.6 並非所有 Agent 能力都領先。例如 Terminal-Bench v3.0 主要測試 AI Agent 能否在終端機環境自主完成技術任務,考驗模型操作命令列、檔案與軟體環境,以及連續執行多個步驟解決問題的能力。Grok 4.6 雖從 15.7% 提升至 26%,仍落後 GPT-5.6 Sol Max 的 34.6% 與 Fable 5 Max 的 34.1%。

《VentureBeat》因此認為,目前證據更能證明 Grok 4.6 相較 Grok 4.5 大幅進步,而不足以證明它全面勝過其他頂尖模型。不同 benchmark 衡量的 Agent 能力也不同,有的偏向專業知識與工具使用,有的強調長時間工作,有的則專門測試終端機操作,不能只排列分數就判定哪個模型整體比較強。

Agent 一跑就是數十輪,Token 單價開始無法反映真正成本

模型往長時間 Agent 發展,也讓另一個問題浮上檯面:企業究竟該怎麼計算 AI Agent 的成本?傳統生成式 AI 的成本相對容易理解,使用者輸入多少 Token、模型輸出多少 Token,再乘上 API 費率即可。但 Agent 執行的不是一次性問答。一項工作可能需要先搜尋資料、讀取文件、推理與呼叫工具,取得結果後再判斷是否正確;一旦發現問題,又要重新修改、呼叫工具與驗證。

因此,即使兩款模型的 Token 單價相同,如果一款模型需要執行 100 輪才能完成任務,另一款只需要 50 輪,最終成本就可能出現明顯差距。

Artificial Analysis 對 Grok 4.6 的獨立測試正好呈現這個差異。前述 AA-Briefcase 除了衡量 Agent 完成長時間專業工作的表現,也記錄完成工作所需的資源。Artificial Analysis 報告顯示,Grok 4.6 完成這套工作負載平均約經過 53 輪、消耗約 5 億個 input tokens;Claude Opus 5 Max 則約需要 103 輪、20 億個 input tokens

這組數字比較的不是單次回答有多長,而是 Agent 為了完成一組多步驟工作,總共需要經歷多少次互動與推理、讀取多少輸入內容。《VentureBeat》指出,這不能解讀成 Grok 4.6 執行所有 Agent 任務都能減少近一半輪數或四分之三 Token,因為 Agent 成本還會受到執行框架、提示詞、工具呼叫、快取、重試方式與任務本身影響。但這些數據揭露了一個值得企業注意的問題:當 AI 從「產生一次答案」走向「完成一整段工作流程」,只比較每百萬 Token 的價格,已越來越難反映真正的使用成本。

從每百萬 Token 走向 Cost per Task,AI 模型價格戰開始換算法

Grok 4.6 的 API 定價乍看相當具有競爭力。根據 SpaceXAI 官方資料,在 prompt 少於 20 萬 Token 時,每百萬 input Token 為 2 美元、output Token 為 6 美元。《VentureBeat》比較目前主要前沿模型的 API 定價後指出,Grok 4.6 的價格不到 GPT-5.6 Sol 標準模式的一半,也低於 Claude Opus 5。

但 Token 比較便宜,並不等於完成工作一定比較省。Artificial Analysis 已開始用 Intelligence (智慧表現)vs. Cost per Task(完成每一任務的成本)比較不同模型。它不是另一個單純測試模型有多聰明的 benchmark,而是把模型能力與完成評測任務實際付出的成本放在一起觀察。

Artificial Analysis 實測 Grok 4.6 約為每項任務 0.84 美元,並將其列入 Intelligence vs. Cost per Task 的 Pareto frontier,也就是在目前測試結果中,屬於模型能力與成本之間較具競爭力的選擇。不過,Grok 4.5、OpenAI GPT-5.6 Luna、Z.ai GLM-5.2 與 Meta Muse Spark 1.2 等模型仍具有更好的任務成本效益。

這也讓 API 價格表與企業實際支付的 Agent 成本之間出現差距。《VentureBeat》分析,對 Agent 工作負載而言,更有意義的衡量方式可能是完成一個 workflow 要花多少錢,而不只是產生 100 萬 Token 要花多少錢。

長上下文又讓成本計算更加複雜。SpaceXAI 官方資料顯示,Grok 4.6 支援最高 50 萬 Token context window,但當 prompt 達到 20 萬 Token,input、cached input 與 output 費率會分別從每百萬 Token 2、0.5、6 美元,提高至 4、1、12 美元,而且較高費率會套用到該次 request 的所有 Token。《VentureBeat》因此提醒,企業不能直接拿 Grok 4.6 最低的 2 美元/6 美元價格,推估使用完整長上下文時的總持有成本。

Grok 4.6 並沒有在所有評測全面擊敗 GPT-5.6 Sol 或 Claude,但它提供了一個觀察 AI 模型競爭變化的窗口:當模型開始專門為 long-running agents 最佳化,傳統 benchmark 與每百萬 Token 定價都只能回答一部分問題。

【推薦閱讀】

SpaceXAI 推 Grok Bot 加入企業 Agent 戰局:真正差異不只是「會操作電腦」

Cloudflare Wallets 讓 AI Agent 自主付款:為何網路基礎設施商也開始做支付?

AI Agent 跨平台終於有共同標準了:Agent Plugins 統一封裝,安全與信任仍留白

*本文開放合作夥伴轉載,資料來源:SpaceXAIArtificial Analysis《VentureBeat》,首圖來源:SpaceXAI