Token 單價便宜的 AI 模型不代表省錢,Databricks 稱任務成本與 Harness 更關鍵

選擇 Token 便宜的 AI 模型不見得省錢!Databricks 稱每任務成本與 Harness 其實更關鍵

除了不斷往更聰明、更智慧的方向發展外,AI 業界也一直在追求更加便宜、成本更低的人工智慧模型。然而,每 Token 單價較低的 AI 模型,就真的能夠替使用者省下更多支出嗎?答案恐怕未必如此。

資料分析服務與軟體大廠 Databricks,最近設計了一套內部專用的程式碼基準測試工具,用以評估導入各種 AI 模型時,價格與效能之間的權衡關係。

效能相近,成本有別

Databricks 技術長 Matei Zaharia 指出,該測試跟業界常見的 SWE-Bench 類似,但可以避免參與跑分的 AI 模型發生像 SWE-Bench 一樣,直接利用預訓練的題庫回答問題,導致測試結果失真的缺點。

在測試中 Databricks 發現,如 Z.ai GLM 5.2 等開放權重模型,其效能表現足以跟 Anthropic 的 Claude Opus 4.8 等前沿模型一較高下。

只不過,Databricks 內部測試所考慮的部分並非只有效能,更關鍵之處在於 AI 模型的開銷成本。雖然 GLM 5.2 的效能跟 Opus 4.8 相近,但前者的每任務成本僅需 1.28 美元,而後者則為 1.94 美元。

只看 Token 單價的盲點

根據前述結果,Databricks 仍強調 AI 模型的 Token 單價,並不能完全反映一款模型究竟屬於「昂貴」或者「便宜」,使用者必須將「每任務成本」同步納入考量。

Matei Zaharia 表示,AI 模型的每 Token 成本較低,無法代表它的每任務成本也比較低,例如 Claude Sonnet 5 的每 Token 成本,雖然低於 Opus 4.8,但在處理任務時,Sonnet 5 所使用的 Token 數量更多,反而導致最終成本變得更高,整體品質甚至有所下降。

同樣根據 Databricks 的測試,Sonnet 5 以每 Token 為單位進行計算時,單價大約會比 Opus 4.8 便宜 1.7 倍,可是若以每任務為單位計算時,Sonnet 5 卻達到 2.09 美元,Opus 4.8 僅為 1.94 美元。

Matei Zaharia 解釋,原因在於 Sonnet 5 有辦法順利完成任務的機率較低,大約落在 81%,而 Opus 4.8 則是 87%,這反映出 Sonnet 5 通常需要消耗更多的 Token,才能達到使用者所預期的結果。

任務總開銷才是關鍵

Databricks 從測試中得到的結論,跟學術界日前最新出爐的說法基本相同。

根據美國史丹佛大學、加州大學等學者所發表的聯合研究目前市場主流的 AI 模型中,大約有高達三分之一的模型,雖然每 Token 單價相對較低,但最終的任務成本支出卻比較高。

舉例來說,Google Gemini 3 Flash 的每 Token 價格,比起 OpenAI GPT-5.4 便宜了 80%,但是在實際執行任務後,前者的總體開銷卻高出 38%。

Harness 也影響成本效益

除了模型智慧程度外,Databricks 亦指出,協助 AI 代理運作的 Harness 框架,比方說 Claude Code、OpenAI Codex 及 Pi Coding Agent 等工具,亦會對 AI 的成本與效能造成顯著影響。

所謂 Harness 框架的用途,主要在於將使用者的任務輸入,傳達給搭配的 AI 模型,並且同時呼叫、協調各種工具,最後再返回處理結果。

Matei Zaharia 說,以近來火紅的 Pi Coding Agent 而言,該 AI 代理框架使用 Claude Opus、OpenAI GPT 5.5 等模型的任務成功率,其實跟大型 AI 開發商推出的 Harness 框架幾乎相同,然而支出成本卻只有它們的一半,這證明了 Harness 框架確實對 AI 的成本效益具有重大影響。

不同工具的偏好造就差異

進一步探究幕後原因,Matei Zaharia 分析,差異在於不同的 Harness 框架和工具,每次傳達給 AI 模型的輸入,即上下文的大小擁有顯著差別。

舉例來說,當使用 Claude Code 作為 Opus 4.8 的 Harness 框架時,每項任務的上下文需要 742,000 個 Token,而 Pi Coding Agent 則為 236,999 個 Token,後者減少了近 3.2 倍。

同樣情況也發生在 OpenAI Codex。根據測試,Codex 處理每項任務的總上下文需要 1,235,000 個 Token,相比之下 Pi Coding Agent 僅使用了 665,000 個 Token,這歸功於後者更偏好撰寫簡潔的系統級提示詞。

即時切換也是解決方案

Matei Zaharia 直言,前述差距就是 Databricks 投入開發新工具 Omnigent 的理由之一;這是一款被用於整合與切換多個 AI 程式碼撰寫代理的通用封裝框架,外界不妨把它想像成「為前端開發者提供的 OpenRouter」。

根據官網介紹,Omnigent 適用於 Claude Code、OpenAI Codex 與 Pi Coding Agent,使用者無需重寫任何程式碼,即可替換或組合各種 Harness 框架,並透過規則與沙箱機制加以管控,自任何裝置於同一串會話中進行即時協作。

【推薦閱讀】

◆ token 最高省 65%!Google 推 Gemini 3.6 Flash 等新模型,成本為何成最大亮點?
◆ OpenAI、Anthropic 擔心低價開放權重模型,美國也該害怕嗎?Kimi K3 掀起國安與商業模式之爭
◆ 【自我修復的 AI 代理】提案、驗證、重寫規則,Self-Harness 框架讓效能最高提升 60%

*本文開放合作夥伴轉載,參考資料:The RegisterDatabricks,首圖來源:Nano Banana 2

(責任編輯:鄒家彥)