AI 模型的 API 價格持續下降,企業選擇較便宜的模型,就一定能降低成本嗎?史丹佛大學等機構一項研究發現,在 336 組 AI 模型成本比較中,約 32% 出現「價格逆轉」(Price Reversal)現象,也就是 API 單價較低的模型,執行相同測試任務反而更花錢。隨著 AI Agent(AI 代理)開始承接更多複雜工作,這項發現也對企業過去依據模型單價比較成本的方式提出挑戰。
API 單價便宜 80%,實際成本卻高出 38%
這項由史丹佛大學、卡內基美隆大學、加州大學柏克萊分校及 Microsoft Research 研究人員共同完成的論文《The Price Reversal Phenomenon》,最初於今年 3 月發表、5 月修訂。
研究比較 GPT-5.4、Gemini 3 Flash、Claude Opus 4.7 等 8 款前沿推理模型,涵蓋數學、科學問答、程式設計,以及需要多次與外部環境互動的 AI Agent 任務,共計 12 類測試。
以 Google Gemini 3 Flash 與 OpenAI GPT-5.4 為例,研究將每百萬輸入與輸出 Token 的價格相加作為比較指標,Gemini 3 Flash 為 3.5 美元,比 GPT-5.4 的 17.5 美元低了 80%。然而,執行全部測試任務後,Gemini 3 Flash 累計花費約 705 美元,GPT-5.4 則約 509 美元,前者反而高出 38%。

這類現象並非單一案例。研究人員針對不同模型與任務進行 336 組配對比較,其中 106 組出現低價模型反而成本更高的情況。而且,不同任務的成本排名也會改變,這代表企業不能單憑模型 API 價目表,就推定哪一款模型最省錢。
為什麼便宜模型反而更貴?過度推理與執行推高成本
研究進一步分析,造成價格逆轉的兩項主要因素,分別是「過度推理」(Overthinking)與「過度執行」(Overacting)。
過度推理是指模型為了解決相同問題,消耗遠多於其他模型的推理 Token。例如在一道 MMLU-Pro 知識測試題目中,Gemini 3 Flash 消耗超過 60,000 個推理 Token,GPT-5.4 卻只使用 25 個。由於模型推理過程產生的 Token 同樣涉及計費,即使單價較低,只要消耗量差異夠大,最終成本仍可能更高。
過度執行則在 AI Agent 任務中尤其值得注意。與單次問答不同,Agent 可能需要將工作拆成多個步驟,反覆呼叫工具、讀取結果,再決定下一步。每次互動又可能重新處理先前累積的任務資訊,使 Token 費用隨執行輪次增加。
《華爾街日報》引用該研究的案例指出,Gemini 3.1 Pro 執行約 85 個步驟、花費約 1 美元就成功完成任務;Gemini 3 Flash 卻執行近 1,000 個步驟,累積約 14 美元費用,最後仍未成功。
這說明當 AI Agent 開始承接多步驟工作,模型是否能有效推理、決定下一步行動及適時停止,都可能影響最後的執行費用。研究也觀察到,即使同一模型接收相同問題,重複執行時的推理 Token 消耗量最多仍可相差 9.7 倍,進一步增加成本預估的難度。
便宜還不夠,成功完成任務究竟要花多少錢?
然而,單純比較實際執行費用,仍有一項限制:模型花比較少的錢執行任務,不代表一定能成功完成工作。AI 評估平台 Arize AI 與推論服務業者 Fireworks 在 7 月發布的聯合測試,便將評估延伸到「每次成功任務成本」(Cost per Successful Task)。
該研究以 40 項 Agent 任務比較 10 款模型,每項任務重複測試 6 次,合計 2,400 次執行。研究將所有測試的執行費用,包括失敗任務的支出,加總後除以成功次數,衡量平均取得一次成功結果需要多少成本。
結果顯示,Gemini 3.5 Flash 每次執行平均花費 0.288 美元,低於 GPT-5.5 的 0.424 美元。但前者成功率只有 23%,後者達 67%。換算每次成功任務的平均成本,Gemini 3.5 Flash 反而需要 1.233 美元,接近 GPT-5.5 的 0.636 美元的兩倍。

不過,這不代表模型價格越高,完成任務的成本就越低。Arize 研究發現,不同模型的成本效益會隨任務難度改變,部分低價模型在簡單任務中仍具優勢,但面對困難任務時,成功率下降可能抵銷其價格優勢。
綜合兩項研究,企業評估 AI 模型時,除了 API 單價,還需比較實際任務的 Token 消耗、工具呼叫次數及成功率。Arize 指出,即使整體表現接近的模型,在不同任務中的成功率仍可能差距明顯。因此,企業應根據自身工作負載測試模型,並隨著模型能力與價格變化重新評估成本效益。
【推薦閱讀】
◆ AI 小模型戰升溫,Anthropic 推 Haiku 5.5,價格更低、Agent 能力卻更強?
*本文開放合作夥伴轉載,資料來源:《Implicator.ai》、《The Wall Street Journal》、《Financial Times》、arXiv、arize,首圖來源:Unsplash



