OpenAI 財務長揭企業 AI 新帳本:每一美元能買到多少「有用智慧」?

過去幾年來,整個 AI 產業最看重的問題就是:誰擁有最聰明的模型?雖然追求技術巔峰依然至關重要,但一項新的「北極星」指標正悄然浮現,那就是企業「每花 1 美元,究竟能取得多少有用的智慧」。

隨著越來越多模型的能力已足以應付多數日常商業任務,企業買家開始轉變態度,不再盲目追求絕對最強大、最昂貴的模型,而是更在乎如何以合理的成本,讓 AI 可靠地完成工作。這場企業 AI 的成本戰,也讓財務主管們備感壓力,就連 OpenAI 執行長 Sam Altman 都坦言,高昂的成本已成為客戶在部署 AI 時,僅次於組織內部推廣的第二大挑戰。

為了回應這波對成本與回報的質疑,OpenAI 財務長 Sarah Friar 便提出一套新的評估框架,主張以「每一美元的有用智慧」(useful intelligence per dollar)作為衡量 AI 成功與否的新指標。Sarah Friar 強調,企業不應只以整體支出或單純的 token 單價來衡量成效,而應深入評估 AI 是否真的在替企業完成「有價值的實際工作」,例如成功解決客服問題、交付程式碼或完成合約審查。

最強模型不再包辦所有任務,Amazon 如何用分級調度壓低 AI 成本?

這股從追求智慧轉向務實的風潮,正席捲科技巨頭與新創生態系。以亞馬遜(Amazon)重建語音助理 Alexa+ 為例,亞馬遜正積極將更多使用者請求導向其自身開發、能力相對較低但運作成本也更便宜的自研 AI 模型,同時刻意避免不必要地呼叫 Anthropic 旗下價格更高、效能更強的模型。亞馬遜的核心思維非常明確:並非讓 Alexa 每次回答都動用最聰明的模型,而是只有在任務複雜度確實需要時,才動用高成本的 AI 能力。

開發語音 AI 的 Inworld 公司執行長 Kylan Gibbs 對此指出:「這是一個非常強大且真實的趨勢,我們正進入一個許多模型都已經足夠好的狀態,在這種情況下,競爭焦點就會轉向效率。」為了因應此趨勢,Inworld 內部甚至成立專門的研究團隊,專注於讓自家模型運行得更便宜、更快,而不再只是盲目地拉高模型智慧。

事實上,許多企業也已經得出相同的結論。它們不再預設將所有工作直接交給最頂尖的前沿模型,而是把日常工作流導向最便宜且適任的模型,只把最密集、困難的任務留給前沿模型。有些企業則積極實驗開放權重模型,或導入 AI 路由器,自動在成本與效能之間切換,尋求最佳平衡點。

別只看 token 單價,企業開始改算「成功任務成本」

然而,當企業開始精打細算,要如何精確衡量哪款模型能提供每一美元的最佳效益,卻比過去單純比拚模型性能更加複雜。Arena AI 的 AI 能力主管 Peter Gostev 與 OpenAI 財務長 Sarah Friar 提出的評估指標,共同揭示企業在精算 AI 成本時必須考量的四大關鍵細節。

首先,企業必須看模型的實際成效,也就是模型能否可靠地完成實際工作,且這項工作必須是真正對企業有實質貢獻的任務。其次,模型單價並不等於實際的任務成本,企業不能只看單一報價,必須同時比較模型讀取請求與產生答案的費用,因為部分供應商會針對規模特別龐大的任務收取更高費用。

第三,模型能否重複利用先前已處理並快取的資訊,也是省錢的關鍵,因為資訊的重複利用往往能大幅降低最終帳單。最後,企業必須計算完成一項工作所需的步驟與重試次數,因為一款每 token 價格看似極低的模型,如果能力不足,需要額外的引導步驟、反覆嘗試,甚至經常需要人工審核與修正,其最終累積的成本反而可能更高。

因此,Sarah Friar 建議企業應改為精算「每一項成功任務的完整成本」,而不是只看 token 單價。這筆帳不僅要算入 AI 的基本使用費,還要納入模型出錯後重試的成本,以及最後需要人工審核與修正的隱形成本。

對財務主管來說,最核心的經濟考量其實很簡單:AI 完成工作所帶來的實質價值,其成長速度是否高於完成這些工作所付出的總成本?如果生產成本增加得比工作價值還快,這項 AI 投資在經濟上就不合理。

儘管 OpenAI 仍極力主張,其最頂尖、最昂貴的模型,能憑藉效率與更高智慧所帶來的精準度,最終在整體經濟效益上勝出,但在務實的商業市場中,最先進的模型並不總是唯一正確的解答。

在實務上,企業最終選擇的,往往是在確保安全產出所需結果的前提下,價格最低且最可靠的工具。這項工具可能是最簡單的傳統軟體、靈活的開源模型,或高價的前沿模型。因此,在未來的競爭中,能力最強的模型或許仍是市場關注的焦點,但能以相同預算提供最多有用且可靠工作的模型,才更可能贏得市場主導權。

*本文開放合作夥伴轉載,參考資料:《Business Insider》《AXIOS》《Reuters》,首圖來源:AI 工具生成