GPT-5.6 Sol 接 Cerebras 快 14 倍:OpenAI 開始替不同 AI 工作挑晶片

AI 開發者想讓模型即時回應,過去往往得在「速度」與「聰明程度」之間做取捨,OpenAI 近日在自家 API 推出名為「Ultrafast」的新服務層,讓旗艦模型 GPT-5.6 Sol 在不更換模型的前提下,推論速度最高較標準模式快 14 倍,每秒可生成 750 個 output token。

OpenAI 表示,要取得即時速度,通常得改用較小或針對特定用途打造的模型;Cerebras 也指出,開發者長期面臨類似問題:最強的模型通常不夠快,最快的模型又未必具有足夠能力。Ultrafast 服務想解決的,正是這項取捨,而支撐這個速度的並非 GPU,是晶圓級晶片公司 Cerebras 的專用晶片。

原本要過夜跑的研究工作,一日內就可多輪迭代

Ultrafast 目前先在 OpenAI API 上線,採限量預覽,開放給一小群客戶,官方表示會隨產能擴大逐步放寬。

在應用場景上,OpenAI 點名事故排除、金融研究與風控、即時客服與語音、電商,以及過去得跑整夜的即時實驗。早期客戶包含 Jane Street、Podium、Basis 與 Rogo。

Jane Street 的 AI 助理團隊成員 John Crepezzi 表示,Cerebras 帶來的速度提升相當可觀,讓開發者能以更專注、更有效率的方式與模型協作。OpenAI 內部開發團隊也已用 Ultrafast 分析資安事件中的系統日誌與追蹤資料,原本需要跑一整晚的研究工作,現在能在一個工作日內進行多輪測試。

OpenAI 早就找上 Cerebras,750 MW 合作開始落地

今年 1 月,OpenAI 就宣布與 Cerebras 簽署多年合作,要把 750 MW 的超低延遲 AI 運算能力加入自家平台,相關容量預計分批部署至 2028 年。

Cerebras 向美國證券交易委員會(SEC)提交的文件進一步揭露,這筆多年合約價值超過 200 億美元,OpenAI 已在今年 1 月開始取得 Cerebras 運算容量。2 月推出的即時程式開發模型 Codex-Spark,就是第一批使用 Cerebras 基礎設施的 OpenAI 產品。如今 GPT-5.6 Sol Ultrafast 上線,等於把這套高速推論能力進一步帶到 OpenAI 的旗艦模型。

Cerebras 與目前 AI 資料中心普遍採用的 GPU 路線不同。它的核心技術晶圓級引擎(Wafer-Scale Engine,WSE),沒有把晶圓切割成許多獨立晶片,而是把大量運算核心、記憶體與頻寬整合在一個晶圓級處理器上。

OpenAI 今年 1 月解釋雙方合作時指出,這種設計可以減少傳統硬體在 AI 推論過程中的資料搬移瓶頸,尤其適合加速模型產生長篇內容。因此 OpenAI 對 Cerebras 的定位從一開始就很明確,不是全面替換原有的 AI 運算架構,而是替自家平台增加一套專門處理低延遲推論的系統。

快的不只是「吐字」,而是一整個工作任務

Cerebras 公布的測試顯示,Ultrafast 帶來的差異不只反映在每秒產生多少 token。在 GDP-Val 測試中,GPT-5.6 Sol Ultrafast 完成端到端任務的速度提高 5.6 倍,同時維持相同的模型品質。GDP-Val 評估的是法律文件、財務模型、工程報告等具有經濟價值的知識工作,因此這項結果衡量的並非單純的文字生成速度,而是一整項工作能否更快完成。

這對 AI Agent 尤其重要,因為一般聊天可能只需要模型回答一次,但 AI Agent 執行工作時,可能反覆經歷推理、呼叫工具、讀取結果、再次推理與修正等步驟。每一輪模型推論增加的等待時間,都會累積到整個工作流程。

也因此,當模型進入程式開發、金融研究、資安等需要反覆執行工作的場景後,速度不只是影響使用者要等多久,也開始決定同一段時間內,AI 能完成多少輪工作。

不再只比哪顆晶片最快,AI 推論開始「按工作分工」

值得注意的是,OpenAI 並沒有把 Cerebras 描述成既有 GPU 的全面替代品。OpenAI 基礎設施主管 Sachin Katti 在今年 1 月宣布合作時表示,該公司的策略是建立更多元的運算資源組合,依照不同 AI 工作的需求,選擇適合的運算系統。在這套布局中,Cerebras 扮演的就是專門處理低延遲推論的角色。

類似的分工也開始出現在其他 AI 基礎設施業者。今年 3 月,AWS 與 Cerebras 宣布合作,把一次 AI 推論拆成兩個階段:由 AWS Trainium 處理需要大量平行運算的提示詞處理階段(prefill),再由 Cerebras CS-3 負責逐步產生輸出內容的解碼階段(decode)。

7 月,AMD 與 Cerebras 又公布類似的分離式推論架構。AMD Helios 負責高吞吐量與大量上下文的提示詞處理,Cerebras WSE 則接手對延遲更敏感的解碼與生成工作。兩家公司指出,AI 推論對反應速度、吞吐量、成本與規模的要求越來越不同,因此需要依工作特性搭配不同的運算技術。

這些合作顯示,AI 晶片競爭正在出現另一種分工方式。也就是不一定由單一種類的處理器包辦整個推論流程,而是依照不同階段的運算特性,把工作交給更適合的架構。這類結合不同處理器優勢的做法,也就是所謂的「異質運算」。

而 OpenAI 與 Cerebras 的合作可能還會再往前一步。Cerebras 向 SEC 提交的文件顯示,雙方協議還包含未來共同設計模型與硬體的可能,讓 OpenAI 能依 Cerebras 的硬體特性設計模型,Cerebras 也能按照 OpenAI 下一代模型的需求調整硬體。

因此,GPT-5.6 Sol Ultrafast 的意義不只是讓一個模型快 14 倍。當 AI 模型開始深入 AI Agent 與即時工作流程,運算基礎設施的競爭也正在從哪一顆晶片效能最好,逐漸開始關注:哪一種 AI 工作,應該交給哪一種運算架構?

【推薦閱讀】

OpenAI 悄悄公布下一代模型 Astra,卻沒公布任何 benchmark 分數

算力狂飆、散熱失速:Synopsys 如何看 AI 重寫晶片到系統的設計規則?

特定模型推論快 48 倍卻犧牲彈性:AMD 為何仍買下 Taalas 對抗 NVIDIA?

*本文開放合作夥伴轉載,資料來源:OpenAI 1OpenAI 2Cerebras 1Cerebras 2Cerebras 3《9to5Mac》《Unite.AI》SEC,首圖來源:擷取自 OpenAI