隨著 AI 應用持續朝更複雜的推理與 Agent 任務發展,推論(inference)速度正成為影響使用體驗與工作效率的重要瓶頸。晶片公司 Cerebras 近日宣布推出新一代伺服器系統 CS-4,採用了該公司獨創、面積等同於整張餐盤大小的「晶圓級晶片」(Wafer-Scale Engine),瞄準生成式 AI 與 AI Agent 的高速推論需求。
Cerebras 表示,CS-4 的 AI 推論速度最高可達傳統 GPU 系統的 30 倍。這項速度優勢對 AI Agent 尤其重要,因為 Agent 執行任務時往往需要反覆推理、呼叫工具並產生大量 token,每一步的延遲都會不斷累積,最終拉長整項工作的完成時間。不過需要注意的是,目前「最高快 30 倍」仍是 Cerebras 官方提供的測試數據,尚未經公正第三方的標準測試(Benchmark)驗證;此外,Cerebras 所標榜的極致效能也高度依賴運算的「稀疏性」(sparsity),在一般大型語言模型推論中未必能完全發揮。
不過,CS-4 的改變不只是追求更高算力。Cerebras 同時重新設計整套伺服器架構,降低硬體複雜度,並進一步將 AI 推論的不同階段交由最適合的晶片處理,讓競爭從單顆晶片效能延伸到整套 AI 基礎設施如何協同運作。
少一半零件、頻寬翻倍:Cerebras 把競爭從單顆晶片推向機櫃級基礎設施
CS-4 採用全新的 Nexus 伺服器架構,將運算、供電與控制元件重新模組化。單一機櫃最多可容納三套整合運算、供電與控制電路的系統模組,並直接與機櫃背板連接,機櫃正面則主要配置供電系統。Cerebras 技術長 Sean Lie 指出,新設計讓 CS-4 的零件數量較上一代減少約 50%,不僅降低系統複雜度,也有助縮短資料中心部署與建置時間。
Nexus 也同時強化晶片之間的資料傳輸能力。CS-4 將晶片間通訊頻寬由 1.2 Tbps 提升至 2.4 Tbps,並把晶片彼此間的延遲從約 5 微秒降至 2 微秒。這顯示 Cerebras 的競爭重心,正從「單一超大晶片能跑多快」,延伸到整個機櫃級基礎設施(rack-scale infrastructure)的整合效率。
這也是目前 AI 硬體產業共同的發展方向。從 NVIDIA NVL72 到 AMD Helios,都不再只強調單顆加速器規格,而是將運算、網路、供電與散熱整合到機櫃層級。CS-4 的設計,也反映 AI 晶片競爭正在進一步走向系統級整合。
Cerebras 拆開 AI 推論流程,讓不同晶片各做擅長的事
在這次發表的背後,更關鍵的技術與戰略轉折,在於 Cerebras 決定擁抱「解構式推論(disaggregated inference)」的架構。傳統上,AI 模型推論往往被打包交由同一款硬體加速器來包辦預填充(Prefill)與解碼(Decode)這兩個性質大不相同的運算階段。
然而,這兩個階段對硬體的實質需求其實完全不同:預填充階段需要一次性處理大量的輸入資訊,因此極度考驗平行運算能力與整體的資料吞吐量;相比之下,解碼階段則是逐一生成 token 的過程,屬於序列運算,對於硬體系統的延遲表現極為敏感。這也讓不同的硬體架構在推論的不同階段各具優勢。
看準這個硬體特性上的差異,Cerebras 本次與 Amazon Web Services(AWS)和 AMD 攜手展開合作,不再堅持由自身的晶片主導整個推論流程,而是容許客戶將計算密集度極高的預填充階段,外包給更擅長大量平行計算的 AMD Instinct GPU 或是 AWS Trainium 加速晶片,等到要進行連續生成 Token 的解碼階段時,再把工作交由具備超高記憶體頻寬的 Cerebras 晶圓級處理器接棒,以極低延遲持續且快速地輸出 token。
這項舉動讓 Cerebras 的市場角色發生微妙而實質的轉變。過去,Cerebras 多以 GPU 挑戰者的姿態,強調晶圓級架構在 AI 推論上的速度優勢;但在實際落地部署的策略上,如今已不再追求由單一類型硬體包辦整段推論流程,而是靈活地將自己定位為解構式推論中的高效分工角色,讓不同晶片各司其職,共同完成一段流暢的高速推論。
Agent 讓高速推論更值錢,Cerebras 下一關是要把速度變成規模化生意
這種分工之所以在當下更具商業意義,與 AI Agent 的快速普及密切相關。當能夠自動編寫程式碼、進行深度市場研究的 Agent 需要連續完成多個運算步驟,評估 AI 推論效能的方式,也開始進一步衡量「完成一項複雜的 Agent 任務需要花費多少時間」。在這樣的評估體系下,專注於低延遲的解碼加速器(Decode accelerator)便獲得明確的價值定位。
為了將這項技術優勢轉化為規模化實力,Cerebras 執行長 Andrew Feldman 表示,公司的工程研發計劃將持續專注於提高未來晶片與系統的資料處理速度,並強調:「從現在到 2027 年底,我們的運算速度將提升 4 倍,同時吞吐量將增加 20 倍。」並預計在 2027 年底前,建立起高達 600MW(百萬瓦) 的龐大運算能力交付規模。
然而,對 Cerebras 而言,CS-4 的真正考驗依舊在市場商業化的成效。自 Cerebras 公開上市(IPO)以來,股價表現面臨不小的壓力,目前已較首日收盤價下跌超過 30%,且近期公佈的第二季營收亦未達市場預期。Freedom Capital Markets 科技研究主管 Paul Meeks 雖給予其極高的技術肯定,但也同時警告,Cerebras 要將這套龐大的晶圓級系統產能擴大並實現規模化交付,其難度可能高於投資人原本的預期。
在必須持續確保晶圓供應鏈、擴張製造產能以及建置資料中心空間的挑戰下,Cerebras 急需藉由 CS-4 的實務部署向市場證明,其晶圓級晶片架構不僅能跑得飛快,更能在一個 GPU、Trainium 等多種硬體加速器共存的混合型 AI 基礎設施生態中,開闢出足夠龐大且具備商業價值的生存空間。
科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉立即投遞履歷
【推薦閱讀】
◆ NVIDIA 出面替 OpenAI 的 10GW 資料中心擔保,同時鎖定第一期獨家晶片供應權
◆ Cursor 推 Origin 進軍程式碼託管:AI coding 戰場為何從 IDE 打到 GitHub?
◆ AI 晶片客戶需求上看 20 億美元,Arm 卻得從零搶台積電與記憶體產能:從賣 IP 到自己賣晶片有多難?
*本文開放合作夥伴轉載,參考資料:《Reuters》、《The Register》、《MarketWatch》,首圖來源:Cerebras



