半導體巨頭 AMD 正式宣布收購加拿大 AI 推論晶片新創公司 Taalas,為迅速白熱化的 AI 晶片戰場投下震撼彈。隨著 AI 應用逐漸從耗費巨資的「模型訓練」階段,跨入需要即時、大規模部署的「推論服務」,各大晶片廠已將專用推論晶片視為降低運算成本的兵家必爭之地。
在眾多追求通用運算能力的晶片中,Taalas 的技術路徑顯得非常獨特:Taalas 不採用傳統 GPU 這一類「一般用途」(general-purpose)的晶片架構,而是反其道而行,選擇直接將特定 AI 模型的權重與資料流「刻進」矽晶片中。這種極致的專用化設計,目標是打破傳統晶片在運算與記憶體之間的傳輸瓶頸,以犧牲通用彈性為代價,換取更高的推論運算速度與能效。
不靠 HBM 反覆讀取權重,Taalas 用「模型專用晶片」加速推論
在傳統 GPU 架構中,運算過程高度依賴且需要不斷從昂貴的高頻寬記憶體(HBM)中反覆讀取模型權重。相較之下,Taalas 的技術核心在於擺脫記憶體頻寬瓶頸,這種將模型權重直接寫入矽晶片中的模式,使這款產品更接近一種專為特定模型量身打造的「模型專用積體電路」(Model-Specific Integrated Circuit, MSIC)。
這套硬體架構本質上借鑑 2000 年代初期的結構化特定應用積體電路(structured ASIC)概念,將模型的資料流直接串接在運算元件之間,也讓晶片內部被精簡地劃分為兩個主要區域:包含負責儲存燒錄權重的唯讀記憶體(ROM)架構,以及負責存放鍵值快取(KV cache)與微調轉接器的靜態隨機存取記憶體(SRAM)架構。
AMD 官方強調,這種創新的硬體設計能大幅最佳化推論時的資料流,藉此解決一般用途架構在運算與記憶體傳輸上的物理瓶頸。
HC1 推論快 48 倍,Taalas 仍需面對模型彈性與擴充限制
這項技術在 Taalas 實測數據得到驗證。Taalas 在今年 2 月公開的首款測試晶片「HC1」採用台積電 6 奈米製程,專為執行 Meta 的 Llama 3.1 8B 模型所打造。根據基準測試,HC1 在執行該模型時每秒可生成高達 16,960 個 token,其生成速度不僅是傳統 NVIDIA GPU 的 48 倍,更是 Cerebras 晶圓級加速器的 8.5 倍,展現專用化的驚人效能。
然而,提高速度的代價是幾乎移除晶片所有的可程式化能力,這也代表一顆晶片出廠後便與特定模型深度綁定。為了解決這個硬傷,Taalas 進一步研發一套專利工具流程,能夠在收到特定模型後,於短短兩個月內快速將其轉換為客製化晶片定案(tape-out)。在實際應用中,若要切換不同的模型,並不需要從頭重新設計整顆晶片,實務上通常只需修改代表模型權重與資料流的兩層光罩即可,大幅降低製造門檻。
雖然目前的單晶片極限約為 80 億參數,但面對更大的模型,Taalas 規劃在下一代「HC2」晶片支援 200 億參數,並能透過流水線並行技術將權重分散至多顆晶片共同執行。不過,由於其完全基於 SRAM 的設計,因此像 6710 億參數的 DeepSeek 671B 這一類極大型模型,仍需要約 30 次獨立的晶片定案,對超大規模模型而言仍存在硬體堆疊上的物理限制。
GPU 負責預填充、Taalas 加速解碼,AMD 重組對抗 NVIDIA 的推論架構
這起併購案的核心戰略價值,在於 AMD 如何運用 Taalas 的專屬硬體來反擊市占巨頭 NVIDIA。不久之前,NVIDIA 才斥資高達 200 億美元與另一家以超高推論速度聞名的新創公司 Groq 達成資產交易,計劃將 Groq 晶片與 GPU 搭配,共同建構具備低延遲性能的 AI 代理人服務。
這次 AMD 收購 Taalas,雙方最關鍵的結盟戰略在於推動「解耦式推論」(disaggregated inference)架構。在這種配置下,AMD Instinct GPU 將專注處理需要大量運算的「預填充」(prefill)階段,而後續對延遲極度敏感、極度消耗 token 生成速度的「解碼」(decode)階段,則交由採用 Taalas 技術的 SRAM 專用晶片進行超高速加速。
雖然 AMD 近期才宣布與 Cerebras 展開合作,計畫由 AMD GPU 處理預填充階段、並由 Cerebras 的晶圓級引擎加速解碼階段。然而,收購 Taalas 則改變這個局勢,未來 AMD 能夠直接採用 Taalas 的 SRAM 晶片來替代 Cerebras,負責解碼加速,這也代表 AMD 不再需要完全依賴第三方晶片廠商,就能將整個高效能推論系統的軟硬體控制權與供應鏈,牢牢掌握在自己手中,運作模式更類似 NVIDIA 控制整體系統的策略。這套端到端自主掌控的硬體組合,也能契合 AMD 近期已開始出貨給微軟(Microsoft)、Meta 等雲端巨頭的 Helios 櫃級伺服器平台,為這些極度渴望降低 token 運算成本的客戶,提供一站式、自主可控的客製化推論解決方案。
從雲端到邊緣,Taalas 補上 AMD 全端 AI 推論版圖
事實上,這項交易是 AMD 近年來建構「全端 AI 生態系」一連串併購計畫的最新一步。在此之前,AMD 已斥資數十億美元收購了 Silo AI、ZT Systems 以及高速度推論軟體公司 MK1 等企業,逐步備齊從硬體晶片、櫃級伺服器設計到模型優化軟體的拼圖。
Taalas 技術的加入,更擴大了 AMD 在雲端與邊緣端推論市場的打擊面。因為除了搭配旗艦級 GPU 提供超大型雲端客戶服務外,Taalas 技術也非常適合應用於邊緣端或物理 AI(Physical AI)等電力受限且對成本敏感的領域。在這些場景中,模型尺寸通常較小,且不需要頻繁更新模型,因此 Taalas 的結構化 ASIC 便能以極低的能耗與成本,提供極高的即時響應速度。
此外,隨著 AI 模型開發逐漸轉向需要大量 token 運算的「測試時間擴充(test-time scaling)」推理技術,也就是讓模型耗費更多時間進行深度思考的技術,Taalas 被預期能將每個 token 的成本降低,並將輸出速度提升 10 到 20 倍,同時將特定模型權重直接刻錄入晶片的製造成本,更比訓練一個全新前沿模型便宜了 100 倍,這將為 AMD 的客戶與合作夥伴在部署與研發上帶來極大的成本與效能優勢。
對 AMD 而言,Taalas 提供一條以模型專用化換取極致速度與效率的全新推論路線,與現有的 Instinct GPU、EPYC CPU、ROCm 軟體等形成強大的互補。AMD 人工智慧事業群資深副總裁 Vamsi Boppana 對此強調:「AMD 正在建構一個全端的 AI 平台,讓客戶能夠靈活地為每種 AI 工作負載部署合適的運算解決方案,Taalas 的技術與工程團隊透過提供具差異化的推論效能與效率,強化我們的 AI 產品組合。」
這也代表,AMD 的 AI 晶片策略正從單純比拚 GPU 效能,進一步走向依照不同工作負載配置不同運算架構。因此,Taalas 能否在保留足夠模型彈性的同時,把專用推論的速度與成本優勢真正帶進 AMD 全端平台,將成為這起收購案後續值得觀察的關鍵。
【推薦閱讀】
◆ 自研晶片卻不放棄 NVIDIA:Anthropic 為何想用軟硬體協同設計重塑 Claude 成本結構?
*本文開放合作夥伴轉載,資料來源:《The Register》、《EE Times》、《CNBC》、《Reuters》、AMD,首圖來源:Taalas



