Cerebras 發表 CS4 系統,運算效能較 GPU 快 30 倍;OpenAI 確認運算需求「遠超」現有產能
上市後首場產品發表會詳述次世代架構與 2027 年發展藍圖,並公布包括 OpenAI、AMD、Arista 與 CrowdStrike 在內的擴大客戶陣容
Cerebras Systems 於 2026 年 8 月 18 日在舊金山舉行名為「Supernova」的產品發表會,這是該公司今年上市以來的首場大型公開活動。執行長 Andrew Feldman 在會中發表次世代 CS4 系統及機架級架構,並展示了一系列合作夥伴與客戶陣容,包括 OpenAI、AMD、Arista Networks 與 CrowdStrike,共同勾勒出圍繞該公司晶圓級晶片所形成的廣泛「解構式推論」(disaggregated-inference)生態系統。
CS4 架構:關鍵技術揭露
對投資人而言,最重大的新資訊莫過於 CS4 系統的規格。Cerebras 表示,該系統的系統級效能較目前的 CS3 世代提升 6 倍,Token 生成速度快 2 倍,每瓦 Token 產出效率則提升高達 10 倍。技術長 Sean Lie 表示,該系統採用名為 WSE-3 Turbo 的新款晶片,是首款整合三片晶圓的 Cerebras 系統,每片晶圓可提供高達每秒 43 PB(petabytes)的記憶體頻寬。Lie 宣稱這比「Nvidia 次世代 GPU Rubin 的記憶體頻寬高出 2,000 倍」,若數據準確,這將凸顯 Cerebras 在推論解碼階段(decode phase)所具備的結構性記憶體頻寬優勢。
該公司同時推出名為 Nexus 的新型機架級架構,採用模組化電源供應器與「可插拔背包」(pluggable backpacks),每個背包搭載一顆晶圓級引擎。Cerebras 指出,此模組化設計可減少 50% 的零件數量,提升 60% 的製造自動化程度,並將資料中心部署時間從數天縮短至數小時,旨在解決長期困擾大規模 AI 基礎設施建置的資本密集度與部署瓶頸問題。CS4 現已開放早期存取,預計於本季稍晚全面上市。
對於長期模型建置而言,更重要的是其發展藍圖承諾:Cerebras 指引目標為每年將原始效能翻倍,並設定 2027 年前達到 20 倍傳輸量的具體目標,屆時將隨 CS5 系統推出次世代晶圓級引擎。這是一項多年期的架構承諾,而非單一產品的更新,為投資人提供了評估其執行力的具體指標。
OpenAI 合作規模擴大,需求評論成為關鍵訊號
Cerebras 揭露 OpenAI 上週宣布推出「GPT-5.6 Sol Ultrafast mode」,這是一項全新的服務等級,能以高達標準 14 倍的速度執行 OpenAI 最智慧的模型,且僅在 Cerebras 硬體上提供。OpenAI 核心產品與平台負責人 Thibault 親臨現場表示:「我們希望 Ultrafast 能直接成為預設模式。我認為這預示了未來的發展方向。」Feldman 特別向現場投資人強調了這番言論的重要性。
比產品本身更具意義的,是 Thibault 對 OpenAI 整體產能限制的評論。當被問及公司如何看待規模擴張時,他表示:「當模型在 GPU 上運行的價值超過其運算成本時,你就會希望擁有全世界所有的產能來運行它……這是我們時刻討論的話題……需求遠遠超過我們整個機群的產能。我不認為有任何理由相信這種情況會放緩或改變。」這是來自業界最大運算需求方之一、針對 AI 基礎設施建置需求面所提供的第一手公開數據,這不僅強化了 Cerebras 的多頭論點,也對整體硬體供應商有利。
解構式推論:AMD 合作案確立新型架構模式
Cerebras 在會中詳述與 AMD 的合作關係,核心在於所謂的「解構式推論」:將推論的預填充階段(prefill stage,處理使用者輸入,具備高度平行化且對記憶體頻寬需求較低)分配至 AMD 的 GPU(特別是即將推出的 Helios 機架)處理,而將解碼階段(decode stage,序列式 Token 生成,對記憶體頻寬需求極高)導向 Cerebras 晶圓。Feldman 表示,此組合能提供比單純使用 GPU 快 10 倍的效能,並比單獨使用 Cerebras 快 5 倍的傳輸量。AMD 技術長 Mark Papermaster 稱其為「出於必要性的創新」,反映出業界基礎設施支出正從以訓練為主導的建置,轉向以推論優化的架構。CS4 的 I/O 模組明確設計為採用 RoCE 網路技術的「可程式化通用解構介面」,將 Cerebras 定位為硬體中立,而非試圖完全取代 GPU,考慮到 Nvidia 現有的龐大安裝基礎,這是一個值得注意的戰略訊號。
資料中心建置與網路依賴
Feldman 透露,Cerebras 已上線或簽約的資料中心產能達 600 百萬瓦(MW),預計明年底前交付,據點涵蓋聖塔克拉拉、多倫多、達拉斯、明尼亞波利斯、蒙特婁、奧克拉荷馬市、阿拉巴馬州、里昂,以及挪威與芬蘭的站點。他坦言這「遠遠不夠」,承認產能競賽仍是一個持續存在的限制,而非已解決的問題。
Arista Networks 執行長 Jayshree Ullal 出席說明支撐這些叢集的網路層架構,指出 Arista 已為 AI 工作負載建置了不同於傳統雲端網路的差異化流量類別,並提醒企業對代理式 AI(agentic AI)的採用——不同於超大規模雲端與新興雲端部署——「才剛起步」,意指未來仍有龐大的未開發需求池。她亦強調網路韌性將是下一個主要瓶頸,直言「未來最大的挑戰將是如何在硬體故障或線路中斷時,維持運算可用性」,提醒市場規模化可靠性與原始速度同樣是關鍵差異化因素。
客戶驗證:Figma、Cognition、Armis 與 CrowdStrike 量化速度論點
除了基礎設施合作夥伴外,Cerebras 還展示了實際部署數據。Devin 程式設計代理開發商 Cognition 揭露,其內部 SWE-grep 模型在 Cerebras 上運行速度高達每秒 2,800 個 Token,比同類大型語言模型快 10 倍以上;其較新的 SWE-1.7 模型在品質上與 GPT-5.5 及 Opus 4.8 相當,運行速度卻接近每秒 1,000 個 Token,且成本遠低於 Kimi K2.7 Code 或 GLM 5.2 等同類模型。Figma 則詳述了一款嵌入其多人協作畫布中、由 Cerebras 驅動的全新設計代理,強調快速推論使設計等迭代式、非驗證性的創意工作變得可行,這是較慢的推論速度所無法支援的。
Cerebras 也引用了程式碼安全掃描客戶 Armis 的數據,該公司完成掃描的時間僅為基準前沿模型的三分之一,且能以更低成本發現更多漏洞。CrowdStrike 工程副總裁 Keith Culley 則從安全角度精準定義了速度的重要性:透過更快的推論,安全工具能在「相同的可接受時間窗口內進行 5 到 10 倍的檢查」,這降低了摩擦並廣泛提升了安全控制的採用率。他指出業界基準顯示駭客最快的網路突破時間為 27 秒,主張網路安全的決策窗口現在是以個位數秒計算,在這種情況下,推論延遲具有直接且可量化的金錢影響,而不僅僅是使用者體驗的提升。
總結而言,這場發表會與其說是單一產品發布,不如說是一場系統級的論點辯護:Cerebras 押注於記憶體頻寬受限的解碼工作負載在晶圓級矽晶片上仍具結構性優勢,並認為與 GPU 合作夥伴採取解構式架構(而非取代 GPU)是具備商業可行性的路徑。隨著編碼、設計與安全領域的付費客戶群不斷擴大,也驗證了市場願意為「速度」這一獨特產品屬性買單,而非僅將其視為基準測試的好奇心。