返回首頁

AI 基礎設施

Cerebras CS-4 以三片 WSE-3T 組成機架系統,峰值頻寬增至 129.6 PB/s

CS-4 並非改用新製程,而是提高 WSE-3 的時脈、供電與 I/O,再以三片晶圓級處理器組成 Nexus 機架。官方宣稱推論速度最高為 GPU 方案的 30 倍,但 PFLOPS 與每瓦吞吐數字仍缺少可比的獨立端到端測試。

Dwergenpaartje · CC BY-SA 3.0 · Image source
zh-Hant

Cerebras 發表 CS-4,將三片 WSE-3 Turbo(WSE-3T)整合進新的 Nexus 機架級架構。整套系統標示 750 PFLOPS AI 運算、129.6 PB/s 記憶體頻寬、160.5 PB/s 晶片內互連頻寬,以及 7.2 Tb/s 對外 I/O;晶圓間延遲則由 CS-3 的 5 微秒降至最低 2 微秒。首批系統預定本季出貨。

值得注意的是,WSE-3T 並非新一代製程晶片。它沿用 WSE-3 的 5 奈米設計、4 兆電晶體、90 萬個核心及每片 44 GB SRAM,主要透過更接近處理器的電源轉換、約兩倍供電能力及更高運作頻率,把單片標示算力由 125 提至 250 PFLOPS。三個可拆換的「Backpack」模組則把運算、供電與 I/O 分離,改善部署及維修方式。

通訊方面,Wafer I/O Module 同時支援 RoCE v2 RDMA 和不經交換器的 Direct Wafer Links;後者以二維環狀拓撲連接跨機架晶圓,目標是以低延遲流水線平行處理超大型模型。Cerebras 亦把它定位為分離式推論的解碼端,讓 AWS Trainium 或 AMD Instinct 處理算力密集的 prefill,再把狀態交給高頻寬 SRAM 執行逐 token 解碼。

工程團隊不應直接把 750 PFLOPS 視為 GPU 等值算力。該峰值含稀疏運算假設,而稀疏加速未必能套用至所有 LLM;官方「最高 30 倍」及「每瓦吞吐提高十倍」也混合內部與第三方比較。接下來應觀察實際功耗、併發批次下的每使用者延遲、prefill/decode 交接成本,以及 132 GB 機架內 SRAM 對不同模型精度與 KV cache 的容量限制。

來源

  1. Cerebras Unveils CS-4: Up to 30 Times Faster than GPU-based Solutions
  2. Cerebras CS-4 rack systems juice their dinner-plate-sized AI chips for every last drop of AI perf
  3. CS-4 Datasheet