返回首頁

AI 晶片與推論

Extropic Z1T 為機率晶片重寫 Transformer,但百倍節能仍是排除關鍵成本的估算

Z1T 以固定四路稀疏投影、動態 tanh 與卷積式注意力,把部分解碼運算映射至 Extropic 的 Z1 機率位元晶片。程式與一組權重已公開,但節能和吞吐數字主要來自硬體模型,尚非完整端到端實測。

Unknown Master, Italian (active 1570s) · Public domain · Image source
zh-Hant

Extropic 公開 Z1T,嘗試從模型架構端配合 Z1 機率晶片的固定稀疏拓撲,而非把既有密集 Transformer 原封不動搬上新硬體。Z1 每顆晶片包含 269,568 個機率位元(pbit),每個節點只有 16 條硬接線耦合。Z1T 因而把投影限制為每個輸出四個輸入,再以四個 pbit 表示一個近似低精度數值;反覆取樣後取平均,可用更多樣本交換較高的有效精度。

架構也替換了幾個 GPU 導向的元件:RMSNorm 改成可映射為取樣電路的 Dynamic Tanh,softmax 自注意力則改為帶局部卷積及累積池化的 gated convolutional attention。稀疏 tanh-linear 層交給 Z1,殘差、池化、位置處理與其他密集運算仍由 FPGA 負責,形成異質管線。公開的 JAX 儲存庫包含稀疏模型與 Z1T 訓練配方,Hugging Face 也提供首個 Z1T-0 權重,讓研究者先在傳統硬體檢查架構與損失曲線。

官方估算的四層、寬度 512 測試模型,在不計最終詞彙 logit 層與晶片間資料搬移時,每 token 約耗 294.52 nJ;若把 H100 假設為僅達 10% 理論利用率,差距約 139 倍。然而其中超過 95% 能耗已來自 FPGA,加入 FPGA 上的最終詞彙讀出後,估算會升至約 136.4 µJ;所需並行 Z1 晶片數量也未建模。其 17,000 token/s 同樣是延遲模型,而非完整系統量測。真正值得追蹤的不是「取代 GPU」結論,而是團隊能否在實體多晶片板卡上公開端到端功耗、I/O、批次處理、品質及總晶片面積,證明硬體—模型共同設計的增益能跨越被排除的系統成本。

來源

  1. Z1T: Sparse Transformer-Like Models for Probabilistic Hardware
  2. extropic-ai/sparse-transformers
  3. Extropic-AI/Z1T-0