AI 基礎設施
NVIDIA Groq 3 LPX 進入量產:以靜態排程在 100K 上下文達每秒 3,431 個輸出 token
Groq 3 LPX 將 256 顆 LP30、128GB SRAM 與編譯器預排的晶片間傳輸整合成低延遲解碼系統。第三方測試顯示長上下文速度領先現有公開端點,但成本、併發吞吐與生產服務表現仍未公開。

NVIDIA 宣布 Groq 3 LPX 進入量產,定位不是取代 Vera Rubin NVL72,而是補上代理推論最難加速的低批次解碼階段。系統可讓 Rubin GPU 處理 prefill、長上下文與 KV cache,再把逐 token 生成交給 LPX;另一種配置則把 attention 留在 GPU、由 LPX 執行 FFN,亦可讓 LPX 擔任投機解碼的外部 draft model。
LPX 機櫃由 256 顆 LP30 LPU 組成,合計提供 128GB SRAM;每顆晶片有 96 條、每條 112Gbps 的點對點連線。關鍵並非只增加頻寬,而是以確定性執行模型讓編譯器預先排定每次計算及資料傳輸,免除執行時仲裁。矩陣乘法結果可切成 320-byte 向量,邊計算邊跨晶片傳送,降低小 batch 張量平行最容易被固定通訊延遲抵消的問題。
Artificial Analysis 在 NVIDIA 資料中心測試 Gemma 4 31B:100K 輸入上下文的中位輸出速度為每秒 3,431 token,對照當時最快公開端點的 870;10K 上下文則為 3,382。測試使用統一的 `o200K_base` tokenizer 計數,並稱輸出精度與模型品質沒有下降。NVIDIA 自行執行的 SPEED-Bench 另錄得每秒 4,767 token 中位數,但這不是同等獨立測試。
這項設計對需要數十至數百輪工具呼叫的代理很有吸引力:上下文不斷增長時,decode 仍可維持互動速度。然而現有數字是單一模型、特定機櫃與低批次效能,尚未交代多租戶併發、prefill 交接 KV cache 的成本、功耗或每百萬 token 價格。工程團隊下一步應觀察 Nebius、Groq 等實際服務的延遲分位數,以及不同 MoE、量化格式和大 batch 下能否保持相同優勢。