推論系統
Chord 針對 Kimi K2.x 重寫 INT4 MoE 核心,依推論階段選擇 GPU 排程
Novita AI 與 vLLM 開源 W4A16 CUDA 運算子 Chord,針對 H200、B200 與 B300 的 Kimi K2.x 服務形狀調校。公開測試最高達 Humming 的 2.15 倍,但數字只涵蓋 MoE 層核心,不能直接換算成端到端吞吐量。

Novita AI 與 vLLM 團隊開源 Chord,一套供 Kimi K2.x 系列使用的 W4A16 MoE CUDA 運算子:輸入維持 BF16、權重量化為 INT4,並以每 32 個權重一組的 BF16 scale 反量化。它不是通用 GEMM 替代品,而是針對稀疏模型中 gate、up 與 down projection 的實際路由形狀,分別調整 prefill、decode、張量平行與專家平行的排程。
Chord 提供兩族核心。`indexed` 路徑沿用 Humming 的路由介面,可支援 H200 的 EP8 prefill、decode 與 TP8 混合負載,以及 B200/B300 的 EP8 decode;`grouped_contiguous` 和 `grouped_masked` 則源自 DeepGEMM 的資料配置,分別處理 prefill 與 decode。排程器會按每個 expert 實際收到的 token 數選擇 block 大小、stream-K、CTA 駐留量及管線深度,而不是只看整批 token 數。核心也使用 WGMMA、TMA、warp specialization 與快取後的 cubin descriptor,避免小型 decode 每次重新搜尋配置。
作者以相同 GPU、形狀及路由分布比較公開版 Humming:H200 EP8 prefill 約快 1.11 至 1.20 倍,H200 decode 約 1.16 至 1.24 倍;B300 decode 報告 1.81 至 2.15 倍。工程團隊應注意,B300 基線是 Humming 尚未調校的預設策略,而測量排除了路由、通訊及 activation,不能代表整個 vLLM 服務同幅加速。套件雖可透過 Humming 相容入口接入部分 vLLM 版本,grouped 路徑的正式整合仍在進行;部署前也須驗證 WNA16 group-scale 支援、量化格式與自身 token-per-expert 分布。