返回首頁

推論系統

NInfer 為兩款 Qwen3.6 寫死推論路徑,單張 RTX 5090 長解碼達每秒 543 token

開源 NInfer 以客製量化、權重布局、融合核心與 MTP 草稿路徑,讓 Qwen3.6-35B-A3B 在單張 RTX 5090 上長程解碼維持約每秒 543 token。速度來自針對模型與 GPU 的深度特化,目前只支援兩個 checkpoint、缺乏連續批次,也尚無同條件獨立評測。

极客湾Geekerwan · CC BY 3.0 · Image source
zh-Hant

開源專案 [NInfer](https://github.com/Neroued/ninfer) 近期在 LocalLLaMA 引發測試熱潮。作者沒有延伸 llama.cpp 或 vLLM,而是從 C++/CUDA 重寫固定推論管線,專門服務 Qwen3.6-27B 與 Qwen3.6-35B-A3B,以及 RTX 5090 的 sm_120a 架構。其最佳公開結果是在單一請求中生成 65,536 token,35B-A3B 平均解碼速度為 542.8±12.5 token/秒,MTP 接受率 73%;較短的結構化輸出則可達約 661 token/秒。

效能來源包括約 4.97 bits-per-weight 的自訂量化、配合核心存取方式重排權重、逐算子最佳化、kernel fusion,以及專用 LM head 草稿路徑。公開模型成品約 20.84 GiB;搭配 INT8 KV cache,可在 32GB 顯示記憶體內使用模型原生 262,144-token 上下文。專案也提供文字、圖像與影片輸入,以及 OpenAI、Anthropic 相容的 HTTP 介面。作者另公布 AIME 及 GPQA-Diamond 的單次評測,用來檢查量化後能力是否明顯崩壞。

社群的初步重跑顯示同一模型可達約 448 token/秒,但也發現模板處理曾錯誤清除 prefix cache;另有使用者指出,NInfer 的 27B prefill 未必勝過採 NVFP4 的 vLLM。這正好界定其技術價值:把模型、權重格式與單一 GPU 一起最佳化,能遠超通用執行器的部分解碼路徑,代價則是可攜性與服務功能。目前僅支援兩個 checkpoint、主要鎖定 RTX 5090,且沒有 continuous batching。下一步應看同量化品質下的盲測、標準化 prefill/decode 比較,以及多人併發後優勢是否仍存在。

來源

  1. NInfer: High-performance single-GPU inference for selected model checkpoints and GPUs
  2. 543 tok/s single-request Qwen3.6-35B-A3B on one RTX 5090 over a 65K-token decode
  3. NInfer community reproduction and discussion