開源推論
NInfer-3090 以 ReplaySSM 壓低推測解碼狀態成本,RTX 3090 可併發跑 Qwen3.8-27B
NInfer 的 Ampere 分支把 Qwen3.8-27B、MTP3、分頁 KV 與相容前綴重用塞進單張 24GB RTX 3090。作者測得八路解碼合計 165.33 token/秒,但結果集中於短提示、長輸出的固定工作負載。

NInfer-3090 v0.6 將原本面向新一代 GPU 的專用 C++20/CUDA 推論引擎移植至 RTX 3090 的 `sm_86`,並把 Qwen3.8-27B 列為首要支援模型。核心新增項目是 ReplaySSM:在 MTP 推測解碼期間,把混合模型的循環狀態視為可提交或回滾的交易,避免每條併發序列保留多份完整暫存狀態。配合 INT8 KV、paged KV、CUDA Graph 與固定 cohort,專案聲稱可在 24GB 顯示記憶體內,讓八個請求繼續使用三 token 的 MTP 草稿,而非因狀態膨脹關閉推測解碼。
作者公布的持續測試讓每個請求生成 1,024 token。單路端到端吞吐為 70.19 token/秒、平均 TTFT 149 毫秒;八路合計為 161.28 token/秒,純解碼達 165.33 token/秒,峰值 VRAM 22,138 MiB,MTP 接受率則由單路 61.13%降至八路 56.84%。這代表它主要以較高總吞吐換取單請求等待時間:八路平均 TTFT 增至 1.215 秒。引擎亦提供 OpenAI Chat Completions、Responses 與 Anthropic 相容介面,並能重用相容提示前綴。
模型檔不是 GGUF 或 Transformers checkpoint,而是 16.96GiB 的 `.ninfer` 專用容器,內含量化文字權重、視覺編碼器、MTP 與 proposal head;部署因而被綁定至特定 runtime revision。更重要的是,公開跑分使用約 29至34個輸入 token、8K/16K 共用 KV 池,量到的是短 prefill 加長 decode,不能直接推論程式代理在數萬 token repository context 下的表現。Linux 目前也只完成編譯與啟動檢查,真實模型效能尚待驗證。下一步應看獨立重現、長提示 TTFT,以及 ReplaySSM 在低接受率與頻繁工具呼叫時是否仍能節省記憶體。