推論系統
Laguna S 2.1 INT4 搭 DFlash,四張 RTX 3090 實測 200K 上下文與峰值 282.5 token/s
社群公開可重現的 vLLM 配方,以四張 24GB RTX 3090 部署 Laguna S 2.1 INT4,並用精度匹配的 DFlash 草稿模型跑過 190K-token 實際請求。282.5 token/s 是特定設定下的峰值而非持續吞吐,低位元量化的品質與相容性也仍高度依賴 checkpoint 和執行引擎。

一套新公開的社群部署配方,把 Poolside 的 Laguna S 2.1 INT4 與 DFlash 推測解碼放進 vLLM 0.25.1,在四張各 24GB 的 RTX 3090 上提供 200K 上下文。作者不是只驗證模型能啟動,而是送入 190,002-token 提示後繼續生成;同一端點的峰值解碼速度為 282.5 token/s,模型與草稿 checkpoint 合計約需 85GB 儲存空間。
Laguna S 2.1 本體是約 118B 總參數、每 token 啟用約 8B 的 MoE 編碼模型,具有 256 個路由專家、top-10 選擇及一個共享專家。48 層注意力中,36 層採 512-token 滑動視窗、12 層使用全域注意力;BF16 權重約 235GB,因此 INT4 是讓上一代消費級 GPU 實際承載它的關鍵。官方 vLLM 配方亦要求量化本體搭配相同精度的 DFlash 草稿模型,避免不同數值格式使接受率或輸出品質惡化。
DFlash 不是單純縮短模型,而是在每次驗證前平行提出多個候選 token,再由主模型一次確認。vLLM 文件對自然文字量得平均接受長度約 3.1 token,程式碼通常更高;但 Laguna 路徑必須改用 Triton MoE,因預設 DeepGEMM 後端與草稿路徑不相容。此外,開啟推測解碼後不能任意加入 `min_p` 或 `logit_bias`,否則 vLLM 會拒絕請求。
這項結果顯示大型稀疏編碼模型可由二手工作站級硬體承載長上下文,但還不能直接換算為多使用者服務容量。峰值數字未交代完整併發、功耗與持續輸出分布;社群的 Apple Silicon 量化測試也顯示,部分極低位元版本雖能裝入記憶體,卻可能幾乎無法完成品質測試。下一步應比較沒有 DFlash 的同機基線、不同提示長度的接受率,以及 200K KV 快取下的併發退化。