ホームへ戻る

本地推論

Qwen3.8-27B 在 RTX 4090 上可達 70 tok/s,主流部署仍依賴量化與 MTP 調校

Qwen3.8-27B 讓 27B 級模型進入單張 24GB 消費級 GPU 的可用範圍。公開資料顯示,一般 GGUF 部署約落在 30 至 60 tok/s;在 RTX 4090 上啟用 KV cache 量化、MTP 與新版 llama.cpp 後,社群實測可提升至 70 至 85 tok/s,但這仍不是開箱即得的基準。

Benlisquare / Wikimedia Commons · CC BY-SA 4.0 或 GFDL · Image source
zh-Hant

Qwen3.8-27B 的本地推論速度正在成為開源模型部署圈的新焦點。這款 27B dense 視覺語言模型支援文字、影像與影片輸入,官方模型卡標示原生 context window 為 262K,並支援 thinking mode、工具使用與多 token prediction。對想把 coding agent、長文件分析或內部助理留在自有硬體上的團隊來說,關鍵問題不只是模型能力,而是單張 RTX 4090 24GB 能否跑到可互動的速度。

目前答案是可以,但條件很多。從公開測試與社群回報看,Qwen3.8-27B 在 4090 上沒有一個固定 tokens/s 數字。一般 GGUF Q4 或 Q5 部署,透過 llama.cpp、LM Studio、Ollama 或 Jan 執行,較保守的互動速度約在 30 至 60 tok/s。若使用更新版 llama.cpp、全層 GPU offload、FlashAttention、KV cache 量化與 MTP draft,單使用者 decode 可進一步推到 70 至 85 tok/s。更激進的 DFlash、vLLM patch 或特製量化棧可看到 90 tok/s 以上,但目前更接近實驗性調校結果,不宜當成一般部署保證。

速度差異主要來自部署棧。Qwen3.8-27B 採 hybrid 架構,64 層中只有部分層使用完整 attention,其餘層使用 Gated DeltaNet 類型的狀態機制。這讓長 context 的 KV cache 成本低於傳統 full-attention 27B 模型,也解釋了為何 24GB 卡能配置 160K 甚至接近 200K context。不過,權重、vision projector、KV cache、MTP 額外 context 與 CUDA workspace 仍會一起擠壓 VRAM;只要 batch、micro-batch 或 cache 精度設定不合,速度可能掉回 10 tok/s 左右,甚至初始化失敗。

較具代表性的 4090 數據有兩組。一名 Reddit/Qwen_AI 使用者回報,RTX 4090 24GB、Q4_K_M、160K context、全 GPU offload 的日常使用速度約 47 至 57 tok/s,並估算權重、BF16 vision projector、Q4 KV cache 與 DeltaNet state 合計仍可塞進 24GB VRAM。另一名 Hugging Face 討論串使用者則以 RTX 4090 FE、Qwen3.8-27B-UD-Q4_K_XL、196608 context、KV cache q4_0 與 MTP,在 Codex 類型工作負載中回報通常 70 至 80 tok/s,prompt processing 約 1900 至 2100 tok/s;短段生成曾達 77.8 與 84.5 tok/s,8276 tokens 長跑約 71 tok/s。

若轉向服務化部署,主流選項是 vLLM 與 SGLang。Qwen 官方文件推薦 vLLM,原因包括 PagedAttention、continuous batching 與最佳化 CUDA kernel;Qwen3 系列也提供 FP8 與 AWQ 預量化模型。這條路線的重點不是單一使用者最高 decode,而是多請求總吞吐、TTFT、prefix cache 命中率與 GPU 利用率。OpenRouter 已上架 Qwen3.8-27B,顯示它可透過多家 provider 以 OpenAI-compatible API 形式使用,這代表對不想自行維護 GPU 的團隊,託管 API 也是早期主流入口。

需要注意的是,Qwen 官方 speed benchmark 使用 NVIDIA H20 96GB,並以 batch size 1、不同 input length 與 2048-token generation 測量,不能直接換算成 4090 的 consumer GPU 表現。官方文件也將速度定義為 prompt tokens 加 generation tokens 除以總時間,因此與社群常說的 decode tok/s 並不完全相同。比較測試時若沒有同時標示 prompt processing、decode、context 長度、batch size、量化格式與 runtime,數字容易失真。

因此,對 4090 使用者最務實的部署判斷是:Q4/Q5 GGUF 是目前入門主流;若只是低併發 coding agent 或本地助理,30 至 60 tok/s 已經可用;若願意調 KV cache、MTP、FlashAttention 與 batch 參數,70 至 80 tok/s 是可達區間。若要多人 API 或高吞吐,應改用 vLLM 或 SGLang 評估 continuous batching,而不是只追單流 tokens/s。

Qwen3.8-27B 的意義不在於它讓 RTX 4090 變成資料中心 GPU,而是把 27B 級長 context 模型推進了單張 24GB 卡可部署的範圍。對開源模型生態來說,這會讓更多開發者用本地硬體測試 agent 工作流、長上下文程式碼修改與私有文件分析;但對生產系統而言,真正的基準仍應回到自己的 workload:固定 prompt 長度、context 深度、併發數、輸出長度與品質門檻,再測 TTFT、decode tok/s 與總吞吐。

出典

  1. Qwen/Qwen3.8-27B model card
  2. Qwen vLLM deployment documentation
  3. Qwen speed benchmark documentation
  4. Qwen3.8-27B at 160K context on a single RTX 4090
  5. unsloth/Qwen3.8-27B-GGUF discussion on RTX 4090 speed
  6. Qwen3.8 27B API pricing and benchmarks