開源模型與本地部署
Qwen3.8-27B 權重正式上架:27B 密集模型拿下 SWE-bench Pro 61.7,單機派等到真正的主菜
Qwen3.8-27B 已在 Hugging Face 開放 Apache 2.0 權重,官方分數顯示它不是 Max 旗艦的縮水註腳,而是面向本地部署與工程代理的主力型號。它在 SWE-bench Pro、LiveCodeBench v6、OSWorld-Verified 與 Vision2Web 都大幅高於 Qwen3.6-27B,但分數多來自官方與部分內部 benchmark,正式換上生產流程前仍要做自家 repo 驗證。

Qwen3.8-27B 終於從「下週開放」變成可以下載的模型。官方 Hugging Face 頁面標示 Apache 2.0,模型大小約 28B 參數、BF16 權重,架構是帶 vision encoder 的 causal language model;它原生支援 262,144 token context,並可透過長上下文技巧延伸到 1,000,000 token。這些規格讓它的位置很清楚:Qwen3.8-Max 是雲端旗艦,27B 則是給想握住權重、成本與資料邊界的人。
官方比分最亮的地方在軟體工程。Qwen3.8-27B 在 Terminal Bench 2.1 拿 73.0,SWE-bench Pro 61.7,NL2Repo-Bench 42.3,DeepSWE 1.1 達 42.2,QwenSWEBench 則是 79.0;對照 Qwen3.6-27B 的 63.4、53.5、36.2、13.3 與 49.3,這不像小改版。尤其 DeepSWE 與 QwenSWEBench 的躍升,說明 Qwen 團隊真正想補的是長流程 coding agent:讀 repo、跑終端、修錯、承受環境回饋,而不是只在單題解碼上刷分。
一般推理與代理任務也有可看之處。LiveCodeBench v6 為 90.3,高於 Qwen3.6-27B 的 83.9,也略高於表中 Opus4.6 Max 的 88.8;GPQA Diamond 是 89.2,HLE 30.8,IFBench 79.5。長工時工作流方面,CoWorkBench 70.7、JobBench 33.4、Agents' Last Exam Pass@1 20.4/Score 42.9,都比上一代 27B 明顯前進。這些數字共同指向一件事:27B 不再只是本地聊天模型,而是開始被定位成可承擔工具調用與多步驟工作的人力替代層。
多模態分數同樣值得注意。OSWorld-Verified 84.3、WebArena-Verified 64.8、AndroidWorld 81.9、RecreationBench 47.1、SWE-MM 38.6、Vision2Web 62.9;在 MathVision 上,官方列出 without CI 90.0、with CI 94.6,BabyVision 則從 without CI 65.7 到 with CI 85.6。這裡的「with CI」不是信賴區間,而是 benchmark 設定中的輔助條件;讀分數時不能把它和統計置信度混為一談。
中肯地說,這份 model card 讓 Qwen3.8-27B 很有吸引力,但還不到可以無腦替換所有本地模型。SWE-bench Pro、NL2Repo、DeepSWE 與 Vision2Web 多用 Claude Code harness 或 Qwen 內部 benchmark,部分基準還註明修正題目或由 GPT-4o / GPT-5.4 擔任 judge。這不代表分數不可信,而是提醒團隊:官方比分適合決定是否投入測試,不適合直接當成上線保證。最合理的用法,是把它放進自己的 repo 修復、終端任務、UI 重建、文件理解與長上下文工作流,跟現有 Qwen3.6-27B、GLM、Kimi 或閉源 API 做同題多輪比較。
如果說 Qwen3.8-Max 是告訴市場「Qwen 的天花板在哪裡」,Qwen3.8-27B 則更像夜裡亮起的一盞工作燈。它不是最大的模型,卻可能是最多工程團隊真正會摸到、量化、部署與微調的那一個。對本地 AI 使用者來說,今天的新聞不只是模型上架,而是 27B 這個甜蜜尺寸重新變得值得期待。