開源模型與本地部署
Qwen3.8-27Bの重みが正式公開:27B密モデルがSWE-bench Proで61.7を達成、ローカル派待望の本命が登場
Qwen3.8-27BのApache 2.0ライセンスの重みがHugging Faceで公開された。公式スコアが示すのは、同モデルがMaxフラッグシップの単なる縮小版ではなく、ローカルデプロイとエンジニアリングエージェント向けの主力モデルだということだ。SWE-bench Pro、LiveCodeBench v6、OSWorld-Verified、Vision2WebではQwen3.6-27Bを大幅に上回る。ただし、スコアの多くは公式または一部社内benchmarkに基づくため、本番ワークフローへ正式導入する前に、自社repoで検証する必要がある。

Qwen3.8-27Bがついに「来週公開」から、実際にダウンロードできるモデルになった。公式Hugging FaceページではApache 2.0と明記され、モデル規模は約28B parameters、重みはBF16、アーキテクチャはvision encoderを備えたcausal language modelとなっている。262,144 tokenのcontextをネイティブにサポートし、長context向けの手法によって1,000,000 tokenまで拡張できる。こうした仕様から、その位置付けは明快だ。Qwen3.8-Maxがクラウド向けフラッグシップである一方、27Bは重み、コスト、データ境界を自ら管理したいユーザーのためのモデルである。
公式スコアで最も目を引くのは、ソフトウェアエンジニアリング分野だ。Qwen3.8-27BはTerminal Bench 2.1で73.0、SWE-bench Proで61.7、NL2Repo-Benchで42.3、DeepSWE 1.1で42.2、QwenSWEBenchで79.0を記録した。Qwen3.6-27Bのスコアは、それぞれ63.4、53.5、36.2、13.3、49.3であり、これはマイナーアップデートと呼べる差ではない。とりわけDeepSWEとQwenSWEBenchでの飛躍は、Qwenチームが本当に強化しようとしているのが長い工程をこなすcoding agentであることを示している。つまり、単一問題のdecodingでスコアを稼ぐだけでなく、repoを読み、terminalを操作し、エラーを修正し、環境からのfeedbackに対応する能力だ。
一般的なreasoningとagentタスクにも注目すべき結果がある。LiveCodeBench v6は90.3で、Qwen3.6-27Bの83.9を上回り、表に掲載されたOpus4.6 Maxの88.8もわずかに超えている。GPQA Diamondは89.2、HLEは30.8、IFBenchは79.5だった。長時間ワークフローでは、CoWorkBenchが70.7、JobBenchが33.4、Agents' Last ExamがPass@1で20.4、Scoreで42.9となり、いずれも前世代の27Bから明確に前進している。これらの数値が共通して示すのは、27Bがもはや単なるローカルchat modelではなく、tool callingや複数stepの作業を担える人間の労働を代替するレイヤーとして位置付けられ始めたということだ。
multimodalのスコアも同様に注目に値する。OSWorld-Verifiedは84.3、WebArena-Verifiedは64.8、AndroidWorldは81.9、RecreationBenchは47.1、SWE-MMは38.6、Vision2Webは62.9だった。MathVisionについて、公式はwithout CIで90.0、with CIで94.6と記載している。BabyVisionはwithout CIの65.7からwith CIの85.6まで向上した。ここでいう「with CI」はconfidence intervalではなく、benchmark設定における補助条件を意味する。スコアを読む際、統計的な信頼区間と混同してはならない。
率直に言えば、このmodel cardによってQwen3.8-27Bは非常に魅力的に映るものの、あらゆるローカルモデルを無条件で置き換えられる段階には至っていない。SWE-bench Pro、NL2Repo、DeepSWE、Vision2Webでは、Claude Code harnessまたはQwenの社内benchmarkが多く使用されている。一部のbenchmarkには、問題を修正したことや、GPT-4o/GPT-5.4をjudgeとして使用したことも明記されている。これはスコアが信頼できないという意味ではない。チームに対し、公式スコアはテストへ投資するかどうかを判断する材料には適しているが、そのまま本番投入の保証にはならないと注意を促すものだ。最も合理的な使い方は、自社のrepo修復、terminalタスク、UI再構築、文書理解、長contextワークフローへ組み込み、既存のQwen3.6-27B、GLM、Kimi、またはクローズドソースAPIと、同一課題で複数roundの比較を行うことだ。
Qwen3.8-Maxが市場に「Qwenの上限はどこにあるのか」を示すモデルだとすれば、Qwen3.8-27Bは夜にともる作業灯のような存在だ。最大のモデルではないが、最も多くのエンジニアリングチームが実際に触れ、quantizationし、デプロイし、fine-tuningするモデルになる可能性がある。ローカルAIユーザーにとって、今日のニュースは単にモデルが公開されたというだけではない。27Bというスイートスポットのサイズが、再び期待に値するものになったということだ。