ホームへ戻る

模型與開發者平台

Qwen3.8-Max-0902、長期稼働型コーディングエージェントを強化。ただし首位との差は依然として統計的誤差の範囲内

Alibaba CloudはQwen3.8-Maxのホステッドスナップショットを更新し、エンジニアリング規模のソフトウェア開発、複数ツールの連携、視覚理解を重点的に強化する一方、100万tokenのコンテキストを維持した。Code Arenaでは暫定首位に立つが、サンプル数が少なく順位区間も重複しているため、他のフラッグシップモデルを安定的に上回ったと証明するには不十分だ。

猫猫的日记本 · CC BY-SA 4.0 · Image source
zh-Hant

Alibaba Cloudは9月2日、`qwen3.8-max-0902`をリリースし、日付付きエイリアス`qwen3.8-max-2026-09-02`も提供した。これは次世代アーキテクチャでもオープンウェイトのリリースでもなく、既存のQwen3.8-Maxのホステッドスナップショットだ。[公式変更履歴](https://docs.qwencloud.com/changelog/models)によると、ポストトレーニングでは大規模ソフトウェアプロジェクト、長期間にわたる自律開発、協調型エージェントによる複数ツールのオーケストレーションに加え、チャート推論、文書解析、マルチモーダル認識に重点を置いている。

インターフェース面では、テキスト、画像、動画の入力とテキスト出力を引き続きサポートし、Thinking Mode、Function Calling、Structured Outputs、バッチ処理、Prefix Continuation、Context Cachingに対応する。モデルの総コンテキスト長は100万tokenだが、[製品ページ](https://www.qwencloud.com/models/qwen3.8-max-0902)には、より詳細な実効上限が記載されている。通常入力は991K、Thinking Modeでの入力は983K、出力は131Kで、reasoning tokenの上限は262Kだ。APIは、OpenAI SDK互換のDashScopeエンドポイント経由で呼び出せる。Code Interpreter、Web Search、Web Fetchなどの組み込みツールは、Responses APIの機能として記載されている。公開価格は、入力tokenが100万token当たり2ドル、出力tokenが同6ドルで、明示的なキャッシュ読み取りは同0.17ドルとなっている。

最も注目すべき証拠は、[Code Arena WebDevリーダーボード](https://arena.ai/leaderboard/code)にある。0902スナップショットは現在1691点で、旧版の1669点を約22点上回る。ただし、新モデルへの投票は約1,390票にとどまり、スコアには依然として「preliminary」と表示され、信頼区間は±19だ。2位のClaude Opus 5 Maxは1687±8で、両者の区間は大きく重複している。リーダーボードが示す予想順位も、いずれも1位から4位だ。これは、今回の更新がフロントエンド生成に対する人間の選好評価で好材料を示したことを意味する一方、バックエンドの正確性、テスト合格率、エージェントの信頼性、あるいはコスト調整後の総合的な生産性にまで直接一般化することはできない。

採用者は、予告のない更新によって出力が変化する可能性のある可変エイリアスを避け、日付付きモデルIDを固定すべきだ。そのうえで、自社のコードベースを使い、長期タスクの成功率、ツール呼び出しのエラー、Context Cachingのヒット率、総tokenコストを測定する必要がある。Alibaba Cloudは今回のポストトレーニングデータ、アーキテクチャ変更、標準的なエージェントベンチマーク、安全性評価をまだ公開していない。また、モデルは依然としてプロプライエタリなAPIであるため、再現性とベンダーロックインが引き続き主な制約となる。

出典

  1. Model releases: qwen3.8-max-0902
  2. Qwen3.8-Max-0902 model page
  3. Code Arena WebDev Leaderboard
  4. Alibaba upgrades Qwen3.8-Max with a new 0902 snapshot