返回首頁

模型與開發者平台

Qwen3.8-Max-0902 強化長週期程式代理,但榜首差距仍在統計誤差內

阿里雲更新 Qwen3.8-Max 的託管快照,主攻工程級程式開發、多工具協作及視覺理解,並保留百萬 token 上下文。Code Arena 暫列第一,但樣本較少且排名區間重疊,尚不足以證明穩定超越其他旗艦模型。

猫猫的日记本 · CC BY-SA 4.0 · Image source
zh-Hant

阿里雲 9 月 2 日推出 `qwen3.8-max-0902`,另提供日期化別名 `qwen3.8-max-2026-09-02`。這不是新一代架構或開放權重發布,而是既有 Qwen3.8-Max 的託管快照;[官方更新紀錄](https://docs.qwencloud.com/changelog/models)稱後訓練重點放在大型程式專案、長週期自主開發、協作代理的多工具編排,以及圖表推理、文件解析與多模態感知。

介面層維持文字、圖片與影片輸入、文字輸出,支援思考模式、函式呼叫、結構化輸出、批次處理、前綴續寫及上下文快取。模型總上下文為 100 萬 token,但[產品頁](https://www.qwencloud.com/models/qwen3.8-max-0902)列出的實際上限更細:一般輸入 991K、思考模式輸入 983K、輸出 131K,推理 token 上限為 262K。API 可透過相容 OpenAI SDK 的 DashScope 端點呼叫;程式解譯器、網頁搜尋及擷取等內建工具則標示為 Responses API 能力。公開價格為每百萬輸入、輸出 token 分別 2、6 美元,明確快取讀取為 0.17 美元。

最醒目的證據來自 [Code Arena WebDev 榜單](https://arena.ai/leaderboard/code):0902 快照目前為 1691 分,較舊版的 1669 分高約 22 分。不過新模型只有約 1,390 票,分數仍標為 preliminary,信賴區間為正負 19;第二名 Claude Opus 5 Max 為 1687 正負 8,兩者區間大幅重疊,榜單給出的可能名次也同為第一至第四。這代表更新在前端生成的人類偏好評測中呈現正向訊號,卻不能直接推論到後端正確性、測試通過率、代理可靠度或成本調整後的整體生產力。

採用者應固定日期化模型 ID,避免浮動別名在無預警更新後改變輸出;再以自家程式庫測量長任務成功率、工具呼叫錯誤、上下文快取命中率及總 token 成本。阿里雲尚未公開此次後訓練資料、架構變更、標準代理基準或安全評測,且模型仍是專有 API,因此可重現性與供應商鎖定仍是主要限制。

來源

  1. Model releases: qwen3.8-max-0902
  2. Qwen3.8-Max-0902 model page
  3. Code Arena WebDev Leaderboard
  4. Alibaba upgrades Qwen3.8-Max with a new 0902 snapshot