Back Home

最新模型

Qwen3.8-Omni-Flash 將百萬 token 音視訊理解接入工具呼叫,API 僅輸出文字

阿里巴巴推出接受文字、影像、音訊與影片的 Qwen3.8-Omni-Flash,並支援多聲道空間音訊。開發者可透過既有 API 串接工具與快取,但語音生成、素材處理成本及完整代理成功率仍須分別評估。

zh-Hant

阿里巴巴於 9 月 18 日推出 Qwen3.8-Omni-Flash,將文字、影像、音訊與影片輸入放進最高一百萬 token 的共同上下文。官方將它定位為音視訊代理模型,延伸至素材分析、剪輯規劃與工具操作,並在發布紀錄中列出雙聲道、四聲道空間音訊理解及相容 API。[發布紀錄](https://docs.qwencloud.com/changelog/models)

開發者可透過 Chat Completions 或 Responses 呼叫模型,使用自訂函式、網頁搜尋與預設開啟的推理模式。文件同時列出自動隱式快取與 Responses 工作階段快取。依這些介面設計,工程上的機會是讓代理讀取原始音視訊後直接產生下一步工具參數,減少必須先把素材全部轉成純文字的中介步驟;實際是否提高準確率,仍須以應用資料驗證。[模型文件](https://www.alibabacloud.com/help/en/model-studio/qwen3-8-omni-flash)

最容易誤讀的邊界是輸出模態:目前服務只回傳文字。官方範例明確設定文字輸出,語音生成則導向 Qwen3.5-Omni。因此,影片製作或音樂影片等使用情境,應理解為模型分析內容並配合外部工具完成流程,不能直接等同模型本身輸出音檔或成片。[呼叫指南](https://www.alibabacloud.com/help/en/model-studio/qwen-omni)

長上下文也有實際配額限制。文件列出的非推理與推理模式最大輸入分別為 991,808 與 983,616 token,最大輸出為 131,072 token;一百萬上下文並非全部都能拿來塞入素材。使用空間音訊時,Chat Completions 另需啟用多聲道參數,既有將音軌混成單聲道的前處理管線應重新檢查。[輸入限制](https://www.alibabacloud.com/help/en/model-studio/qwen3-8-omni-flash)

QwenCloud 模型頁目前標示每百萬輸入 token 為 0.15 美元、輸出為 0.47 美元,但這些單價不能直接換算成每小時影片的總成本,還必須量測素材編碼後的 token 數、推理輸出與工具重試。[模型頁](https://www.qwencloud.com/models/qwen3.8-omni-flash) 對中文應用團隊,下一步應測試多人重疊語音、方言、字幕與畫面矛盾,以及長片跨段事件追蹤;發布規格能確認介面可用,尚不足以保證正式工作流的完成率。

評測也應把內容辨識、工具參數正確率與整段任務成功率分開記錄,並測量快取未命中及長輸入時的首 token 延遲,避免平均摘要品質掩蓋代理執行階段的失敗。

Sources

  1. Model releases — September 18, 2026
  2. qwen3.8-omni-flash Model Info(9 月 18 日更新)
  3. Qwen-Omni 呼叫指南(9 月 18 日更新)
  4. Qwen3.8-Omni-Flash 模型規格與價格