返回首頁

生成式影片

Wan3.0 正式上線:單次生成 30 秒有聲影片,文件與網頁亦可直接作輸入

阿里巴巴把 8 月初邀測的 Wan3.0 正式推向市場,統一支援文字、圖片、影音、文件及網頁參考。API 已公開,但模型仍標為邀測,權重、架構與獨立評測均未發布。

Fooksou Lamimo · CC BY-SA 4.0 · Image source
zh-Hant

阿里巴巴於 8 月 24 日正式推出影片生成模型 Wan3.0,接續 8 月 6 日開始的公開測試。它把文生影片、首幀或首尾幀生成、參考素材生成收進同一個 `wan3.0-video` API,最高輸出 1080P、單次最長 30 秒,並可同步產生音訊。與以往主要接收提示詞及媒體素材的流程相比,新版可直接讀取 DOC、XLS、PPT、PDF、Markdown、Apple Pages、Numbers 等文件,亦能解析毋須登入的公開網頁;每次限一份文件或連結,檔案不得超過 100MB,部分格式最多 50 頁。

工程介面採非同步工作模式:用戶先向北京或新加坡端點提交任務,再以有效期 24 小時的 `task_id` 輪詢結果;模型、API key 與端點必須屬於同一地域。官方表示一般生成需時約一至五分鐘。北京區定價按輸出秒數計算,480P、720P、1080P 分別為人民幣 0.3、0.6、1.2 元;完整 30 秒 1080P 影片原價即為 36 元。對內容管線而言,真正的新意不是單純延長片段,而是模型可把簡報結構、試算表資料或網頁內容轉成分鏡、圖表動畫及旁白,減少前置抽取與人工改寫步驟。

不過,「正式上線」不等於開放模型。官方目錄仍把服務標成邀測,Wan 官方 GitHub 與 Hugging Face 組織也未提供 3.0 權重、推論程式或授權;架構、訓練資料與可重現基準同樣欠奉。人物一致性、微表情及物件穩定性的改善目前主要來自供應商展示,阿里亦承認音訊質感與畫面文字準確率仍需改進。開發者下一步應觀察一般可用性、實際排隊延遲、文件解析錯誤率,以及長達 30 秒時身分和場景漂移是否真的受到控制。

來源

  1. Alibaba launches Wan3.0 AI video model after $10 billion share sale
  2. Wan3.0: 30-Second AI Video Generation from Any Input
  3. 萬相3.0-影片生成 API 參考