多模態模型
Gemini Omni 1.1 Flash 以十秒上下文延伸影片,4K 輸出實為升頻
Google 將對話式影片模型推進正式版,新增首尾幀插值、最長 40 秒場景延伸與四級解析度控制。新介面增加工作流程可控性,但 1080p、4K 均由升頻產生,複雜動作與文字一致性仍有限。

Google 於 8 月 27 日發布 `gemini-omni-1.1-flash`,把先前預覽中的對話式影片生成與編輯介面升為正式版本。模型透過 Interactions API 接收文字、圖像或最長十秒的影片,輸出三至十秒、24 FPS 的有聲影片;開發者可用 `previous_interaction_id` 延續先前生成結果,也可明確指定 `text_to_video`、`edit`、`extend` 等任務。
最具實作意義的變更是延伸時不再只參考輸入影片最後一秒,而會讀取末十秒的影像、動作、角色與音訊。每次可續寫十秒,累計上限 40 秒;系統可能修改輸入末端數幀以平滑接縫。因此,媒體管線若依賴原始幀雜湊、時間碼或逐幀審批,不能把延伸結果視為單純附加內容。
另一項新介面允許輸入首幀與尾幀,再由模型生成中間運鏡,適合軌道鏡頭、環繞及循環轉場。解析度參數支援 360p、720p、1080p、4K;360p 草稿相較預設 720p,Google 宣稱系統吞吐最高快 60%,成本約三分之一,讓產品可先批量探索構圖再挑選成品。不過 API 文件明確標示 1080p 與 4K 是升頻輸出,不能解讀為模型原生生成同等細節。
正式版也意味著遷移期限開始倒數:`gemini-omni-flash-preview` 預定 9 月 30 日停用,應用需更新模型名稱並回歸測試提示詞、輸出尺寸及內容安全流程。官方模型卡仍承認複雜動作、編輯後長程一致性與精確文字渲染是弱點;目前品質主張主要來自 Google 的內部人類偏好評測,尚缺公開、可重現的延伸漂移與音畫同步基準。