多模態模型
Gemini Omni 1.1 Flash 以十秒上下文延伸影片,並加入首尾影格控制
Google 將 Gemini Omni 1.1 Flash 推為穩定 API,場景延伸可讀取先前十秒內容,並逐段生成最長四十秒的影片。新版亦支援首尾關鍵影格、360p 草稿與 4K 輸出,但公開品質數據仍以 Google 自有評測為主。

Google 發布穩定版 `gemini-omni-1.1-flash`,把影片生成與對話式編輯放進同一個 Interactions API。最實質的改動是場景延伸:前版主要參考原片最後一秒,新版可分析最多十秒既有內容,再以十秒為單位延伸,累計影片長度上限為四十秒。應用程式可傳入 `previous_interaction_id` 延續先前生成狀態,而非每輪重新描述整個場景,這對角色外觀、運鏡與敘事連續性尤其重要。
模型亦接受指定的第一與最後影格,在兩者之間生成連續鏡頭,可用於環繞、推拉、轉場或循環影片。API 單次輸出為 3 至 10 秒、24 FPS,解析度涵蓋 360p、720p、1080p 與 4K;360p 草稿的官方系統吞吐量最高比 720p 快 60%,成本約為三分之一,適合先產生多個 storyboard 變體,再放大選定結果。開發者還能加入最長三秒的參考影片,借用動作或維持角色一致性。舊的 `gemini-omni-flash-preview` endpoint 預定於 9 月 30 日停用,現有整合需改用穩定模型識別碼。
這次更新的技術價值在於把生成影片從單次 prompt 轉向可保存狀態、可指定邊界條件的工作流程,產品可以把草稿、審核、延伸與升頻拆成不同成本層級。不過「production-ready」不等於已解決長程一致性:四十秒內容仍由多次生成拼接,錯誤可能逐段累積;4K 是升頻輸出,也不能證明原生細節或物理正確性。Google 的比較主要採內部提示集與人類偏好評分,尚缺第三方針對接縫、角色漂移、語音同步及多輪可重現性的系統評測。