多模態模型與開發者平台
Gemini 將長影片理解改成工具迴圈,依問題動態選取片段與取樣率
Google 為三款 Gemini Flash 模型加入 agentic video processing,模型可按需載入畫面、音訊或逐字稿,而非預先以固定幀率處理整段影片。官方宣稱最多節省 88% token、降低 66% 成本,但短片的首 token 延遲及評測可重現性仍待檢驗。

Google 在 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 上線代理式影片理解,把影片輸入由一次性的固定取樣改造成模型控制的工具迴圈。傳統靜態模式預設以每秒一幀擷取畫面,再連同音訊放入上下文;新模式則讓模型依問題搜尋時間軸,選擇讀取逐字稿、音訊或特定畫面,並可針對高速動作重新提高幀率與解析度。
開發者可在 Gemini Interactions API 的影片內容中把 `processing` 設為 `agentic`。回應的 `steps` 會出現 `processing_call` 與 `processing_result`,分別記錄片段載入要求及結果。這不只是內部最佳化:在無狀態多輪工作流程中,應用程式必須把這些步驟連同先前回應送回,否則影片上下文會遺失;相關內容也會計入後續輸入 token。推理期間產生的導覽 token 記為 thought tokens,載入的媒體則歸入 tool-use tokens,因此成本追蹤系統需要分開觀察兩者。
Google 表示,長影片測試最多可減少 88% token、降低 66% 分析成本,品質最高提升約 7%;適用情境包括多小時影片搜尋、異常偵測、動作計數及次秒級事件定位。功能沿用標準 API token 定價,已支援上傳影片與公開 YouTube 網址。
工程上的取捨是代理迴圈會先規劃及呼叫工具,短於五分鐘的影片可能增加首 token 延遲;需要完整逐幀覆蓋的稽核工作也未必適合選擇性載入。官方僅公布「最高」改善值及部分 LongVideoBench 展示,尚未提供各模型、影片長度與查詢類型的完整明細。部署前應以實際影片分布比較靜態與代理模式的召回率、延遲、token 組成及漏看關鍵片段的風險。