返回首頁

多模態模型評測

2,190 段受控影片揭露 VLM 計數邊界:增加取樣幀仍無法保證事件軌跡正確

新研究以可執行時間軌跡稽核影片模型,而非只檢查最終計數。Gemini 3.6 Flash 在高事件量、高頻率區僅答對 0.2%,且只找回 18.1% 的真實事件。

Delta Wing Kites and Gliders Incorporated · CC0 · Image source
zh-Hant

影片語言模型答對「發生幾次」不代表它真的找到了那些事件。8 月 6 日公開的 [Low-Frequency Trap 研究](https://arxiv.org/abs/2608.06361) 以 2,190 段程式生成影片建立可控制的能力曲面,分別測試球體撞牆、短暫閃爍與持續顯示的狀態轉換。研究者獨立調整事件數量與頻率,並為每段影片保存可執行的真實時間軌跡,使模型回報的 timestamp 能逐項對齊,而不只比較最後的整數答案。

以 80% 正確率作為可靠邊界時,Gemini 3.6 Flash 對持續狀態轉換可在 0.5 與 1 Hz 下數到 12 次,對短暫閃爍卻沒有任何正事件數能形成連續可靠區域。三類任務的總體精確計數率只有 21.1%,時間軌跡 F1 為 36.4%;閃爍任務更降至 6.4% 與 18.6%。當事件數與頻率同時升高,只有 0.2% 的最終計數正確,模型回報的事件數約為實際值的 28%,timestamp recall 僅 18.1%。此時主要問題是漏掉或合併事件,而不是大量憑空新增事件。

提高取樣密度可把撞牆計數準確率由 19.6% 拉至 29.3%,但回報序列與真實軌跡完全一致的比例仍只有 3.7%;不同提示與推理格式也沒有穩定擴大可靠範圍。這一點直接影響 API 使用者,因為 [Google 的影片理解文件](https://ai.google.dev/gemini-api/docs/video-understanding) 指出 File API 預設只保存每秒一幀,快速動作可能遺失細節。單純增加影格會增加 token、延遲與成本,卻未必修復事件累積與時間保持能力。

對監控、運動分析或工業檢測系統而言,下一步應把事件 timestamp、順序與漏報率納入驗收,並針對實際頻率建立操作邊界。這些結果量測的是完整模型與輸入管線,受控場景也不能涵蓋真實影片的遮擋與壓縮,因此尚不能被解讀為所有影片模型的通用上限。

來源

  1. The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping
  2. Video understanding | Gemini API