多模態評測
影片模型在高頻多事件區僅答對 0.2%,增加取樣幀仍未找回事件證據
擴充版 Low Frequency Trap 以 2,190 段可程式化影片,把事件數量與頻率分開測量。Gemini 3.6 Flash 的彈球計數準確率隨取樣增加而上升,但時間戳序列 F1 反而只有 3.7%。

影片語言模型在綜合基準上得分不低,卻不一定能可靠記錄重複事件。馬里蘭大學團隊擴充 Low Frequency Trap,建立 2,190 段、每段 24 秒的合成影片,分別呈現彈球撞牆、短暫閃爍及持續狀態切換。事件數從 0 至 12,頻率從 0.5 至 4 Hz;渲染器同時輸出事件時間、前後狀態與累計數,使研究者能核對模型列出的每個事件,而不只檢查最終答案。
Gemini 3.6 Flash 在 80% 可靠度門檻下,可於 0.5 及 1 Hz 正確處理最多 12 次持續狀態轉換;面對短暫閃爍時,卻連最低的正事件數都沒有形成可靠區域。當事件數與頻率同時升高,最終計數準確率降至 0.2%,真實事件召回率為 18.1%。補充測試的 Qwen3‑VL‑235B 也呈現成績集中於低數量、低頻率區域,但兩款模型使用不同原生介面與取樣率,因此不能用圖表直接比較優劣。
更值得工程團隊注意的是,將彈球影片輸入由原生設定提高至 4 FPS,最終答案準確率由 19.6% 升至 29.3%,模型回報的事件序列與真值對齊 F1 卻只有 3.7%;以事件為中心挑選關鍵幀甚至可把答案準確率推至 68.6%,但相應軌跡 F1 仍僅 9.7%。這表示增加視覺證據可能讓模型猜中總數,未必代表它真的找到了正確事件。
對影片搜尋、監控及流程稽核系統而言,部署測試應同時記錄事件時間戳、召回率與「答案正確但證據不忠實」比例。研究目前主要依賴三種簡化動畫及 Gemini 單一主要模型,尚未隔離遮擋、鏡頭運動與不規則事件間隔;新版亦是早期工作坊研究的實質擴充,而非全新議題。