返回首頁

多模態評測

MeViS-Audio 冠軍方案以候選遮罩共識取代單一模型判斷

第八屆 LSVOS 的 MeViSv2-Audio 冠軍報告把語音轉寫、視覺定位、分割與目標存在判定拆成多階段流程,再以候選遮罩間的一致性選出軌跡。系統最終分數為 0.769589,但官方公開排行榜仍標示待公布,程式與完整消融資料亦未釋出。

Unknown authorUnknown author · Public domain · Image source
zh-Hant

MeViSv2-Audio 要求模型根據一段描述物體運動的語音,在整段影片逐幀輸出目標遮罩;若描述的物體不存在,系統還必須回傳空遮罩。這比一般文字提示分割多了語音辨識錯誤、運動語意、跨幀追蹤及「無目標」判斷四個耦合問題。新冠軍報告沒有訓練單一端到端巨型模型,而是先用 Qwen3-ASR 將語音轉成文字,再由多組互補的定位與分割模型產生候選遮罩軌跡。

關鍵設計是 agreement-based selection:系統不直接相信分數最高的單一候選,而是計算每條軌跡與其他候選的平均遮罩一致程度,選出最接近群體共識的一條。這相當於在沒有標註答案時,用不同模型的交集估計可靠度。對「左方」、「兩個」或複數物體等容易被一般追蹤器忽略的查詢,流程另加入方向、數量與單複數規則。最後,一個影片級分類器結合純視覺、影音及同片不同查詢的分數,決定究竟應輸出遮罩還是空結果。

報告列出的 `J&F` 為 0.5952,無目標準確率為 0.7931、存在目標準確率為 0.9205,綜合分數 0.769589;作者表示主辦方已通知其排名第一。技術上的啟示是,多模態代理未必需要所有模組共同訓練,候選共識、規則修正與明確的拒答閘門仍能在競賽資料上帶來優勢。不過官方網站目前的排行榜仍是 TBD,論文也未提供程式、推論成本、候選模型數量的完整消融或跨資料集驗證。下一步應觀察排行榜正式封存、程式公開後能否重現,以及共識機制在候選模型共享相同偏差時是否仍然可靠。

來源

  1. Agreement-Based Audio-Visual Segmentation: Champion Report for the MeViS-Audio Track
  2. Large-scale Video Object Segmentation:8th LSVOS Challenge
  3. Qwen3-ASR official repository