返回首頁

多模態評測

視覺模型呼叫裁切工具不等於使用證據,六模型增益集中於少數有效軌跡

新研究以反事實裁切與觀察破壞測試視覺工具是否真正影響答案,發現部分模型只是「呼叫但不看」。六款模型在五項細粒度基準的整體增益,主要由少數校準良好的軌跡貢獻。

This file was contributed to Wikimedia Commons by National Archives at College Park - Still Pictures as part of a cooperation project. The donation was facilitated by the Digital Public Library of America. Record in source catalog DPLA ide… · Public domain · Image source
zh-Hant

多模態模型開始在推理途中主動裁切、放大圖片,但工具呼叫紀錄本身不能證明模型利用了回傳畫面。上海人工智慧實驗室等團隊提出 CauAudit,把視覺工具流程拆成工具動作、回傳觀察與最終答案三個節點,再於政策、完整軌跡及單一步驟三個層級進行因果介入。

政策層比較開啟工具與直接作答;軌跡層把每次回傳影像換成隨機裁切;步驟層則在固定先前推理的情況下替換單一觀察,計算 Visual Evidence Gain,檢查新畫面是否真的改變答案偏好。研究涵蓋 DeepEyes、Pixel Reasoner、Mini-o3、Qwen3-VL 4B/8B 與 Thyme,並使用五項細粒度視覺基準。

結果揭露兩種錯配。「Calling Without Looking」表示模型雖呼叫工具,觀察內容對答案幾乎沒有因果效果;「Looking Without Planning」則是畫面確實有用,但模型在已有答案後繼續裁切,或一路耗盡呼叫額度。以 V* 為例,Mini-o3 與 Qwen3-VL-8B 分別有 84.8% 與 59.2% 的軌跡撞上工具上限。研究把軌跡分成未呼叫、兩種失敗模式與 Calibrated 四組後,發現 Calibrated 是四款完整受測模型中唯一一致帶來正向增益的群組;Qwen3-VL-8B 的總增益為 6.9 個百分點,其中 7.6 點來自這一組,其餘群組合計反而抵銷部分收益。

這對代理訓練與評測的含意是:工程團隊不能只統計工具使用率或最終準確率,還要測試答案對工具回傳值是否敏感,並追蹤停止時機。作者推測只看最終結果的強化學習可能同時獎勵有效與儀式化呼叫,但尚未透過控制訓練實驗證實。論文雖稱已開源,GitHub 目前僅有 README 與授權檔,因此數據處理及介入流程仍待完整程式釋出後才能獨立重現。

來源

  1. The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
  2. CauAudit repository