返回首頁

多模態代理與強化學習

FTF-bench 顯示多模態代理會犧牲必要條件,FTF-RL 改以分層獎勵訓練

研究者用購物、訂房與叫車介面測試代理能否先滿足必要條件,再最佳化偏好。FTF-RL 將輸出格式、答案正確性及條件分類納入獎勵,但作者承諾的程式與預訓練模型尚未真正公開。

Niels de Wit from Lunteren, The Netherlands · CC BY 2.0 · Image source
zh-Hant

「First Things First」研究鎖定一個常被一般指令遵循分數掩蓋的失敗:代理可能選出看似更理想的商品或路線,卻違反使用者不可妥協的條件。團隊建立 FTF-bench,收錄 3,649 組介面圖片與口語化需求,涵蓋電商、訂房、地圖及叫車;其中電商占 2,098 題、訂房 1,093 題、地圖與叫車 458 題,並由人工確認條件及答案。

題目分成三種決策結構。第一種只有一個候選項符合全部必要條件;第二種有多個合格候選項,代理才可依「最好具備」的偏好排序;第三種沒有任何候選項符合必要條件,正確行為是拒絕作答。這種設計把條件解析、可行性判斷與偏好最佳化拆開,能辨認模型究竟是看錯畫面、混淆條件優先級,還是在無解時硬選一項。

作者另提出 FTF-RL,在 Qwen2.5-VL 不同尺寸模型上訓練。獎勵函數同時檢查輸出格式、最終答案及每項要求被分類為必要或偏好是否正確,並鼓勵模型產生中間推理。論文報告三類情境的任務成功率均改善,且在 LogicVista、MathVision 與 InfoQA 等外部測試也有遷移效果;提供正確的條件標籤時,基礎模型表現亦明顯上升,支持瓶頸部分來自需求解析,而不只是視覺辨識。

對建置採購、旅遊或操作介面代理的團隊,這項結果意味著不能只用最終偏好分數驗收。測試集應明確包含無解案例,執行期也可先以結構化欄位分離硬限制與軟偏好,再禁止規劃器用後者補償前者。不過目前 GitHub 儲存庫只有說明文件,明載程式、文件及預訓練模型仍在準備;外界尚不能完整重現訓練或核對資料生成偏差,因此現階段應視為論文結果,而非已交付的訓練工具。

來源

  1. First Things First: Teaching LLM-Based Agents to Prioritize Must-Haves before Nice-to-Haves
  2. FTF-RL repository