模型合併與多模態代理
AgentPatch 免訓練修補多模態代理合併,六項基準平均分由 54.5 升至 56.6
AgentPatch 先找出模型合併後的弱項,再只恢復專家模型的獨有殘差與關鍵 FFN 神經元。它輸出單一靜態 checkpoint,無需路由或推論期代理,但完整評測轉接器與模型權重仍未公開。

把搜尋、GUI 操作與視覺推理專家合成一個通用多模態代理,通常不是簡單平均權重即可完成:互動鏈較長的能力更容易被稀釋,少數決定成敗的動作一旦消失,整條軌跡便會失敗。8 月 7 日公開的 AgentPatch 將這個問題拆成「弱任務訊號流失」與「關鍵行為遺忘」,提出不需梯度訓練的兩階段修補流程。
系統先比較多個既有合併結果,選出相對穩定的 recipient checkpoint,並辨識其最弱任務。Weak-Task Unique Residual Recovery 接著找出弱任務專家相對其他專家獨有的參數更新,只把這部分殘差補回 recipient;第二階段的 Diagnoser–Guardian–Compiler 流程則從 recipient 與專家的代理軌跡擷取需要恢復及保護的行為片段,再依啟用值與輸出貢獻定位 FFN 神經元。Guardian 會排除支撐既有強項的神經元,降低修補一項能力時破壞另一項能力的風險。
作者在 MMSearch、FactualVQA、AndroidWorld、OSWorld、V*Bench 與 HR-Bench 8K 六項基準測試搜尋、桌面/手機操作及視覺處理。論文與儲存庫報告,AgentPatch 將 TSVM recipient 的整體平均分由 54.5 提至 56.6,也能套用於其他合併骨幹。部署端仍是一個靜態 checkpoint,不需要專家路由、ensemble 或額外分析代理,因此不增加相同類型的推論分支成本。
不過,目前 GitHub 只有核心修補算子、設定範例、輸入契約與 CPU 測試;完整 checkpoint 建構管線、benchmark adapters、軌跡、模型權重及可直接重播的評測命令仍標示為後續發布。工程團隊應先把它視為可檢查的演算法骨架,而非已完整重現的模型發行;下一步要觀察完整資產公開後,2.1 分平均增益能否在不同專家組合與隨機種子下維持。