生成模型評測
Open-EA 將視覺生成評測代理縮至 3B,但目前只完整支援 VBench 影片流程
Open-EA 把多輪視覺模型評測軌跡整理成 10,042 筆監督資料,將原本依賴 GPT-4o 的規劃流程移植至本機 EA-3B。模型、資料建構與 runtime 已公開,但「評測時間降至傳統方法 10%」主要來自原始 API 代理,不能直接視為 EA-3B 的普遍效率保證。

新公開的 Open Evaluation Agent(Open-EA)試圖把圖片與影片生成模型的評測,從固定提示集加單一總分,改成可用自然語言指定目標的多輪代理。系統先把「主體一致性如何」等問題拆成子面向,再挑選針對性提示、呼叫生成模型與 VBench 等工具,根據中間結果決定下一輪要測甚麼,最後輸出帶有觀察依據的摘要。
這次相對於 ACL 2025 版 Evaluation Agent 的主要更新,是移除規劃階段對 GPT-4o 的必要依賴。團隊從既有多輪 rollout 建立 EA-CoT-10K:核心共有 10,042 筆帶歷史上下文的記錄,包括 7,494 筆工具決策與 2,548 筆摘要,覆蓋 VBench 的 15 種影片評測工具。研究者再以這批資料對 Qwen2.5-3B-Instruct 做全參數監督微調,得到本機規劃器 EA-3B;另有 986 筆圖像資料,但未用於目前的 EA-3B 訓練。
工程上,公開 runtime 使用兩個 OpenAI-compatible 本機端點:EA-3B 負責規劃,另一個 Qwen2.5-3B-Instruct 負責從工具提示表選題;生成器與 VBench 又是額外工作負載。官方範例通常為兩個端點各配置一張 GPU,再以第三張執行待測影片模型。端點預設只綁定 `127.0.0.1`,因其沒有驗證機制,若改為對外監聽必須自行加入網路隔離與認證。
論文稱原始 Evaluation Agent 只需傳統流程約 10% 的評測時間即可取得可比結果;然而 Open-EA 的新增實驗重點是四個訓練分布內、三個分布外影片生成器之間的政策轉移,而且只呈現「部分」跨家族泛化。目前本機版完整範圍仍限於 VBench 文字生成影片,圖像開放式評測與 T2I-CompBench 仍走 GPT-4o 路徑。下一步應檢查 EA-3B 是否會因主動選樣而漏掉低頻失敗,以及不同規劃器是否能在固定生成預算下維持排序一致性。