代理訓練與醫療 AI
BaT 按代理失敗階段安排強化學習,9B 策略的 AutoMedBench-Lite 得分由 19.9 升至 53.4
Benchmark-as-Teacher 把評測中的階段分數直接轉成下一輪訓練課程,並以隔離合成資料避免把測試答案帶入更新。論文報告 9B 策略明顯優於一般 GRPO,但完整訓練資料尚未釋出,跨系統排名亦混合了不同執行框架。

醫療研究代理通常要依序規劃、配置工具、驗證資料、執行推論及提交成果;若整條軌跡只收到一個終局獎勵,模型很難知道應補強哪一步。Benchmark-as-Teacher(BaT)把這類結構化評測改造成訓練控制器:固定的保留測試先量出各階段弱點,外層 BiCuRL 課程再選擇下一輪目標,內層則以 GRPO 更新策略,候選 checkpoint 只有通過重測才會保留。
訓練資料由非同步 Stage Bank 供應。團隊建立 20,299 個可按 rubric 評分的候選狀態,分成弱點導向的 S-target、其餘階段的 S-mix,以及完整流程代理的 E2E;任務身分、答案、路徑、報告及原始軌跡不能穿越評測邊界。每輪亦記錄資料混合、獎勵版本與 checkpoint,讓退步時可以回退。這比單純增加 rollout 更接近針對軟體流程缺陷安排課程。
在七種 AutoMedBench-Lite 任務、每種重跑十次的設定下,Qwen3.5-4B 的 Overall 由 6.1 升至 22.9,9B 則由 19.9 升至 53.4;同一 9B 的終局獎勵 GRPO 為 31.9。完整 BaT-9B Agent 配合固定 OpenHands 環境後得到 79.6,但這個數字屬系統級比較,不能與裸策略得分直接互換。
工程師目前可檢查 MIT 授權程式碼、VeRL/Slime 訓練及 vLLM/SGLang 推論介面。不過倉庫剛建立,完整訓練資料、合成提示與 leakage checker 仍標示為後續釋出;論文比較的模型亦使用不同代理外殼。下一步應觀察資料能否完整重建、固定等算力消融是否維持升幅,以及按評測弱點反覆訓練會否逐漸過度配合 scorer。