AI 程式開發工具
GitHub HydraFusion 在 Copilot 執行期編排多模型,成本下降但品質未全面勝出
HydraFusion 會依任務選擇單模型、逐級升級或跨模型審查,而非讓同一模型完成所有步驟。GitHub 的離線測試顯示三項基準成本均下降,但只有 TerminalBench 2.1 同時提高品質。

GitHub 將 Project HydraFusion 以研究預覽形式加入 Copilot CLI,把「選哪個模型」提升為整段工作流的執行期決策。使用者只需選擇 HydraFusion,系統便依推理、程式生成、除錯及工具使用等能力訊號,在三種模式間路由:`Single` 由一個模型直接完成;`Cascade` 先讓較便宜的模型起草,再由品質閘門決定是否升級;`Critique` 則交由另一模型家族的唯讀模型審查,原模型再修訂一次。
這套設計的工程重點不只是路由器。GitHub 會合計草稿、審查、重試、升級與備援的全部用量,為每一段設定逾時及取消規則;審查模型在沒有工具的隔離環境執行,求解模型才可進入具權限控制的共享工作區。若驗證失敗或流程取消,系統不套用任何修補,並記錄各步驟角色、成本、延遲與診斷資料。
相較 Claude Opus 5,最佳調校配置在 TerminalBench 2.1 的已驗證任務品質提高 4.9 個百分點,估算成本降低 67%。然而 DeepSWE 的成本雖降低 36%,品質也下降 1.5 點;內部 CheckpointBench 則省 65%,品質低 0.1 點。這表示成果較接近可調整的品質—成本交換,而非多模型必然更準。
工程團隊仍應關注實際延遲、路由可觀測性及模型更新後的策略漂移。測試結果來自固定模型池與離線評測,CheckpointBench 也未公開;GitHub目前更建議先用於範圍清楚的單回合任務,長時間、多回合開發流程仍待驗證。