返回首頁

代理模型與後訓練

NeoHorse-1 將代理執行軌跡回灌模型訓練,但「遞迴自我改進」仍只是單輪原型

NeoHorse-1 以路由器收集不同模型完成代理任務的軌跡,再用課程式 SFT 與線上蒸餾訓練 4B、9B 模型。官方綜合分數高於同尺寸 Qwen3.5 基線,但尚未證明多輪自我更新能持續增益或避免資料偏移。

Henry Bucklow/Lazy Photography (Sffubs) · CC BY-SA 3.0 · Image source
zh-Hant

TokenRhythm 於 9 月 8 日公開 NeoHorse-1 的 4B、9B 權重,並發布[技術報告](https://arxiv.org/abs/2609.08183)及[專案倉庫](https://github.com/TokenRhythm/NeoHorse)。兩款模型由 Qwen3.5 同尺寸版本後訓練而成,目標不是只提高對話分數,而是讓模型保留代理執行所需的工具呼叫、推理與 harness 上下文。權重採 Apache 2.0,另有 BF16、8 位、5 位及 4 位 GGUF,可經 vLLM、SGLang 或 llama.cpp 相容工具自行部署。

核心是 routing harness:系統先估計每個請求的能力需求,從異質模型池選擇服務層級,同時記錄選擇、工具互動及結果。軌跡經精確與近似去重、評測污染排除、結構驗證、六維語意評分,以及 Scene/Goal/Outcome 子場景標記後,才進入三階段課程式監督微調。相同路由訊號亦用於 on-policy distillation,由教師監督學生自己生成的回應;後續評測結果再決定下一批訓練資料的能力配比,形成「評估—選擇—更新」閉環。

團隊報告 4B 模型跨代理、工具使用、程式與指令遵循評測的宏平均由 58.94 升至 64.87,9B 則由 65.60 升至 69.04;4B 在 tau2-Bench 得 88.46、LiveCodeBench v6 得 59.43。這些數字顯示執行軌跡可成為有效後訓練資料,卻不足以支持強版本的「遞迴自我改進」:目前公開的是一次後訓練所得檢查點,尚無連續多代更新、成本曲線、能力退化或安全行為漂移實驗。工程團隊下一步應觀察路由器是否偏向昂貴教師、失敗軌跡如何進入資料集,以及閉環運行後能否在未見任務維持增益。

來源

  1. NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
  2. TokenRhythm/NeoHorse
  3. TokenRhythm/NeoHorse-1-4B