AI coding agent
openJiuwen 統一單代理與 Swarm 執行語義,讓 coding harness 依診斷與目標動態調整
openJiuwen 將能力組合、子代理與多代理協作放進共用執行底座,再以 LSP 診斷、上下文管理及明確停止條件調整長任務。團隊報告兩項 coding agent 基準領先所選排行榜結果,但比較仍混合不同模型、工具與提示設定。

華為 openJiuwen 團隊公開長時程 coding agent harness 的系統論文,焦點不是再加一套固定工作流,而是讓單代理、委派子代理與 Swarm 共用相同執行語義。其 Rail 把工具、提示、上下文與控制能力依序組合,並以可見性閘門限制不同角色能取得的能力;Swarm Flow 則提供 `budget`、`parallel`、`compact`、`pipeline`、具狀態 `agent_session` 及人工介入等運算子,開發者可重組協作拓撲,毋須替每種代理架構另寫執行引擎。
執行期間,框架保持基礎模型策略不變,只調整模型可見的狀態。上下文管理會漸進壓縮歷史、移出大型產物並按需取回,也可利用 session affinity 協調 KV cache;Goal Mode 把結果分成繼續、完成與受阻,並另外套用次數、時間及資源上限,避免代理把「預算耗盡」誤報成任務成功。程式修改後,LSP 產生的型別與符號診斷會先排序、去重及限量,再自動送回下一輪。跨任務的 Self-Reflection 只寫入可檢索經驗庫,並未更新模型權重。
作者在 500 題 SWE-bench Verified 報告 82.6% Pass@1;Terminal-Bench 2.1 使用 GPT-5.6 Sol 得到 87.19%,使用 Fable 5 則為 84.04%。後者與同模型 Claude Code 的 83.8%較接近,顯示 harness 可能有增益,但差距只有 0.24 個百分點;不同提示、工具與實作仍未受控。論文也只與「所選」官方排行榜結果比較,尚未交代完整成本、token 用量及可重現執行映像。工程團隊應先觀察 benchmark 配方是否完整開放,以及 Rail 權限閘門能否轉化為真正的程序、檔案與網路隔離。