代理系統
MANTA 在推論途中重組多代理拓撲,五項基準平均提高 5.8 點
MANTA 依任務建立代理通訊圖,再從執行軌跡偵測協作異常並有限度改寫角色、連線與驗證順序。以 Gemma 4 31B 測試時,其五項基準平均得分達 74.0,但實驗樣本與重複次數仍偏少。

多代理系統通常在部署前固定角色與通訊流程;新提出的 MANTA 則把拓撲本身納入推論期控制。系統先由 Topology Planner 依題目及跨任務 playbook 選擇代理數量、角色、群組和資訊可見範圍,再執行一輪協作。Trace Auditor 不直接判斷答案正誤,而是檢查工具失敗、證據未驗證、過早共識、分支過載或重複操作等可觀察異常;若風險足夠高,控制器允許一次受限重組,例如增加驗證者、改變連線、調整執行次序或擴充分支。
這套設計的工程重點是以確定性程式驗證拓撲、限制代理預算、去除重複工具呼叫,並以 append-only ledger 保存證據。長期 playbook 只讀取流程訊號,不取得基準答案,因此理論上可跨任務累積組織經驗而不更新模型權重。
研究以 Gemma 4 31B 在 BrowseComp、StableToolBench、PlanCraft、WorkBench及 MATH 各抽取 30 題、重複三次。MANTA 平均得分 74.0,較次佳 ADAS 的 68.2 高 5.8 點;但在 WorkBench 只有 43.3,低於 ADAS 的 66.7。消融實驗中,完整系統四項平均成功率為 71.7%,移除初始拓撲規劃後降至 57.5%,停用途中重組則降至 60.8%,顯示主要收益並非只來自增加代理。
限制同樣明顯:完整 MANTA 每次平均使用約十萬 token,所謂「多代理中最省」仍不代表部署便宜;評測題量不大,而且使用單一基礎模型。論文也未附官方程式庫。下一步應觀察拓撲決策能否在不同模型、真實工具故障及更長工作流上重現,以及流程審核器誤判時會否把原本可行的協作結構改壞。