Agent frameworks
TrueForge 開源代理執行框架,14 項企業任務成本宣稱較受管服務低 30% 至 75%
TrueFoundry 以 MIT 授權釋出 TrueForge,將代理迴圈、MCP 工具、按需沙盒、子代理及核准流程組成可自行託管的執行框架。官方在 Enterprise-Bench 報告相同模型可節省約 30%,改用 GLM-5.2 則節省約 75%,但比較僅涵蓋 14 項任務。

TrueFoundry 開源 TrueForge,定位為不綁定模型供應商的通用代理 harness。它不只封裝一次模型呼叫,而是負責反覆執行「規劃、選擇工具、執行、回傳結果」迴圈,並處理串流輸出、長任務上下文壓縮、子代理、人工核准及跨重新連線保存工作階段。專案採 MIT 授權,可用 `npx @truefoundry/trueforge` 在本機啟動,也提供 Docker Compose、Kubernetes、SDK 與可嵌入的聊天 UI。
架構上的主要差異是把沙盒視為工具,而非每次對話固定配置的常駐資源。只有代理需要執行程式或操作檔案時才建立沙盒,因此查詢、規劃等純模型回合毋須承擔相同的運算成本。框架亦可透過 MCP 接入外部工具,敏感操作先暫停等待核准;持久化狀態則讓前端斷線或伺服器重啟後繼續既有任務。這些元件可分別替換,企業因而能自行選擇模型、工具、隔離環境及閘道。
TrueFoundry 以 DevRev Enterprise-Bench 的 14 項 CRM、工單與文件管理任務比較 TrueForge 和 Claude Managed Agents。據其公開結果,TrueForge 搭配 GLM-5.2 完成 14 題中的 11 題,成本約 2.90 美元;Claude Managed Agents 搭配 Claude Opus 4.8 達到相同完成數,成本約 11.80 美元。兩邊都使用 Opus 4.8 時,TrueForge 的成本仍低約 30%。官方將差距歸因於工具篩選、上下文管理及按需資源配置,而非單純模型價格。
這項結果尚不足以證明所有工作負載都能等比例省錢:樣本只有 14 題,報告由供應商自行執行,且跨模型比較同時改變了模型與 harness。工程團隊應重跑自己的工具組合,分開量測模型 token、沙盒啟動、工具延遲與失敗重試成本,並檢查核准狀態、子代理權限及持久化資料是否真的能在多租戶環境隔離。