AI 代理與評測
Thinkingbox 以後端狀態驗證 507 個企業流程,最佳代理連續 20 次全對僅 25.25%
微軟開源 Thinkingbox,以隔離的 MCP 工具環境及可執行斷言檢查代理是否真正完成工作,而非只看回覆或工具呼叫是否合法。最佳系統單次成功率達 65.36%,但要求同一任務連續成功 20 次時只剩 25.25%。

微軟研究團隊發布 [Thinkingbox](https://github.com/microsoft/thinkingbox) 與 Thinkingbox-bench,將代理評測的焦點由「是否產生合理回覆」移到資料庫、檔案及業務系統最後是否進入正確狀態。框架透過常駐的 MCP Session Proxy,為每段對話啟動隔離工具伺服器、載入初始狀態,並在代理結束後擷取所有副作用;測試可以拒絕漏做、做錯或額外執行的動作。
[論文](https://arxiv.org/abs/2608.19741)建立 507 個受政策約束的工作流程,涵蓋零售、旅宿、汽車保險、數位銀行內部 IT,以及顧問公司的 IT、HR 支援。任務要求代理在多輪對話中補問資料、遵循規則並協調相依工具。當中 477 題主要以終端後端狀態判定,另有 30 題使用回覆 rubric;作者發現不少失敗軌跡仍會正常結束,也確實執行了有效的狀態變更,顯示只監控格式正確率會漏掉實質錯誤。
多款封閉與開放權重模型中,最佳系統的 pass@1 為 65.36%,但 pass^20——同一任務 20 次全部成功——只有 25.25%。這個落差對會退款、改帳戶或寄信的企業代理尤其重要:偶爾成功不能代表可部署的可靠度。MIT 授權框架亦可用於產生離線軌跡或接入強化學習迴圈,並支援 OpenAI 相容端點、Azure OpenAI 與 Anthropic。
限制是任務由未公開來源重建,不能視為真實企業流量分布;每題只有一個黃金終態,也排除了多種處理方式都合理的案例。使用者模擬器固定為 GPT-5.4-mini,30 題的語言評分亦由它負責;目前實作只正式測試 Linux。因此下一步應觀察獨立團隊能否加入自有 MCP 系統、多人或非唯一終態流程,並重現可靠度衰減。