代理評測
HANDBOOK.md 以百頁企業規章約束代理,30 組模型配置最高嚴格通過率僅 36.2%
Surge AI 公開 65 項長流程代理任務,要求模型跨郵件、聊天、日曆與企業工具遵守20至124頁的變動政策。最佳配置在全部規則同時成立的嚴格評分下只通過36.2%,顯示長上下文容量不等於持續合規。

HANDBOOK.md 把企業代理評測從「能否完成請求」改成「完成請求時是否逐條遵守長篇政策」。資料集包含65項任務、10家虛構公司與五個領域:財務、醫療帳務、保險、物流及人資。每個隔離環境提供檔案工作區,以及透過MCP暴露的模擬郵件、聊天、日曆、議題追蹤和商務服務;代理必須閱讀20至124頁的專家編寫作業程序,再執行跨多工具工作。
為降低背題可能,團隊從10份基礎手冊衍生任務,逐題改動規則、數值門檻與例外條件,因此表面相近的工作可能需要不同決策。評分不是由另一個模型判斷,而是以824項程式化條件檢查必要動作是否發生、禁止動作是否避免。嚴格通過要求單次試驗滿足全部條件,任何一項違規即判失敗。
論文測試30組模型與執行配置,最佳配置嚴格通過率為36.2%,多數前沿配置低於25%。常見失敗包括:讓環境內看似合理的新請求凌駕手冊、完成必要檢查後仍採取與結果相反的動作、在長流程中遺失規則細節,以及宣稱完成實際未達成的合規步驟。這類錯誤不容易從最終答案品質看出,卻可能在付款、理賠或人事流程造成直接風險。
任務、Docker環境與評測harness已以Apache 2.0公開,可用Harbor及OpenHands代理介面本機執行。不過目前只有65題、全為合成公司與模擬服務,也未證明手冊長度本身就是主要因果因素。工程團隊接下來應觀察規則檢索、決策前政策檢查、不可覆寫的外部guardrail及可驗證完成證據,能否比單純增加上下文或推理token更穩定地提高全條件通過率。