代理評測
TREK 以可執行規則驗證旅遊代理,最強模型完整可行率僅 46.2%
TREK 不再以 LLM 評審旅遊計畫,而是逐項驗證實體、預算、營業時間、交通與隱含需求。15 款代理中表現最佳者也只完整通過 46.2% 的可解任務,顯示局部正確仍難組成可執行行程。

7 月 29 日公開的 TREK,把旅遊規劃設計成可重現的工具代理評測,而不是讓另一個語言模型主觀判斷行程是否合理。基準包含 800 項多重限制任務,其中 533 項有解、267 項被構造成可證明無解;後者還附帶路線、實體或預算等型別化原因,要求代理在不能完成時正確拒絕,而非硬湊答案。
任務建立在一個完全合成且內部一致的知識庫上,收錄 375 個城市、13 種旅客 persona,以及 212,530 筆航班、旅館、景點與租車資料。代理不能直接查表,只能透過具結構化錯誤的 REST API 沙箱搜尋及提交計畫。評分器逐一檢查九個維度,包括指定實體、城市與預算、未明說的設施需求、資料庫中是否真有該項目、營業時間、逐日交通可達性,以及無解任務的拒絕原因;全部條件同時成立才算 task-perfect。
團隊測試 15 款 LLM 代理後,最強的 GPT-5.6 在可解任務上的完整通過率為 46.2%,中位數僅 6.6%,最低為零。隱含 persona 需求是所有模型的共同瓶頸。這個結果比單一「資訊是否正確」分數更接近實際部署:一份行程即使九成項目合理,只要航班不存在、轉場時間不可能或總價超支,對使用者仍是失敗交付物。
程式庫釋出了任務、知識庫、黃金答案、代理執行器與確定性評分器;800 份黃金答案可離線重算並全部取得 1.0,因此至少能證明評分上限可達。不過,合成價格與時刻表消除了真實網站的資料漂移、反爬限制及付款狀態,官方代理執行器也主要面向 Amazon Bedrock。現有結果仍由作者自行產生,GitHub 儲存庫發布時尚無外部採用訊號。下一步應觀察第三方能否重現排行榜,以及加入即時庫存、工具故障與跨語言需求後,模型排名是否仍然成立。