AI evaluation
EvolvingIntent 把靜態基準改寫成需求會變動的對話,揭露代理追蹤修正指令的落差
Microsoft Research 提出 EvolvingIntent,把既有數學、SQL、搜尋及程式任務拆成逐步揭露、修訂或轉向的多輪對話。實驗顯示,模型在單輪基準的能力無法穩定轉移到需求持續變動的情境,相關資料建構與評測程式已公開。

Microsoft Research 研究者於 7 月 22 日提交 EvolvingIntent,針對一個常被靜態基準忽略的代理失敗模式:使用者在執行過程中補充條件、撤回舊值,甚至把問題改成另一項任務時,模型能否以最新意圖完成工作,而不是延續早先建立的計畫。
框架不另造一批只能人工評分的對話題,而是先把既有樣本分解為主要 function、必要 arguments 與標準答案,再為參數產生反事實值,並建立相關但不同的 predecessor function。模擬器據此安排多輪互動,形成四類情境:只逐步揭露參數、在中途修訂參數、切換主要任務,以及三者混合。最後仍沿用原始基準的執行式或正確答案評分,因此可把分數下降較直接地歸因於意圖變動,而非換了一套評測規則。
公開實作目前涵蓋 GSM8K、BIRD-SQL、BrowseComp+ 與 SWE-bench Verified,橫跨算術、文字轉 SQL、代理搜尋及儲存庫修復。團隊報告指出,多個模型系列即使在完整、單輪提示下表現強勁,經過少數意圖轉換後仍會明顯退化。這對程式代理尤其重要:若使用者先要求修正缺陷、稍後限制不得更動 API,代理不能只把新句子附加到原計畫,而必須重新判定哪些假設、工具結果及待辦事項已失效。
程式庫提供確定性的 eval 模式、可隨機取樣的 train 模式,以及把結構化回合改寫得較自然的 naturalizer;模型呼叫則透過 OpenAI Python SDK 連接 OpenAI 或 Azure OpenAI。這也構成主要限制:部分對話與反事實資料由模型合成,自然度及難度可能受生成模型影響;目前涵蓋的任務仍不足以代表含模糊偏好、多人協作或長時間外部狀態變化的真實工作。
開發者可把此框架加入代理回歸測試,另外記錄「最後採用哪一版需求」及變更後是否撤銷舊工具動作。後續值得觀察的是資料與完整結果能否由第三方重現,以及顯式狀態機、計畫失效標記或事件溯源記憶是否能縮小落差。