AI 評測與代理可靠性
研究揭露多模型審稿管線的指涉漂移:驗證器可能把正確回滾判成錯誤
新實驗顯示,「草擬—驗證—修訂」管線中的 `previous` 等相對詞,可能隨模型角色轉換而改變指涉。提高推理強度可大幅改善部分模型,但模型選擇比單純增加測試時計算更關鍵。

多模型「草擬—驗證—修訂」常被視為比單次生成更可靠:第一個模型提出答案,第二個模型找錯,第三個模型裁決並修正。然而一篇新研究指出,管線本身會引入「指涉漂移」。例如部署指令同時列出「Previous Version」與「Current Version」,草擬模型把回滾目標理解為升級前正在運行的 current 版本;驗證器卻依欄位名稱,堅持應回到更早的 previous 版本。兩種語言解讀都合理,但只有一種符合實際操作時序。
研究把這類衝突做成 10 個基礎案例、每例三種條件,共 30 個合成刺激,測試六款模型的 21 種推理設定。結果的 balanced accuracy 從 0.156 到接近滿分不等;GPT‑5.2 從不啟用推理時的 0.156,上升至最高推理強度的 0.942。Gemini 3 Pro 在各設定皆高於 0.94,低推理設定仍以約 5% 的單次成本超過 GPT‑5.2 的最高推理設定。錯誤分析顯示,模型常被欄位標籤與驗證器的錯誤分類牽引,即使已說出正確操作邏輯,最後仍接受錯誤裁決。
工程上的直接教訓是:跨階段傳遞內容時,不應保留依視角變動的「前一個」「目前」「原回應」等詞;應改用版本號、時間戳、物件 ID 與明確的狀態轉移。驗證器也應輸出引用對象,而不只是錯誤標籤。研究已公開刺激、彙總結果與重建圖表的程式,但樣本只有 10 種情境,且部分原始供應商回應與推理軌跡未包含在儲存庫中,因此尚不能推論所有代理工作流都會出現相同比率的失敗。