AI 代理與 RAG
HALT 以證據覆蓋率決定 RAG 代理何時停止,搜尋迴圈最多減少 45%
HALT 不再用生成模型的自信度判斷搜尋是否完成,而是逐項驗證多跳問題所需主張是否已有證據支持。它可外掛至凍結的搜尋代理,但實際節省幅度高度取決於能否事先產生準確的中間主張。

檢索增強搜尋代理通常會反覆提出查詢,直到模型自行判定資料足夠;問題是必要證據出現後,代理仍可能繼續搜尋,增加延遲、推論成本及干擾內容。8 月 3 日提交的 HALT 將停止條件改寫成可檢查的「證據覆蓋」問題:系統先把問題拆成預期完成的多跳主張,再由小型監督式驗證器,將每項主張與累積文件的關係分類為 Match、Partial 或 Null;只有全部匹配才停止,否則繼續檢索。
這套控制層不修改原代理的策略、檢索器或主幹模型。公開實作以 Qwen2.5-3B-Instruct 加 LoRA 訓練三分類驗證器,推論採 4-bit NF4,並在 HotpotQA、2WikiMultihopQA 與 MuSiQue 測試。使用人工標註的 gold hop claims 時,平均搜尋迴圈減少 19% 至 45%;換成由問題自動產生的主張並遷移至 7B 代理後,節省幅度降至約 6% 至 9%。作者以配對 bootstrap、Holm 校正及 2 個百分點的非劣性界線檢查 exact match,多數測試格維持非劣結果。
工程價值在於,HALT 可作為現有 RAG 代理外部的執行期閘門,不必重新訓練整個代理。不過主要數字仍來自封閉資料集及既定支持事實;開放網路中,文件衝突、來源品質和未完整索引都可能讓驗證器選擇棄答。程式庫也未直接附帶資料與部分產物,完整重現需要另行下載語料和索引。下一步應觀察自動拆解主張的錯誤率,以及額外驗證模型的延遲能否被減少的搜尋呼叫真正抵銷。