返回首頁

推理與檢索

ThinkRetrieve 在推理途中檢索解題範例,Qwen3‑1.7B 的 AIME 2025 準確率提高 13.4 點

ThinkRetrieve 不再只要求模型延長思考,而是在每個推理邊界檢索相似題目的完整解答,插入下一段思考脈絡。五款 1.5B 至 8B 模型均勝過循序式測試時計算,但方法需要龐大且嚴格去污染的解題資料庫。

File URL IIIF manifest Catalog record · Public domain · Image source
zh-Hant

研究團隊於 8 月 11 日發表 [ThinkRetrieve](https://arxiv.org/abs/2608.10928),試圖修補「讓模型想更久」的常見失效模式。循序式測試時擴展通常在模型結束一段思考後加入「再想想」之類的提示;推理軌跡拉長後,錯誤假設卻可能被反覆放大。ThinkRetrieve 改在每個 `</think>` 邊界要求模型產生暫定答案,再把原題與暫定答案編碼成向量,從解題庫找出最相近的題目及逐步解答,插回下一段推理。

實驗以 E5‑Large、FAISS 和約 30.96 萬筆經過濾的 NuminaMath 範例組成檢索層,測試 DeepSeek‑R1‑Distill‑Qwen‑1.5B,以及四款 1.7B 至 8B 的 Qwen3/Qwen3.5 模型。所有範例文字都計入相同的 22,528 token 預算,因此改善並非來自額外上下文配額。Qwen3‑1.7B 在 AIME 2025 的最佳準確率由循序擴展的 22.2%升至 35.6%;DeepSeek 1.5B 在 GSM‑8K 使用長預算時,基線由 83%跌至 52%,ThinkRetrieve 則維持約 84%。作者先前也在[馬里蘭大學博士答辯摘要](https://talks.cs.umd.edu/talks/4595)披露了長推理回報遞減與此方法的方向。

關鍵差異是它檢索「怎樣解」而非只補充「知道甚麼」。這使外部記憶成為推理控制訊號,對本機小模型或固定權重部署尤其有吸引力;工程上也能把檢索器、範例庫及模型分開更新。

限制同樣明顯:主要結果集中於數學與選擇題,解題庫的品質、覆蓋範圍及授權會直接限制可部署領域。相似題亦可能洩漏解法;作者雖以精確比對和 0.90 餘弦門檻除污,最高保留相似度仍達 0.898。後續應觀察程式設計或開放式研究任務是否仍受益,以及多次向量檢索與長提示在真實服務中的延遲和成本。

來源

  1. ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling
  2. Steering Generative AI on the fly: Inference-time Approaches for Safe, Reliable and Inclusive Language Models