返回首頁

搜尋與推薦系統

Retrieve-for-Train 把搜尋時推理編譯進 5,390 萬參數擴散檢索器

Google Research 將強化學習產生的集合級搜尋策略,蒸餾成可平行輸出多個向量的輕量擴散模型。實驗宣稱比自回歸展開快 12 至 20 倍,但目前證據集中於時尚資料與未公開的音樂資料集。

Simon Bening · Public domain · Image source
zh-Hant

Google Research 9 月 15 日公開介紹 Retrieve-for-Train(R4T),嘗試解決「搜尋結果必須合起來才算好」的集合檢索問題。傳統排序模型通常逐項估計相關性;但服裝搭配、播放清單或購物組合還要求結果彼此多樣、互補,同時不能偏離原始查詢。直接讓大型語言模型展開十個子查詢雖能處理這些條件,卻要逐 token 產生推理與文字,難以滿足搜尋列的低延遲需求。[官方技術文章](https://research.google/blog/bypassing-inference-bottlenecks-accelerating-complex-ai-search-with-retrieve-for-train/)將 R4T 描述為把昂貴推理移到離線訓練的三階段管線。

第一階段以 Soft-GRPO 微調 Gemma 3 4B 或 Qwen3 4B,獎勵同時計算查詢對資料庫的 groundedness、與原意的 alignment,以及集合的 Vendi Score 多樣性。第二階段凍結這個 fan-out 語言模型,為每個查詢取樣 128 組訓練目標;第三階段再以這些合成配對訓練 5,390 萬參數的 Diffusion Transformer,使其由查詢 embedding 直接產生十個目標 embedding,最後以最近鄰映射回資料庫內容。這相當於把 RL 學到的集合策略「編譯」進較小的生成式檢索器,而不是在線上呼叫推理模型。

[論文](https://arxiv.org/abs/2603.06397)在 Polyvore 服裝資料與工業音樂播放清單上,報告其品質優於單查詢、零樣本展開及 Best-of-N,查詢端速度較自回歸方法提高 12 至 20 倍。工程上值得注意的是,所謂一次非自回歸生成仍使用 256 步 SDE solver,並非一次網路前向運算;真正延遲也會受 embedding 模型、最近鄰索引與集合大小影響。此外,音樂資料是專有資料,部分開放式品質由 LLM judge 評分,尚不能推定同樣收益會出現在新聞、企業文件或快速變動的商品庫。接下來應觀察程式碼與資料是否釋出,以及獎勵權重在新領域是否需要昂貴重訓。

來源

  1. Bypassing inference bottlenecks: Accelerating complex AI search with Retrieve-for-Train
  2. Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion