檢索與推論系統
Tevatron-Elastic 用單一檢索 checkpoint 調節深度、token 與向量寬度
Tevatron-Elastic 將早退、Matryoshka 向量及層間 token 壓縮統一成可設定的 operating point,一個 checkpoint 可服務多種成本配置。Qwen3‑0.6B 重排序器在第 16 層維持完整品質,同時於作者測試環境加速 1.75 倍。

Tevatron-Elastic 試圖解決生產檢索系統常見的模型碎片化:為低延遲、低儲存或高品質需求分別訓練不同模型。框架把三種壓縮軸寫進同一個 `Granularity`:`layer` 決定提早讀出或移除上層,`dim` 截短 Matryoshka 嵌入,`keep_ratio` 與 `pool_layer` 則控制中途合併 token。訓練者以一段 schedule 列出所需 operating point,部署時再用 `prune_to` 或 `encode_at` 選擇配置。
深度與 token 壓縮減少編碼或評分運算,向量寬度則縮小索引及近鄰搜尋成本,三者不是同一種節省。框架透過 Hugging Face 模型既有的 hidden-state、層列表及 pooling 介面工作,作者已驗證 BERT、ModernBERT、Qwen3、Llama 3 與 Mistral 路徑;新提出的 MLTC 還能在同一檢索 checkpoint 中聯合訓練多個 token 保留率。
團隊以 RLHN‑680K 訓練 20 個 checkpoint,並在 BEIR‑15 測檢索與 BM25 top‑100 重排序。聯合訓練的「彈性稅」並非全為零:ModernBERT 檢索器的完整 operating point,nDCG@10 由專用模型的 0.476 降至 0.450;BERT 下降 0.013,Qwen3‑0.6B 則增加 0.008。單 GPU 實測中,Qwen3‑0.6B 重排序器在第 16 層維持 0.342 MRR@10,吞吐提高 1.75 倍;第 4 層實測 6.86 倍,接近 FLOPs 模型預測的 7 倍。
限制也很明確:token 壓縮對八個 token 的短查詢幾乎沒有收益,三軸同時組合雖能執行,論文尚未提供品質結果;實驗亦固定在特定資料、單 GPU 與監督微調配方。這次發布的價值主要是統一介面與 20 組可檢查權重,而不是新的最高檢索分數。