返回首頁

向量資料庫與 AI 基礎設施

Qdrant 1.19.1 以預取與批次 SIMD 重整量化向量搜尋路徑

Qdrant 1.19.1 針對 TurboQuant 評分加入預取與批次化 SIMD,並減少 HNSW 搜尋及查詢平面的額外配置。新版也強化分片轉移的故障復原,但官方尚未公布涵蓋不同處理器與資料集的整體效能比較。

RI2AI · CC BY-SA 4.0 · Image source
zh-Hant

Qdrant 1.19.1 的重點不是新增檢索介面,而是重寫向量搜尋的熱路徑。官方變更紀錄顯示,量化評分現在會預取資料以提高記憶體頻寬利用率,4-bit TurboQuant 的 SIMD 實作也改為批次處理;HNSW 搜尋則合併多筆評分、提早略過無效項目,並省去部分結果後處理中的 point ID 解析。這些改動瞄準的都是大型 RAG 索引常見瓶頸:計算量降低後,隨機記憶體存取、配置及分支開銷往往比乘加指令更早限制吞吐量。

TurboQuant 先以快速旋轉重新分配向量各維度的資訊,再將數值壓縮成低位元表示。Qdrant 1.19 已提供 `turbo4` 儲存型別,只保存每維 4 bit 的向量,約為 `float32` 體積的八分之一;1.19.1 則主要改善其實際評分效率。這與保留原始向量、再建立量化副本的模式不同:`turbo4` 節省更多儲存與讀取流量,卻無法用完整精度向量重排候選結果。工程團隊仍需以自身 embedding 分布測量 recall,而不能只按壓縮率選型。

分散式可靠性也有實質修改。設定 replica 狀態、終止 resharding 及重新啟動 transfer 的操作改為 crash-safe,以降低共識狀態不同步風險;大量 payload 的 shard transfer 改用原始 payload 傳送,專案稱可快 1.5 倍。新版另修正 CoW segment 在建立 payload index 前未先 flush 的一致性問題,並拒絕以 `.`、`..` 作為 collection 名稱。下一步應觀察不同 AVX/ARM 平台、向量維度、filter 比例及併發度下的端到端 p95 延遲;目前發布說明列出微觀最佳化,尚不足以推導每個部署都會等比例加速。

來源

  1. Release v1.19.1 · qdrant/qdrant
  2. Quantization
  3. Vectors: Turbo4