推論系統
Ray 2.58 完成 KV-cache/token 感知路由,但新路由器仍屬 alpha
Ray Serve LLM 現在把提示詞 token 化、快取命中估算與副本選擇集中在 ingress,並把 token 直接傳給推論引擎。設計可減少重複 prefill 與 token 化,但官方未公布新版效能數據,控制平面亦帶來額外同步成本。

Ray 2.58.0 將 2.57 預覽的 KV-cache 與 token 感知路由補成可部署路徑。過去只按請求數量分流,容易把具有可重用前綴的提示送到沒有相應 KV block 的 GPU,迫使引擎重新執行 prefill;新設計則由 `LLMRouter` ingress 先按與引擎相同的模板完成 token 化,再比較各副本已有的 KV overlap、尚待處理的 prefill,以及進行中的 decode 工作量。
副本透過 vLLM 的 KV 建立與逐出事件回報快取狀態,Ray 再把事件廣播至所有 ingress。路由器連已卸載至 CPU 的 KV block 也計入命中估算;選定副本後,提示 token 經獨立通道送往引擎,避免第二次 token 化。這對共享大型 system prompt、few-shot 範例或長對話前綴的代理服務尤其有用,因為命中位置與佇列負載現在能在同一次決策中權衡,而不是只追求 session affinity。
代價是 ingress 需要額外 CPU 執行 token 化與評分,並維護跨副本的最終一致快取視圖;高併發下可能要增加 ingress replicas。文件亦指出 KV-aware router 仍為 alpha,且要求 direct streaming 與 NVIDIA Dynamo selection service,簡單、前綴重用低的流量未必能抵銷協調開銷。2.58 同時把 vLLM 升至 0.26.0,部署者應先重播實際請求分布,比較首 token 延遲、KV 命中率及 ingress CPU,不能只憑架構推定吞吐提升。新版另外加入實驗性 gVisor Ray Sandbox,並修正 Serve replica 繞過 token authentication 的問題,升級評估也應涵蓋安全與相容性。