返回首頁

AI 基礎設施

FlashVector 把效能代理從 GPU 核心擴展到整條推薦模型服務堆疊

Unity 團隊提出 FlashVector,讓代理跨越 GPU 核心、計算圖、Triton 伺服器及特徵服務尋找效能瓶頸。正式環境測試最高提升兩倍吞吐量,但程式碼、修改軌跡及完整成本資料尚未公開。

Visitor7 · CC BY-SA 3.0 · Image source
zh-Hant

Unity 研究團隊在 9 月 15 日公開 FlashVector,嘗試把近年用於 CUDA、Triton 核心最佳化的 coding agent,擴展成能處理完整模型服務系統的效能工程代理。它鎖定的是推薦與廣告模型常見的分層瓶頸:GPU 核心之上還有 PyTorch 計算圖、NVIDIA Triton Inference Server、批次與請求處理,以及即時特徵轉換服務;只加速其中一層,瓶頸往往會轉移到別處。[論文](https://arxiv.org/abs/2609.17391)

FlashVector 將不同技術堆疊包裝成可擴充的最佳化環境,讓代理讀取程式碼、建立修改、執行基準,再以效能回饋反覆搜尋。論文列出的案例不只包含 GPU 運算,也涵蓋 Triton 的 C++ 伺服器程式,以及以 Python 撰寫的特徵轉換服務。這種設計的重點並非單一模型具備所有系統知識,而是為每一層提供合適的建置、測試與量測介面,使同一個最佳化迴圈能跨語言和元件工作。

團隊表示,系統已部署於 [Unity Vector 廣告平台](https://unity.com/products/unity-ads/vector):模型伺服器最高取得 2 倍吞吐量及 1.98 倍延遲加速,特徵儲存服務最高提升 1.6 倍吞吐量。這對工程團隊的啟示是,效能代理可能從「產生較快的 kernel」進入能修改生產服務的自動化系統工程階段,因此回歸測試、SLO、資料正確性與變更審核都必須成為獎勵函數之外的硬性閘門。

目前數據仍主要來自作者所屬公司的單一廣告平台,且只公布最高增益;論文沒有釋出代理程式碼、完整工作負載、失敗修改比例或推論成本。後續應觀察其修改能否由外部團隊重現、效能是否能跨硬體與流量分布維持,以及代理產生的底層變更是否經得起長期生產負載。

來源

  1. FlashVector: Agent for Hierarchical Model Serving Stack Optimization
  2. Vector AI connects the right games with the right players