返回首頁

訓練基礎設施

Rollplex 將 VLM 強化學習的前綴計算塞進 rollout 空檔,32 張 H800 訓練加速最高 1.30 倍

Rollplex 把參考模型與訓練 actor 的影片編碼、prompt prefill,提前至自回歸解碼期間執行,同時維持同步 on-policy 語義。系統以 CUDA VMM 管理跨階段記憶體,並讓不同張量平行度的訓練與推論程序共用相容權重。

Nevit Dilmen · CC BY-SA 3.0 · Image source
zh-Hant

視覺語言模型的強化學習工作負載與純文字不同:論文所測四組影片任務中,prompt 佔樣本 token 的中位比例達 79%–98%,視覺編碼與 prefill 因而不再只是小額前置成本。傳統同步流程仍依序執行 rollout、參考模型評分、actor 前後向傳播與權重更新,令解碼期間未充分使用的運算單元無法承接後續工作。

[Rollplex 論文](https://arxiv.org/abs/2608.14498)把每個模型階段切成不依賴生成結果的 prefix,以及必須等待回應 token 的 suffix。參考模型與訓練 actor 的 prefix 可在 rollout decode 同時執行;生成完成後,suffix 再從保留的邊界 KV 狀態繼續。所有計算仍使用同一個 actor snapshot,沒有採用陳舊策略或推測回應,因此沒有放寬同步 on-policy 更新順序。

直接共置並不可行。Qwen2.5-VL-32B 的權重、梯度、Adam 狀態、訓練 activation、三組 KV cache 與工作區合計約需每卡 165 GiB,超過 H800 的 80 GB。Rollplex 以 CUDA Virtual Memory Management 保留虛擬位址,只在資料的生產者至最後消費者期間配置 HBM 實體頁;activation 可卸載或重算,FP32 optimizer state 則分塊串流處理。另一項機制依張量版型分類權重:相同切分直接別名、可轉置者以邏輯 view 共用,只有 fused-QKV 等不相容排列需要複製重排。這讓訓練採 TP=8、rollout 採 TP=4,毋須保存完整的第二份 actor。

作者在 32 張 H800、Qwen2.5-VL-32B 與四組影片推理任務上,報告相對序列式共置加速 1.23–1.30 倍,相對分離部署則為 1.57–2.24 倍。[ROLL](https://github.com/alibaba/ROLL)本身已開源並整合 Megatron-Core、vLLM 與 Ray,但目前公開主分支尚未明確標示可直接重現 Rollplex 的完整實作。工程團隊接下來應觀察程式釋出、host offload 對 PCIe/NUMA 的敏感度,以及模型尺寸、影片長度或更快解碼核心改變可重疊窗口後,收益是否仍能維持。

來源

  1. Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training
  2. ROLL: Reinforcement Learning Optimization for Large-Scale Learning