GitHub Repo
vLLM 社群提出 RDNA 分塊調校,W7900 嵌入吞吐量測得提升約 17%–19%
社群測試透過縮小注意力核心的鍵值區塊,提高 AMD 顯卡上的嵌入服務效能。變更仍屬提案,核心加速倍數、整體吞吐量與檢索品質須分別評估。

vLLM 社群於 9 月 22 日提出一項針對 AMD RDNA 顯卡的注意力核心調校:縮小每次處理的鍵值區塊,在 Radeon Pro W7900 的嵌入服務測試中,吞吐量提高約 17% 至 19%。目前公開的是效能提案,尚不能視為正式版本已提供的加速。[社群測試](https://github.com/vllm-project/vllm/issues/58060)
技術切入點是矩陣分塊方式。vLLM 0.28.0 的公開程式顯示,查詢與鍵值兩個方向共用同一區塊尺寸,執行緒群組數則依注意力頭維度決定。提案僅把鍵值方向縮至 32,保留其他啟動參數;這使調校可集中於單一核心,但區塊變小是否改善共享記憶體壓力,仍缺少硬體剖析證據。[核心程式](https://docs.vllm.ai/en/v0.28.0/api/vllm/v1/attention/ops/triton_prefill_attention/)、[提案說明](https://github.com/vllm-project/vllm/issues/58060)
測試採單卡、BF16 與原廠時脈。W7900、R9700 的核心加速中位數分別約為 2.6 倍、2.3 倍,後者服務吞吐量卻只增加約 3% 至 5%,顯示核心速度不能直接換算為請求效能。作者也明確限定適用於嵌入及重排序所走的注意力路徑,未涵蓋文字生成。[測試條件與結果](https://github.com/vllm-project/vllm/issues/58060)
重現時,模型設定同樣關鍵。服務測試使用的 GTE-Qwen2-1.5B 已設定非因果注意力,符合此提案的用途;模型名稱帶有 Qwen,並不代表它走一般自回歸解碼路徑。工程師應核對實際載入的設定與後端,再比較效能;僅更改輸出為向量,並不足以證明運算經過同一條路徑。[模型設定](https://huggingface.co/Alibaba-NLP/gte-Qwen2-1.5B-instruct/blob/main/config.json)
vLLM 文件將嵌入、分類等工作歸入 pooling 模型,可透過對應介面取得向量或分數,並提醒這類支援不保證比直接使用 Transformers 更快。因此,RAG 系統評估此調校時,還應比較完整檢索流程的延遲,不能只看注意力核心。[官方文件](https://docs.vllm.ai/en/latest/models/pooling_models/)
目前端到端數據每種架構僅來自一張卡;半精度 FP16、多卡與其他 RDNA 型號尚未測試,檢索指標也有小幅變動。[已知限制](https://github.com/vllm-project/vllm/issues/58060) 下一步值得追蹤的是上游補丁、獨立重測,以及繁體中文語料上的排序一致性。尤其是短查詢、長文件與高併發可能有不同瓶頸,平均吞吐量之外,也應保留尾端延遲及失敗請求紀錄。這些驗證才能判斷節省的推論時間,是否足以抵銷維護自訂核心的成本。