推論系統
vLLM 以外掛接入 Tenstorrent:為網格加速器另建分階段排程與資料平行路徑
新開源外掛毋須分叉 vLLM 核心,即可用相同的 OpenAI 相容 API 在 Tenstorrent 硬體上提供多款語言及視覺模型。它也暴露現階段限制:預填與解碼不能在同一步混合,LoRA、推測解碼及多主機服務尚未支援。

Tenstorrent 團隊公開 `vllm-tt-plugin`,透過 vLLM 的標準平台與通用外掛入口註冊硬體、模型架構、工作程序及排程器。只要環境可匯入 TT-Metal 的 `ttnn`,vLLM 就會辨識 Tenstorrent 平台;外部仍使用原有的 OpenAI 相容端點與請求格式。這種設計的重點是把硬體相依程式留在 Apache 2.0 外掛內,避免長期維護落後上游的 vLLM 分支。
外掛目前涵蓋 Llama、Qwen、Mistral、Gemma、DeepSeek V3、GPT-OSS,以及部分視覺語言架構。模型實作並不放在外掛本身,而是由 TT-Metal 提供手寫 TTNN 核心;外掛依 checkpoint 宣告的架構名稱完成註冊。因此「可辨識模型」不等於所有裝置、精度與上下文組合均已驗證,部署者仍須對照 TT-Metal 的模型與提交版本表。
真正不同之處在排程。上游 vLLM 可在同一步混合分塊預填與持續解碼,Tenstorrent 路徑目前則把每一步固定為預填或解碼,再於兩者之間切換。穩定解碼時,深度為二的佇列可讓主機安排下一步,同時非同步讀回前一步結果;批次形狀改變、恢復預填、結構化輸出或取樣方式不符時,管線必須先排空。Galaxy 系統也採單程序的 lane data parallelism,以避免每一步跨程序分散與彙整抵銷平行收益。
目前安裝程式會針對 vLLM 0.26.0 從原始碼建置,舊版相容標籤並不持續回補。LoRA、推測解碼、prompt logprobs、多主機服務尚未支援,prefix cache 與非同步解碼亦需模型主動宣告能力。工程團隊下一步應關注混合預填/解碼、跨主機擴展與實際吞吐量資料;官方這次說明的是架構可行性,沒有提供與 GPU 的同條件成本或延遲比較。