推論系統
TensorRT Model Connect 公開預覽:Hugging Face 模型可免經 ONNX 打包成原生 C++ 推論
NVIDIA 開源 TensorRT Model Connect,以兩道指令把受支援的 Hugging Face 或本機 checkpoint 建成可移交 C++ 應用的版本化 bundle。它縮短模型移植路徑,但目前定位仍是參考實作,支援範圍與效能須按模型、精度及硬體逐項驗證。

NVIDIA 公開 TensorRT Model Connect,試圖填補「PyTorch 模型能訓練,卻難以穩定交付原生應用」之間的工程缺口。快速入門以 Qwen3-0.6B 為例:`trtmc build` 直接讀取 Hugging Face checkpoint,產生包含 TensorRT engine、模型設定及執行資源的 `.bundle`;`trtmc run` 可立即測試,而相同 bundle 亦能由 C++ 的 `trtmc::load()` 載入。這條路徑毋須先匯出 ONNX,可避開不支援算子、動態 shape 及匯出器版本不一致等常見故障點。
專案並非只替語言模型包一層 CLI。其架構按模型家族配置 builder、runtime pipeline、輔助 kernel 與驗證契約,再以文字生成、轉錄、分割、embedding、影像或影片生成等任務 API 隔開應用與底層實作。對需要把 Python 原型交給低延遲 C++、邊緣裝置或既有服務的團隊,版本化 bundle 也比散落的權重、外掛與建置參數更容易納入發布流程。倉庫另附代理專用指引及技能,目標是讓程式代理協助加入和測試新模型支援。
不過,Model Connect 被 NVIDIA 明確標示為參考實作,而非所有模型皆可任意匯入的通用編譯器。精確 checkpoint、精度、量化方式與硬體資格仍以支援矩陣為準;追求已最佳化 LLM/VLM 邊緣部署者,官方亦建議先評估 TensorRT Edge-LLM。工程團隊下一步應觀察新架構納入速度、bundle 的跨版本相容性、實際效能基準,以及自訂算子與第三方原生函式庫的供應鏈安全。