AI 推論與邊緣部署
Ultralytics 8.4.105 擴充 YOLO26 深度模型邊緣部署,並修補量化與匯出路徑
Ultralytics 8.4.105 新增 YOLO26 深度估測模型對 Hailo-8L 與 Qualcomm QNN 的支援,並改善 CoreML、OpenVINO、NCNN 等部署後端。版本亦讓中斷的知識蒸餾檢查點可直接驗證與匯出,但效能收益仍須在目標硬體上個別量測。

Ultralytics 於 7 月 25 日發布 8.4.105,重點不是新模型權重,而是補齊 YOLO26 從訓練到異質硬體部署的工程路徑。新版為 YOLO26 depth 加入 Hailo-8L 匯出與推論支援,並擴大 Qualcomm QNN 相容性;CoreML 端則改用可匯出的上採樣操作,修正動態尺寸下的分割與深度模型。行動裝置匯出輸入尺寸也被統一:分類預設 224,其餘偵測、分割、深度、姿態與旋轉框任務使用 640,降低不同任務產物之間的配置落差。
訓練與 CUDA 原生推論新增選用式 `channels_last` 記憶體格式,讓卷積工作負載有機會利用較適合 Tensor Core 的 NHWC 排列;既有 NCHW 仍是預設值,避免無條件改變數值或效能特性。配套修正涵蓋卷積與 BatchNorm 融合、轉置卷積權重軸,以及 CUDA 校準期間由 inference tensor 引起的崩潰。
量化方面,OpenVINO INT8 匯出會讓 DFL 操作維持浮點精度,避免邊界框分布計算被過度量化;語意分割的 `argmax` 亦可直接寫入匯出圖。NCNN 批次推論遺漏首張之後影像、OpenVINO 多 GPU 裝置別名及 CoreML NMS 精度紀錄等問題也獲修正。
另一項實用變更是把蒸餾檢查點融合至 student model,使中途或中斷保存的權重能執行 `predict`、`val` 與 `export`,減少訓練恢復前的人工轉換。不過官方未提供跨裝置的統一吞吐與精度比較;工程團隊升級前仍應重跑量化校準、動態尺寸、批次輸入及端側精度回歸測試。