AI 基礎設施
PyTorch 2.14 將故障重組納入 c10d,Inductor 擴充低精度與多硬體核心
新版以 `nccl2`、程序群組就地重組與跨後端 Flight Recorder 強化大型分散式訓練。Inductor 同時加入 NVGEMM、宣告式動態形狀與複數張量編譯,但多項介面仍標示不穩定。

PyTorch 2.14 的主軸不是單一模型效能數字,而是把編譯器、分散式通訊與硬體後端往可部署方向推進。新版把先前的 torchcomms 工作整合成 `nccl2` c10d 後端,實作非阻塞 communicator、記憶體暫停/恢復及單邊 RMA window;`Backend` 與 `ProcessGroup` 又新增就地重組介面,使節點失效後可重建程序群組,不必一律拆掉整個工作。原本綁定 NCCL 的 Flight Recorder 也改由程序群組 hook 收集,因此 Gloo 或自訂後端能使用同類 collective 追蹤資料。
編譯路徑方面,NVGEMM 現在讓 CuTeDSL/CUTLASS 產生的候選核心,與 Triton、ATen 一起參與 `mm`、`addmm`、`scaled_mm` 自動調校,並可融合 bias、逐元素操作及部分 reduction;NVFP4 路徑則需要 Blackwell。`ShapesSpec` 與 `@dynamic_spec` 可讓同一份動態維度約束跨 `torch.compile`、`torch.export`、`make_fx` 使用,減少三套入口各自描述形狀的落差。`torch.switch` 補上可追蹤的多分支控制流,複數張量也開始能以拆分實部、虛部的方式實驗性進入 `torch.compile`。
硬體支援亦擴至 ROCm 7.14、Intel XPU graph capture 與 Rubin `sm_107`;Apple Silicon 新增原生 SVD、`eigh`、QR、Cholesky,並把更多算子從 MPSGraph 移到 Metal。升級前仍須注意:`nccl2` 目前只支援 eager,許多新 API 標示 unstable;Python 3.15 雖有 wheel,卻不能使用 `torch.compile`;TVM Relay 後端、部分 profiler 介面及 ROCm 7.1 已被移除。官方也沒有提供一組可概括所有硬體與工作負載的端到端加速數字,工程團隊應以自身模型、拓撲及精度設定重新量測。