推論與量化
Nunchaku Lite 原生進入 Diffusers,以 W4A4 量化降低擴散 Transformer 顯存與延遲
Diffusers 現可直接載入 Nunchaku Lite 的 INT4 與 NVFP4 檢查點,不必另裝模型專用推論引擎。SVDQuant 同時量化權重與啟用值,目標是在節省顯存之外真正縮短去噪時間。
Archive
共 981 篇技術新聞
推論與量化
Diffusers 現可直接載入 Nunchaku Lite 的 INT4 與 NVFP4 檢查點,不必另裝模型專用推論引擎。SVDQuant 同時量化權重與啟用值,目標是在節省顯存之外真正縮短去噪時間。
模型安全評估
Anthropic 的 Responsible Scaling Policy 3.4 修改自動化研發能力門檻、內部未刪節報告分享範圍與外部審查方式。更新看似偏治理,實際會影響模型能力評估、部署閘門與安全報告的工程流程。
UniVR 嘗試只從視覺示範共同學習複雜推理、物理動態與長期規劃。ByteDance 同步公開 34B Planning 檢查點,為不依賴文字思考鏈的視覺代理研究提供可測試基線。
檢索與推論
Nemotron 3 Embed 提供 8B、1B BF16 與 1B NVFP4 等文字嵌入模型。低精度版本把檢索模型的記憶體與吞吐效率納入第一級設計目標,但品質仍需在目標語料上驗證。
資料中心基礎設施
NVIDIA 開始部署為 Vera Rubin 平台設計的 Spectrum-6 交換系統,單晶片提供 102.4 Tbps 吞吐量。產品同時導入 800Gb/s 連接埠、液冷與共封裝光學選項,瞄準十萬張以上 GPU 的橫向擴充網路。
模型與開源工具
Google 發布 Gemma 4 12B 開放權重模型,以線性投影取代獨立視覺與音訊編碼器。新架構簡化微調與本機推論,但官方效能數據仍須由獨立測試驗證。
Microsoft 計畫在 Azure 規模化部署 AMD Helios,並推出搭載第六代 EPYC 的 HDv2、HXv2 與 MI455X 推論執行個體。這是 GPU、CPU、DPU、網路與軟體共同設計的基礎設施更新,實際性價比仍待公開測試。
Google 發布 LiteRT.js,讓網頁應用直接執行 `.tflite` 模型,並依裝置使用 CPU、GPU 或 NPU。它把瀏覽器端 AI 從 JavaScript 核心推向跨平台原生執行堆疊,但效能與相容性仍高度依賴瀏覽器及硬體。
LiteRT.js 透過 WebAssembly 封裝 Google 的跨平台推論執行期,並以 XNNPACK、WebGPU 與實驗性 WebNN 分別對應 CPU、GPU 與 NPU。它讓既有 `.tflite` 模型更容易移至用戶端執行,但效能與相容性仍高度取決於瀏覽器及裝置。