開放模型與視覺生成
SenseNova-U1.5 正式權重其實約 175 億參數,Hub 快速載入路徑仍缺必要程式碼
SenseNova-U1.5-8B-MoT 正式版以同一骨幹支援視覺理解、原生圖像生成與編輯,模型卡標示實際規模為 18B。第三方 ONNX 移植驗證發現 Hugging Face 的 `trust_remote_code` 宣告指向未隨權重發布的檔案,部署者目前仍須搭配 GitHub 參考實作。

SenseNova 已釋出 U1.5-8B-MoT 正式權重與 Apache 2.0 參考實作。它不是把獨立語言模型、視覺編碼器與擴散模型串起來,而是在 42 層 Qwen3 解碼器內保留理解及圖像生成兩套權重:文字與參考圖片先走理解分支建立 KV cache,生成分支再於 flow-matching 的每個步驟讀取此前綴並直接預測像素。官方稱新版改善原生 4K 生成、中英文文字、複雜版面、局部及多參考圖編輯。
「8B」容易造成部署誤判。模型卡目前標示 18B;Microsoft Mobius 團隊逐 tensor 檢查得到 17,532,854,464 個參數及約 50.2GB 權重,其中理解分支約 9.35B、生成分支約 8.12B。兩個分支也不是 token 級 MoE 路由,而是每次 forward 整體切換;生成期間會凍結理解側 KV cache,反覆執行另一套解碼器。
更直接的相容性問題在包裝。Hugging Face 設定宣告 `AutoModel` 應透過 `modeling_neo_chat.py` 載入,但該檔與對應 configuration 檔並未包含在模型倉庫,因此頁面提供的 `trust_remote_code=True` 單行範例不能獨立運作。官方完整 quick start 實際要求先 clone GitHub 倉庫,再由其中的 `sensenova_u1` 套件載入權重。
Mobius 的轉換測試還發現,理解權重為 BF16,而生成分支大量以 FP32 儲存;把後者直接降至 FP16,20 步採樣約在第 15 步出現溢位與 NaN。其 H200 ONNX 測試峰值約 91GB,這是特定匯出路徑而非官方最低需求,不能外推至 LightX2V 或量化版本。部署者應等待 Hub 包裝修正、獨立品質評測,以及正式 GGUF/低記憶體方案,再評估生產使用。