開源模型與生成影像
Anima 3.8B v1.1 將時間步感知連接器併入 DiT,雙文字編碼器可在取樣前卸載
社群圖像模型 Anima 3.8B v1.1 以 Semantic Connector v2 在每個去噪步驟融合 Qwen3.5 4B 語義,並把連接器與 52-block DiT 封裝成單一檢查點。新版簡化 ComfyUI 與 Forge Neo 部署,但缺乏標準化品質評測,且完整提示編碼仍有顯著瞬時顯存成本。

Anima 3.8B v1.1 在 9 月 1 日更新權重與工作流程,將原先獨立、可調強度的 progressive-cross adapter,改為時間步感知的 Semantic Connector v2。這個約 608M 參數的連接器不只在產生 conditioning 時執行,而是留在取樣模型內,在每個去噪步驟依 timestep 擷取及注入 Qwen3.5 4B 的語義特徵;其訓練強度固定為 1.0。開發者因此不再需要配對 adapter 檔案或調整滑桿,連接器與擴充至 52 個 block、約 3.8B 參數的 DiT 已合併成一個 safetensors 檢查點。
文字條件仍採雙路徑:原生 Qwen3 0.6B 保留 Anima 的既有風格對齊,Qwen3.5 4B 則補充自然語言、空間關係及多角色綁定能力。兩個文字編碼器只在提示改變時載入,產生 conditioning 後即可卸載;重用快取提示時也毋須重新執行。這可降低穩態取樣的顯存占用,但首次編碼或更換提示時仍須容納額外約 4.8GB 的 Qwen3.5 權重,實際峰值亦受解析度、精度、attention backend 與前端卸載策略影響。
配套 ComfyUI 節點會驗證連接器記錄的原生 adapter hash,避免把不相容元件封裝在一起,並以 64-entry registry 安全重用 conditioning;Forge Neo 亦可依 safetensors metadata 自動識別 v2。模型作者稱新版以四張 A40 訓練約 140 小時,建議從約一百萬像素、28 至 50 步開始。不過目前證據主要是作者展示圖,沒有公開 FID、GenEval 或人工盲測;計數、手部、可讀文字與擁擠構圖仍列為已知弱點。授權也沿用上游 Anima 條款,不能只依配套程式碼的 MIT 授權判斷模型用途。