生成模型研究
TinyDiT 公開單卡訓練配方:210M 影像模型以 register 吸收九成跨注意力
TinyDiT 用單張 RTX PRO 6000、400,000 步及 3.5 天從頭訓練 210M 參數 DiT,並公開程式、權重與逐階段量測。結果顯示 flow-matching loss 幾乎不能代表成像進展,而 register、時間步偏移及編譯訓練帶來更可操作的訊號。

TinyDiT 並非要挑戰大型商用生圖模型,而是把現代文字生圖訓練縮成可檢查的單卡實驗。作者在一張 RTX PRO 6000 上以 420 萬張 256² 圖片訓練 210M 參數 diffusion transformer,400,000 步耗時 3.5 天;FLUX.2 autoencoder 與 flan-t5-base 文字編碼器保持凍結,原始部分包括 DiT、資料管線、訓練配方與評測。
架構採 cross-attention、2D RoPE、QK normalization、SwiGLU 與 adaLN-single。後者相較作者舊設計釋出 27% 參數額度,換成 16 層、896 hidden width。更值得追蹤的是 register:第 3 層加入 16 個可學習影像 token,每個跨注意力層另有兩個 null key/value slot。量測顯示,中層、中等雜訊下,兩個 null slot 吸收約 90% 跨注意力,EOS 降至約 4%;register 向量範數則達影像 token 的 4 至 13 倍,支持它們充當全域暫存空間的解釋,但仍不是因果消融證明。
訓練採 rectified flow,因 FLUX.2 latent 有 32 channels,把 timestep shift 設為 2.8,使半數樣本位於 74% 以上雜訊區。`torch.compile` 在實際訓練步驟測得 2.4 倍速度、約一半記憶體,但五種長寬比 bucket 各須一張靜態圖。最終 FID 由 33.7 降至 27.0、FD-DINOv2 由 570 降至 218,物件偵測準確率由 65% 升至 90%;同期 flow loss 只從 0.805 降到 0.754,顯示它較適合監測訓練健康,而非判斷視覺品質。
限制也很清楚:模型仍不擅長可讀文字、近距離人臉、人群、三個以上計數與複雜幾何;指標來自作者自建的固定提示流程,尚無獨立重現。權重亦依賴凍結的外部元件,工程師應先核對完整依賴與授權,再把「單卡可訓練」理解成端到端完全獨立。