返回首頁

模型推論研究

CForce 以後期去噪結果監督早期預測,LLaDA2.1 每次前向處理 token 數由 6.94 升至 9.08

CForce 沿用擴散語言模型自己的生成軌跡,把後期較完整的預測蒸餾回早期遮罩狀態。LLaDA2.1-mini 在提高平行解碼量的同時維持準確度,但證據目前集中於同一模型家族與作者控制的評測。

zh-Hant

上海交通大學與螞蟻集團研究者提出 CForce,處理擴散語言模型在高平行解碼下的核心矛盾:一次前向傳播揭露愈多 token,速度愈高,但早期去噪階段掌握的上下文較少,錯誤一旦被提交便可能向後傳播。

方法先收集模型自己的 self-rollout 軌跡,再按新揭露的遮罩 token 數切成多個階段。相鄰階段訓練時,較後期、上下文更完整的分布會以 stop-gradient 方式監督早期分布,不需要另外維護凍結教師。仍被遮罩的位置使用 Confidence Adaptive KL:後期預測信心較高時偏向強制模式對齊,信心不足時則保留較廣的機率支援;交叉熵 anchor 約束真正要提交的 token,課程式訓練再逐步提高揭露難度。

在具備 token-to-token 修訂能力的 LLaDA2.1-mini 上,論文報告平均每次前向處理的 token 數(TPF)由 6.94 增至 9.08,平均準確率亦由 85.57 升至 86.41。非編輯式 LLaDA2.0-mini 的 TPF 則由 3.60 升至 6.42,但作者明確把它描述為速度與品質的折衷,而非所有設定同時無損加速。

程式已併入 Apache-2.0 授權的 dFactory;目前倉庫可訓練 LLaDA2.0-mini/flash,README 則把 LLaDA2.1 支援標示為即將推出。工程上仍須留意:TPF 不是實際 token/秒,軌跡收集與後訓練也會增加一次性成本。下一步應看獨立團隊能否在不同 dLLM、GPU、輸出長度及真實服務批次下重現 wall-clock 優勢。

來源

  1. CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing
  2. dFactory: Easy and Efficient dLLM Fine-Tuning