模型訓練
Puro-2B 公開消費級 GPU 預訓練配方,2B 模型完整訓練成本約 6,900 美元
清華大學團隊以 RTX 5090、區塊式 FP8 與 MuonH,從零訓練 2B 參數模型並公開權重、資料與程式碼。較低預算檢查點在團隊的 15 項評測中超越 Qwen2-1.5B,但成本只計 GPU 租用等值,不能視為完整研發預算。

清華大學 PACMAN 團隊公開 Puro-2B:一組以消費級 RTX 5090 從隨機初始化開始訓練的 2B 參數稠密語言模型,以及可檢查的端到端預訓練堆疊。模型沿用與 Qwen3-1.7B 相容的結構配置,但沒有繼承 Qwen 權重;正式版本讀取約 1.4 兆 token,採 28 層 Transformer、2,048 隱藏維度、4,096 token 上下文與非綁定輸入/輸出 embedding。
成本下降並非來自單一技巧。訓練以區塊式 FP8 降低運算與記憶體需求,使用帶 hyperball 約束的 MuonH 最佳化器,並把一般資料順序、代理模型引導的資料選擇、後期課程排序及六個檢查點平均納入同一套實驗。團隊記錄正式模型消耗 22,514 個有效 GPU 小時,按每張 RTX 5090 每小時 0.31 美元換算約 6,891 美元;另一個只完成一半第二階段的檢查點成本約 4,370 美元,在其 15 項 base-model 評測平均分數超越 Qwen2-1.5B。正式模型則被描述為接近 Qwen2.5-1.5B。
對小型研究團隊而言,真正重要的是權重之外的可重現性:Puro-Megatron 保留資料打包、可續跑階段切換、FP8 檢查點、分散式最佳化器狀態及資料損壞處理,資料處理程式與多個中途檢查點亦已釋出。這使研究者可以實際比較資料課程和最佳化策略,而不只是微調既有模型。
不過,成本數字未計入工程、人力、儲存、網路、失敗實驗及後訓練;資料集也因上游來源而採混合授權。Puro-2B-Base 是未對齊的基礎模型,不能直接當聊天助手。下一步應關注外部團隊能否在相同硬體與資料條件下重現吞吐量、成本及評測結果。