返回首頁

模型訓練系統

Puro-2B 公開 RTX 5090 預訓練配方,1.4T token 實跑成本為 6,891 美元

Puro-2B 把兩階段資料課程、區塊式 FP8 與 MuonH 最佳化整合到消費級 GPU 叢集。作者報告 4,370 美元的縮短訓練版本已超越 Qwen2-1.5B 平均分,但成本只計加速器租用等價值。

极客湾Geekerwan · CC BY 3.0 · Image source
zh-Hant

清華大學 PACMAN 團隊與合作者公開 Puro-2B,希望把「完整重做預訓練」從大型實驗室專案縮小成一般研究團隊可負擔的實驗。這不只是釋出權重:Hugging Face collection 同時提供模型、資料、訓練配方及不同 token 預算的 checkpoint,採 Apache 2.0 授權,方便研究者檢查資料順序、最佳化器與低精度計算如何共同影響結果。

模型是約 20 億參數的 dense decoder-only Transformer,沿用 Qwen3-1.7B 配置但拆開輸入 embedding 與輸出 head。訓練在 RTX 5090 叢集執行,主要線性層的矩陣乘法使用區塊式 FP8,master weights、最佳化器狀態及敏感運算則保留 BF16 或 FP32。系統以 Megatron Core 實作,並結合 MuonH、學習率設計及 curriculum model averaging。

標準流程先由 24 張 GPU 處理 438.84B token,再把規模擴至 96 張 GPU。完整版本第二階段加入約 960B token,合計接近 1.4T token、耗用 22,514 個有效 GPU 小時,按論文的租用等價算法為 6,891 美元;較短的 uniform-data 版本合計 918.84B token、成本 4,370 美元。作者在 15 項數學、程式、推理及知識測試上報告,完整模型平均 57.81 分,高於 Qwen2-1.5B 的 55.14,但仍低於 Qwen2.5-1.5B 的 60.73。其擬合的成本縮放曲線亦顯示約 4,400 美元即可跨過前一基線。

真正值得關注的是可控制的端到端研究平台:團隊能在相同架構下改變資料課程,再追蹤後訓練效果,而不必從不同廠商權重反推因果。不過「低於七千美元」不是建置實體叢集的總持有成本,也不能直接外推至更大模型;網路、主機、儲存、電力、故障重跑與人力仍可能顯著增加預算。外部團隊接下來應重跑縮小版配方,核對 RTX 5090 的長時間穩定性、FP8 數值誤差及完整資料來源。

來源

  1. Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
  2. Puro-2B paper and open artifacts
  3. Tsinghua's Puro-2B trains from scratch on RTX 5090s