返回首頁

模型透明度與訓練基礎設施

Gensyn open‑1b 為 80,957 個訓練步驟建立跨硬體位元級稽核鏈

Gensyn 公開 1.61B 參數模型的資料、檢查點、逐步雜湊與重播工具,讓第三方可抽查訓練狀態是否與承諾相符。這套可重現性以約五倍訓練效能代價換取,而且雜湊吻合仍不能獨自證明原始叢集確實按宣稱方式執行。

User:Nillerdk · CC BY-SA 3.0 · Image source
zh-Hant

Gensyn 釋出 Apache 2.0 授權的 open‑1b,重點不是追逐大型模型榜單,而是把「可重現配方」推進成可抽查的訓練紀錄。模型共有 16.1 億參數,其中 10.8 億為非 embedding 參數;基礎版在 48 張 H100 上以 4,000 億 token 訓練 80,957 步,另有續訓 930 億 token 的版本與 SFT 模型。官方同時提供每 100 步的完整檢查點、語料分片、設定、評測程式及逐步狀態雜湊。

其核心是 RepOps 與固定資料流:矩陣乘法、正規化、梯度歸約及隨機數都採固定運算順序,資料窗口也不隨 world size 或 rank 改變。每一步會把前一步雜湊、資料批次摘要、權重、梯度與最佳化器狀態串成新摘要;稽核者可在 CPU、CUDA 或 Apple Silicon 重播指定步驟,比對是否得到相同位元。這比只公布權重與訓練 recipe 多出一條「recipe 是否能導向這組權重」的查驗路徑,適合研究資料污染追蹤、模型供應鏈證明與監督模型的來源治理。

代價相當具體。官方表示可重現 runtime 的模型 FLOPs 使用率約 5%,同硬體、同配方下約比最佳化 PyTorch 慢五倍,完整預訓練耗時 27.8 個運算日。模型能力也不是賣點:中期訓練後在 OLMo 2 評測套件平均 26.8,低於 OLMo 2 1B 的 43.7。更重要的是,單次重播吻合只證明指定輸入與程式產生預期摘要,不能單靠它證明歷史叢集真的如此運行;RepOps 原始碼尚未公開,訓練 loss 日誌亦刻意保留。接下來應觀察獨立稽核覆蓋率、跨 GPU 世代重播結果,以及這種固定歸約成本能否擴展至更大模型與張量平行。

來源

  1. Introducing open‑1b: the first model you don’t have to trust
  2. Gensyn/open-1b-base model card
  3. open-transformers training and audit-replay harness