AI 研究
自我對弈預訓練公開六種規模權重,以程式輸出學習可遷移結構
研究讓生成器與學習器從隨機權重共同演進,觀察到跨模態預測隨運算量改善。公開材料支援重新評測,但訓練碼尚未釋出,且自然資料仍參與超參數選擇。

9 月 24 日提交的《Self-Play Pretraining with Zero Data》提出一種從隨機權重出發的預訓練方法:兩個模型共同演進,自行產生訓練材料。作者報告,增加自我對弈運算量後,模型在文字、影像與音訊等自然資料上的下一位元組預測損失呈現可擬合的規模效應。[論文](https://arxiv.org/abs/2609.30063)
流程由生成器提出類 Brainf*ck 程式,執行後得到位元組序列,再讓學習器以交叉熵訓練。生成器透過強化學習改善出題方式,獎勵依據是學習器梯度與近期參數變化的對齊分數,並納入 AdamW 縮放,藉此尋找仍有學習價值的結構,降低純隨機雜訊被當成高難度教材的問題。[方法細節](https://arxiv.org/html/2609.30063v1)
作者公開六種規模的學習器權重,從約 9.8 萬到 2,439 萬參數,採類 Llama 解碼器、256 個位元組詞彙及 4,096 token 上下文;每隔 256 輪保存檢查點。這讓研究者能比較同一架構隨訓練進度的變化,並檢查固定程式先驗與不同獎勵設計的對照組。發布僅收錄完成至少 8,192 輪的種子,解讀結果時也須留意這項篩選條件。[模型卡](https://huggingface.co/nourya-cohen/solomonoff-paper)
「零資料」的範圍須精確理解:自然資料沒有參與梯度更新,但作者使用 DCLM 與 DNA 驗證損失選擇超參數。主要結果衡量位元組預測,且規模曲線結合不同模型、檢查點與集成配置;目前證據仍限小模型,世界知識也須由真實資料提供。[實驗設定與限制](https://arxiv.org/html/2609.30063v1)
公開材料提供兩條驗證路徑。研究者可直接使用附帶數據重畫圖表,這一步不需 GPU;也可透過評測程式下載公開語料、整理成固定長度序列,再載入權重重新計分。計分工具會跳過已有結果,容許中斷後續跑。因此,重畫曲線與重新執行模型評測所需的資源及驗證強度,應分開理解。[重現指南](https://github.com/nourya-aliz/self_play_pretraining/blob/main/REPRODUCING.md)
完整重訓仍有缺口:生成器權重、最佳化器狀態與自我對弈訓練碼未釋出,PCFG 對照組也僅提供已計分資料。工程上的下一步,是分別驗證評測結果與完整訓練流程,再測試擴大模型後的效益是否足以抵銷生成教材的成本。[發布範圍](https://huggingface.co/nourya-cohen/solomonoff-paper)、[對照組限制](https://github.com/nourya-aliz/self_play_pretraining/blob/main/REPRODUCING.md)