返回首頁

資料集/程式模型

The Stack v3 開放近 5 兆個程式 token,修正舊版去重錯誤並內嵌原始碼

Hugging Face 與 BigCode 釋出新一代開放程式預訓練語料,訓練集包含約 1.73 億筆樣本及 4.9 兆個 token。新版不再要求使用者另行回抓原始碼,但授權、資料污染與 15.9 TB 儲存成本仍須由訓練團隊自行治理。

Asoundd · CC BY-SA 4.0 · Image source
zh-Hant

Hugging Face 與 BigCode 公開 The Stack v3,重新建立供程式語言模型預訓練使用的大型原始碼語料。完整版本取自約 2.24 億個 GitHub repository、439 億個檔案,原始規模約 114 TB,涵蓋 770 種程式及標記語言;可直接訓練的 `stack-v3-train` 則經授權篩選、品質過濾、PII 遮蔽及近似去重,形成約 1.73 億筆樣本、4.9 兆個 token。資料以 1,023 個 Snappy 壓縮 Parquet 分片提供,官方文件支援用 Hugging Face Datasets 串流讀取。

相較 The Stack v2,最實際的改變是每筆資料直接包含解碼後的 UTF-8 原始碼。舊版主要保存 Software Heritage 識別碼,使用者仍須另行取得內容;v3 因而更容易建立可重現的資料快照。新語料反映 GitHub 截至 2025 年 8 月的預設分支狀態,比 v2 多出約兩年程式碼,但不含完整 Git 歷史。

團隊也披露,v2 的 MinHash 去重流程把 token 序列誤當成字元序列切割,造成過度去重。v3 改用正確的 token shingles,並透過 MinHash LSH 建立近似重複群組。使用者若不接受官方語言比例或過濾規則,也可從保留重複群組識別碼的完整資料桶自行重建訓練集。

此發布為開放程式模型提供較新且可檢查的預訓練基線,但「開放」不等於沒有治理成本。資料集採 ODC-BY 1.0,個別檔案仍保留原始授權;模型訓練者需要自行處理授權義務、秘密資訊殘留及退出要求。社群討論亦指出,公開 repository 的品質差異很大,且 2025 年語料已可能混入 AI 生成程式碼。研究者下一步應量測跨 repository 的評測污染、去重召回率與不同語言配比,而不能只以 token 數量判斷資料品質。

來源

  1. The Stack v3 Dataset Card
  2. Hugging Face releases The Stack v3 – largest open code dataset yet
  3. The Stack v3: 5 Trillion Open Code Tokens from Hugging Face