訓練資料
LAION-BVD 釋出千萬小時影片語料,但媒體檔只限經審批的非商業研究
LAION-BVD 從 Common Crawl 整理 13 億條影片網址,並下載約 8,000 萬段、合計一千萬小時的內容。資料管線與網址清單已公開,但主要媒體子集受存取限制,且合規責任仍由研究者承擔。

LAION 於 8 月 25 日公布 Big Video Dataset(BVD),嘗試把大型影片、音訊及圖像預訓練資料帶到可檢查的研究環境。團隊先從 Common Crawl 擷取 13 億條平台專屬影片網址,再成功下載約 8,000 萬段影片,總長度約一千萬小時;這兩個數字不可混為一談,前者只是候選網址集合,後者才是實際取得的原始語料。
公開管線涵蓋下載、內容感知場景切割、畫格抽取、合成字幕及模型訓練。主要衍生資料包括 5,500 萬段附影片字幕和時間戳的場景片段、1,000 萬段音訊,以及 3 億張場景變化畫格。影片與音訊說明由模型合成,而非直接取自網頁,因此可降低缺少描述文字的問題,卻也可能把 caption 模型的辨識錯誤與偏差注入後續訓練。
LAION 同時發布 ViCLIP、CLAP 與 CLIP 訓練路徑。作者稱,使用 BVD 訓練的 ViCLIP 在標準影片—文字評測上較 InternVid 基線最多提高 2.1 個百分點,且資料量由 1,000 萬增至 5,000 萬片段時持續改善。這為研究資料規模、模型規模及模態組合的 scaling behavior 提供了少見的公開實驗材料。
「開放」仍需加上重要限定:完整媒體並非匿名自由下載。5,500 萬片段子集約 41.1TB,須提交機構、用途及授權資料接受人工審批,只准學術與非商業研究;網址和部分 metadata 才能直接取得。LAION 也明確警告語料可能帶有地域、語言、刻板印象及內容權利問題,發布並不等於替使用者完成著作權或平台條款清理。下一步應觀察資料移除機制、來源可追溯性、合成字幕誤差,以及第三方能否在受限存取下重現官方結果。