資料集與多模態研究
LAION-BVD 公開 13 億個影片網址,實際處理 8,000 萬段、總長一千萬小時
LAION-BVD 從 Common Crawl 建立跨影片、音訊與影格的開放研究資料,並釋出 5,500 萬段合成字幕 clip 與 3 億張影格等子集。ViCLIP 評測最多領先 InternVid 基線 2.1%,但資料僅限研究用途,來源權利、網址失效與合成標註誤差仍須另行治理。

LAION、圖賓根大學等團隊發布 LAION-BVD,試圖補上開放多模態研究與大型科技公司私有影片語料之間的規模差距。團隊先從 Common Crawl 擷取 13 億個平台特定影片網址,成功下載並處理其中約 8,000 萬段,總時長達一千萬小時;接著以內容感知的場景偵測切分片段,為影片與音訊生成合成文字描述,並從畫面變化處抽取影格。
公開工件不是單一壓縮檔,而是分層資料產品。Hugging Face 上可見完整網址索引、約 5,500 萬段帶合成影片字幕的 BVD-V-55M、1,000 萬組音訊資料,以及約 3 億張影格的 BVD-I-300M。這種設計讓研究者可只取得網址或特定模態,降低直接複製全部原始媒體的門檻,但也意味著可重現性會受到來源影片刪除、地區限制與平台下載規則影響。
團隊以 ViCLIP、CLAP 和 CLIP 驗證資料效用。官方摘要顯示,ViCLIP 使用 1,000 萬至 5,000 萬個片段擴大訓練時持續改善,在標準影片文字評測上相對 InternVid FLT 基線最多增加 2.1%;音訊模型則與其他未精選的大型語料相若,影片影格的分布也與一般網頁圖片不同。這些結果證明資料可訓練表徵模型,卻不能直接推論大型影片生成模型的品質,且目前成績仍由資料集作者自行產生。
LAION 明確把資料限制為研究、非商業用途,並提醒使用者自行遵守著作權、平台條款及適用法律。網路影片亦可能帶入語言與地區失衡、刻板印象、有害內容,以及合成 caption 的幻覺。後續值得觀察的是網址存活率、去重與內容安全稽核,以及第三方能否在固定計算預算下重現其 scaling 趨勢。