返回首頁

AI 研究

Basis 釋出 1,502 小時多人語音,中文子集含 15.3 小時

資料集保留逐人音軌與共同時間軸,供全雙工語音及輪替研究使用。中文部分未列出人工標註時數,自動逐字稿也不宜直接作為訓練標準答案。

Antoni Parellada · CC0 · Image source
zh-Hant

Basis 於 9 月 23 日發布 Conversations 1500,提供 1,502 小時、22 種語言的多人對話,涵蓋 2,645 名說話者。時數按對話時間軸計算,沒有把每人的音軌重複相加。資料由參與者透過應用程式與同語言陌生人交談而來,供研究語音互動、輪替及重疊發話使用。[發布公告](https://huggingface.co/blog/basis-ai/conversations-1500)

這批資料保留每位參與者的獨立麥克風音軌,同一片段的起點與長度一致,便於分析誰在何時回應或打斷誰。通話同時容納二至四人,過程中可以換人,因此一整段對話的累計說話者可能超過四名。官方提供可試聽樣本,研究者可先檢查自然對話的聲學與互動特性。[專案頁](https://withbasis.co/open/conversations-1500)

音軌採四萬八千赫茲、十六位元單聲道無損格式,保留錄音時的音量與雜訊,未統一降噪或響度。就前處理而言,研究者應保留原始時間對齊,避免破壞重疊發話的判定。[音訊規格](https://huggingface.co/blog/basis-ai/conversations-1500)

標註集中在約 100 小時的子集。團隊先以波形、音訊模型與逐字稿分析找出候選事件,再請人判讀,涵蓋附和、笑聲、停頓、打斷及自我修正。公告列出 23,751 個人工判讀時刻;除笑聲與附和外,其他類型的機器標籤不保證全部經人確認,評測時應分開處理兩者。[標註流程](https://huggingface.co/blog/basis-ai/conversations-1500)

中文使用者尤其需要看分布:資料卡的 zh-TW 子集只有 15.3 小時、17 段對話及 35 名說話者,人工標註時數欄位留白,不能將整體標註規模套用到中文。官方也明示,自動逐字稿可能有錯,主要供搜尋與篩選片段,不建議未經校對就當成監督訓練目標。[語言與逐字稿說明](https://huggingface.co/datasets/basis-ai/basis-conversations-1500)

取得資料仍須申請並經人工審核;官方稱可免費用於商業及研究,但須遵守資料授權與禁止辨識、聯絡或冒充特定說話者等條件。就實驗設計而言,建議依穩定說話者識別碼切分訓練與測試集,並另建中文人工評測子集,降低身分重疊及標註差異對結果的干擾。這是依資料結構提出的使用建議,並非已證實的模型增益。[存取條件與資料結構](https://huggingface.co/datasets/basis-ai/basis-conversations-1500)

來源

  1. Basis Conversations 1500: 1,500 hours of multilingual, multi-party conversation
  2. Basis Conversations 1500 專案與樣本
  3. Basis Conversations 1500 資料卡