AI 研究
Basis、複数人の会話音声1,502時間を公開 中国語サブセットは15.3時間
話者ごとの音声トラックと共通のタイムラインを保持し、全二重の音声対話やターンテイキングの研究に活用できる。中国語部分の人手によるアノテーション時間は記載されておらず、自動文字起こしもそのまま学習用の正解データとして使うには適さない。

Basisは9月23日、22言語、計1,502時間の複数人による会話を収録したConversations 1500を公開した。話者数は2,645人。収録時間は会話のタイムラインに基づいて算出されており、各話者のトラックの長さを重複して加算したものではない。データは、参加者がアプリを通じて同じ言語を話す見知らぬ相手と会話したもので、音声によるやり取り、ターンテイキング(発話交替)、発話の重なりの研究に利用できる。[公開発表](https://huggingface.co/blog/basis-ai/conversations-1500)
このデータには、参加者ごとの独立したマイク音声トラックが保持されている。同じ区間の各トラックは開始時点と長さがそろっており、誰がいつ誰に応答したり、割り込んだりしたかを分析しやすい。同時に通話できる人数は2〜4人だが、途中で参加者が入れ替わるため、会話全体の累計話者数は4人を超える場合がある。公式の試聴サンプルも用意されており、研究者は自然な会話の音響特性や相互作用の特徴を事前に確認できる。[プロジェクトページ](https://withbasis.co/open/conversations-1500)
音声トラックは48 kHz、16ビット、モノラルのロスレス形式で、録音時の音量とノイズを保持している。一律のノイズ除去やラウドネスの正規化は行われていない。前処理では、発話の重なりの判定を損なわないよう、元の時間的な整合性を維持する必要がある。[音声仕様](https://huggingface.co/blog/basis-ai/conversations-1500)
アノテーションは約100時間のサブセットに集中している。チームはまず、波形、音声モデル、文字起こしの分析によって候補となるイベントを抽出し、その後、人手で判定した。対象には相づち、笑い声、間、割り込み、自己修正が含まれる。発表では、人手で判定した時点の数を23,751としている。笑い声と相づち以外の種類については、機械生成ラベルのすべてが人手で確認済みとは限らないため、評価時には人手による確認の有無を区別して扱うべきだ。[アノテーションの手順](https://huggingface.co/blog/basis-ai/conversations-1500)
中国語データを扱う利用者は、特にその分布を確認する必要がある。データカードによると、zh-TWサブセットは15.3時間、17件の会話、35人の話者にとどまり、人手によるアノテーション時間の欄は空白になっている。データセット全体のアノテーション規模を中国語にも当てはめることはできない。また、公式には、自動文字起こしには誤りが含まれる可能性があり、主に区間の検索や絞り込みのために提供していると明記されている。校正せずに教師あり学習の正解データとして使うことは推奨されていない。[言語と文字起こしに関する説明](https://huggingface.co/datasets/basis-ai/basis-conversations-1500)
データの取得には申請と人手による審査が必要だ。公式には商用・研究用途で無料で利用できるとしているが、データのライセンスに従い、特定の話者の身元の特定、連絡、なりすましなどを禁じる条件を守る必要がある。実験設計では、固定の話者識別子に基づいて訓練セットとテストセットを分割し、中国語の人手による評価用サブセットを別途作成することを勧める。これにより、両セット間での話者の重複やアノテーションの違いが結果に与える影響を抑えられる。これはデータ構造に基づく利用上の提案であり、モデル性能の向上が実証されているわけではない。[アクセス条件とデータ構造](https://huggingface.co/datasets/basis-ai/basis-conversations-1500)