ホームへ戻る

AI 研究

Agentic-GERが音声区間を再確認、中国語の専門用語の誤り率を最大36.8%相対低減

エージェントに逐語録全体を読ませ、疑わしい区間を再文字起こしすることで、区間をまたぐ専門用語の不一致を修正する。公式実装は公開済みだが、最大の改善幅は特定のモデル構成に限られる。導入時は誤修正率と推論コストを見極める必要がある。

Reichsbankdirektorium Berlin · Public domain · Image source
zh-Hant

上海交通大学やAlibabaなどの研究者は9月24日、長時間音声の修正を、疑わしい箇所の特定、音声の再確認、最小限の修正に分けるAgentic-GERを公開した。既存の音声認識結果を利用し、逐語録全体を手がかりに専門用語を判定する。論文は現在プレプリントで、ICASSP 2027に投稿済みと記されている。[論文情報](https://arxiv.org/abs/2609.29428)

まず話題と用語を要約し、全文と作業メモリをもとに疑わしい区間を選び、Qwen3-ASR-1.7Bで再文字起こしする。言語モデルは新たな認識結果と前後の文脈を合わせて、元の表記を維持するか修正するかを決める。根拠が不十分な場合は元の表記を残す。修正と維持の判断はいずれもメモリに記録され、次のラウンドで参照される。区間の時間境界は変えず、中国語では1ラウンドにつき最大4つの候補を確認する。録音1件あたり最大32ラウンドを実行し、修正は最大48回まで受け入れる。[実装の説明](https://github.com/QwenAudio/FunResearch/blob/main/Agentic-GER/README.md)

評価対象は、GigaSpeechBenchの12分野から選んだ中国語録音524件と英語録音387件。著者らによると、中国語の専門用語で最大の相対改善を示したのは、Whisper-Large-v3の初稿に、思考モードを無効にしたQwen3.8-Maxを組み合わせた構成だった。B-CERは35.07%から22.16%に下がり、相対減少率は36.8%だった。この指標は注釈付きの専門用語だけを数えるもので、逐語録全体の誤りが同じ割合で減ったことを意味しない。初稿にFunASRを使った場合、同じ修正器による相対減少率は17.9%だった。[評価結果](https://arxiv.org/html/2609.29428v1)

効果は誤りの種類にも左右される。誤った語への置き換えは疑わしい文字列が残ることが多い一方、抜け落ちた専門用語は全文を走査しても見つけにくい。また、思考モードは強めるほどよいわけではない。4つの比較のうち3つで、Maxは専門用語の成績が低下した。一部の構成では、全体の認識誤り率もわずかに上がる可能性がある。修正器を評価する際は、専門用語と全文の品質を併せて追跡する必要がある。[制約の分析](https://arxiv.org/html/2609.29428v1)

公式リポジトリにはプロンプト、評価用アダプター、中国語・英語の設定が含まれている。ただし、デフォルトで使われるのはQwen3.8-27Bで、最大の改善幅を示した構成とは異なる。クイックスタートでは録音を各1件だけ処理し、録音ごとの生の実験結果も添付されていない。再現には別途モデルの実行環境を用意し、処理が正常に完了したことを確認する必要がある。失敗後に引き継がれた初稿を、修正済みの結果と取り違えないよう注意したい。[再現に関する説明](https://github.com/QwenAudio/FunResearch/blob/main/Agentic-GER/README.md)

手法の仕組みから見ると、中国語の技術的な内容で役立つのは、区間をまたいで繰り返し現れる用語を利用し、短い区間だけでは不足しがちな意味の手がかりを補える点だ。一方、逐語録全体に依存するため、ストリーミングサービスでリアルタイムに得られる効果は本研究で実証されていない。エンジニアリングチームは既存の文字起こし処理の後段に接続し、自社の分野の録音を使って誤修正率、遅延、呼び出しコストを測定してから、会議や講義などの長時間音声に適するか評価できる。

出典

  1. Agentic-GER: Terminology Recovery in Long-Form Speech Using Global Context
  2. Agentic-GER 論文全文與評測表格
  3. Agentic-GER 官方實作與重現說明