ホームへ戻る

GitHub Repo

Transformersコミュニティがトークナイザー設定の不整合を報告、DeepSeekモデルで中国語入力が気付かれず失われる可能性

Transformers 5.8.1での再現報告によると、特定のDeepSeekモデルが誤ったトークナイズ処理を読み込み、中国語入力が消失したり、英語の空白が失われたりする可能性がある。現行の開発版ドキュメントには設定不整合時のフォールバック機構が記載されているが、この事例が各バージョンで修正済みかどうかは未確認だ。

Andrew Wippler from Lancaster, USA · CC BY 2.0 · Image source
zh-Hant

10月2日、Transformersコミュニティから、中国語でのデプロイに直接関わるバグ報告があった。Transformers 5.8.1、tokenizers 0.22.2の環境でAutoTokenizerを使ってDeepSeek-R1-0528-Qwen3-8Bを読み込むと、中国語のテスト文字列「嗯,」から空のトークンリストが返され、英語の「hello world」はエンコード後にデコードすると空白が失われるという。報告者によれば、読み込み時に警告や例外は発生せず、最小限の再現コードも添えられている。現在もissueはオープンしており、これらの結果は特定環境でのコミュニティによる報告として扱うべきだ。再現報告

問題は、モデルのメタデータと実際のトークナイズ処理の不一致を示している。公開されているモデルのtokenizer_config.jsonでは、tokenizer_classがLlamaTokenizerFastに設定され、legacyとsp_model_kwargsの各フィールドも残っている。報告者によると、tokenizer.jsonにはバイトレベルのBPE処理が保存されている一方、読み込み後にはMetaspaceを使うSentencePiece形式の前処理とデコーダーが構成される。クラス宣言と関連フィールドだけを変更すると、同じtokenizer.jsonでテスト用の中国語を正しく処理できた。この結果は、設定の選択経路に誤りがあるという見立てを裏付ける。モデル設定、比較テスト

技術的な影響はモデル推論の前段階で生じる。エンコード時点でテキストが失われれば、その後の回答品質や評価結果に影響する可能性がある。これはトークナイザーの役割から導かれるデプロイ上のリスクであり、広範な影響を示す統計はまだない。Hugging Faceの現行mainドキュメントでは、AutoTokenizerがクラス設定を読み取ってバックエンドを選択する仕組みと、設定が一致しない場合にシリアライズ済みのtokenizer.jsonを優先して読み込むフォールバック機構が説明されている。ただし、開発版のドキュメントだけでは、報告対象のバージョンや同種のモデルすべてで修正済みとは確認できない。公式トークナイザードキュメント

エンジニアリングチームは、デプロイ前のエンコード・デコード検査に中国語、句読点、空白を含む英語を加え、パッケージのバージョン、モデルのリビジョン、実際に使われるバックエンドを記録するとよい。今後は、上流でこのモデルがフォールバック規則に追加されるか、どの正式バージョンに修正が含まれるか、同じ設定を使う派生モデルにも個別対応が必要かを確認する必要がある。

出典

  1. Transformers issue #49252:分詞器配置錯配與中文輸入遺失重現
  2. DeepSeek-R1-0528-Qwen3-8B tokenizer_config.json
  3. Transformers 官方文件:Tokenizers 與後端回退機制