返回首頁

GitHub Repo

Transformers 社群回報分詞器配置錯配,DeepSeek 模型中文輸入可能靜默遺失

Transformers 5.8.1 的重現案例顯示,特定 DeepSeek 模型可能載入錯誤的分詞流程,讓中文輸入消失、英文空格遺失。現行開發版文件已描述配置錯配的回退機制,但此案例在各版本的修復狀態仍待確認。

Andrew Wippler from Lancaster, USA · CC BY 2.0 · Image source
zh-Hant

10 月 2 日,Transformers 社群提出一項與中文部署直接相關的錯誤回報:在 Transformers 5.8.1、tokenizers 0.22.2 環境,以 AutoTokenizer 載入 DeepSeek-R1-0528-Qwen3-8B 後,中文測試字串「嗯,」得到空的 token 清單;英文「hello world」編碼再解碼後則失去空格。回報者指出,載入過程沒有警告或例外,並附上最小重現程式。目前議題仍開啟,這些結果應視為特定環境的社群證據。重現回報

問題指向模型中繼資料與實際分詞流程不一致。該模型公開的 tokenizer_config.json 確實將 tokenizer_class 設為 LlamaTokenizerFast,並保留 legacy 與 sp_model_kwargs 欄位。回報者指出,tokenizer.json 儲存的是位元組層級 BPE 流程,載入後卻建立使用 Metaspace 的 SentencePiece 風格前處理與解碼器。只調整類別宣告及相關欄位,同一份 tokenizer.json 就能正確處理測試中文,支持配置選擇路徑有誤的判斷。模型配置、對照測試

技術影響發生在模型推論之前。若文字在編碼階段已遺失,後續回答品質與評測結果都可能受到干擾;這是依分詞器角色推導的部署風險,尚無全面影響統計。Hugging Face 現行 main 文件說明,AutoTokenizer 會讀取類別設定、選擇後端,也列出配置不符時優先載入序列化 tokenizer.json 的回退機制。不過開發版文件不能證明回報版本或所有同類模型已獲修復。官方分詞器文件

工程團隊可先把中文、標點與含空格英文加入部署前的編碼解碼檢查,並記錄套件版本、模型修訂與實際後端。接下來需確認上游是否將這個模型納入回退規則、修補落在哪個正式版本,以及相同配置的衍生模型是否需要另行處理。

來源

  1. Transformers issue #49252:分詞器配置錯配與中文輸入遺失重現
  2. DeepSeek-R1-0528-Qwen3-8B tokenizer_config.json
  3. Transformers 官方文件:Tokenizers 與後端回退機制