返回首頁

模型工程/評測工具

TokEval 用 18 項內在指標篩選 tokenizer,資訊量指標與語言建模表現相關最高達 0.80

TokEval 將數字位值、程式 AST 邊界、UTF-8 完整性及跨語言成本納入 tokenizer 評測。控制實驗顯示部分指標可預測特定下游能力,但結果目前限於單一 1.27B 架構。

CDC/Cynthia Goldsmith · Public domain · Image source
zh-Hant

EPFL 研究者 Clara Meister 於 8 月 18 日公開 TokEval,試圖把 tokenizer 選擇由壓縮率與人工目測,改成可在模型預訓練前執行的系統化評測。開源工具提供 18 項指標及 16 項確定性健康檢查,除 fertility、詞彙使用率與 Rényi efficiency,也量度數字是否按右側三位分組、運算子是否被獨立編碼、程式 token 是否對齊 tree-sitter 解析出的 AST 葉節點,以及 CJK、emoji 等多位元組字元的 UTF-8 邊界是否完整。

作者沒有只宣稱這些指標「看起來合理」,而是訓練 46 組約 1.27B 參數的 decoder-only 模型。44 個 tokenizer 分別改變演算法、pretokenization 與訓練資料配比,另加入 Llama 3、Mistral-Nemo tokenizer 作參考;同一實驗軌內固定架構、資料與超參數,再以 bits-per-byte、語言理解、數學及程式任務檢查內在指標能否預測下游結果。資訊理論類指標與語言建模表現的 Spearman 相關絕對值最高達 0.80,而換行、數字分割等結構指標則與相應任務準確率相關。

工程上的價值是把部分昂貴 tokenizer 預訓練 sweep 前移為便宜的 corpus 檢查;`tokenizer-sanity-check` 亦會以非零退出碼回報位元組覆蓋、Unicode 正規化、round-trip、特殊 token 或詞彙可達性問題,可接入 CI。工具支援本機 `tokenizer.json` 與多種 tokenizer backend,並附九款常用 tokenizer、13 種 FLORES+ 語言及 15 種程式語言的可重跑報告。

不過,TokEval 不是單一「最佳 tokenizer 分數」。各指標只對部分能力有解釋力,結果也依評測 corpus 而變;主要統計面板僅含 29 個 tokenizer,且模型只有 nanochat 1.27B 架構,未涵蓋長上下文、指令遵循或開放式生成。團隊下一步需驗證這些關係能否延伸至更大模型、不同架構及中文密集資料。

來源

  1. TokEval: A Tokenizer Evaluation Suite
  2. cimeister/tokenizer-intrinsic-evals