Hugging Faceは、機械学習ワークフローにおいてトークン化がボトルネックになるのを防ぐため、パフォーマンスの劇的な向上に焦点を当てたtokenizers v1のリリース候補を公開しました。新バージョンはv0.23との完全な互換性を維持しており、同一のトークンID、API、およびボキャブラリを生成します。
Hugging Faceが大幅なパフォーマンス向上を実現したtokenizers v1のリリース候補を公開
この記事は翻訳です。 原文を読む
このパフォーマンス向上は、いくつかの主要なアーキテクチャの変更によるものです。同ライブラリは、汎用的な正規表現エンジンではなく、SIMD(single instruction, multiple data)命令を使用して複数のバイトを一度に処理する手書きのスプリッターを使用するようになりました。さらに、v1ではスレッドローカルキャッシュが実装され、以前に処理されたプリトークンの結果を保存することで、繰り返される単語に対してコストのかかるマージプロセスをスキップできるようになりました。また、マージループもスクラッチバッファを再利用するように最適化され、頻繁なメモリ割り当てを排除しており、現在は単一のモデル呼び出しでプリトークンのバッチを処理できます。
Apple M4 Maxで実施されたベンチマークによると、v1のエンコードパスは、モデルファミリーに応じて、シングルスレッドモードでv0.23よりも3から30倍高速であることが示されています。このアップデートはマルチコア間でも効果的にスケールし、8つのワーカーにわたって約76%の線形スケーリングを達成しています。
リリース候補はcrates.ioで入手可能です。今後のアップデートでは、追加のモデルファミリーへのサポート拡大や、最終的にはこれらの改善がtransformersライブラリに導入されることが期待されています。
出典
- tokenizers v1: encode, decode and scaling, measured (Hugging Face Blog, 2026-09-21)
- Update on GitHub