21 сентября 2026 г.
Тот же код токенизирует в 3–30 раз быстрее: tokenizers v1 сохранила API и token ID
Hugging Face ускорила кодирование в 3–30 раз на десяти семействах моделей и оставила те же token ID: переписывать ничего не нужно.

На одном ядре ноутбука новый токенизатор Hugging Face прогоняет 90 МБ текста в секунду. Версия 0.23.1 давала 8.
Это замер tokbench на GPT-2 (Apple M3 Max, один поток): рост в 10,7 раза. Библиотека tiktoken на том же прогоне выдаёт 27 МБ/с.
На декодировании новый конвейер даёт 337 МБ/с, в 6,1 раза быстрее референса. Быстрее только tokie с 379 МБ/с.
Переписывать ничего не придётся: v1 выдаёт те же token ID и тот же API, что 0.23. Апгрейд конвейера подготовки данных сводится к смене версии.
Откуда скорость. Hugging Face собрала выигрыш из четырёх приёмов. Основной называется Bitcannon и заменяет regex-сплит SIMD-битстримом для пяти семейств паттернов, среди них GPT-2, cl100k и o200k. Ещё три приёма добавляют кэш повторяющихся пре-токенов на поток, цикл слияний без аллокаций на готовых буферах и параллелизм без общего лока.
Восемь воркеров дают 76% от линейного роста: потоки делят один токенизатор, не выстраиваясь в очередь.
Как поставить. v1 пока выходит только как pre-release. В Rust её ставит `cargo add tokenizers --pre`, а вариант без тренировки, с одним кодированием, собирается флагами `--no-default-features --features http`.
На PyPI 21.09.2026 выложены 1.0.0rc1 и 1.0.0rc2, стабильной остаётся 0.23.2 от 03.09.2026. Без флага `--pre` pip поставит старую.
Все замеры сделаны на Rust-ядре. Python-биндинги оборачивают тот же код, но добавляют накладные расходы на каждый вызов, которых в этих цифрах нет.
Биндинги Python обещают упростить до финальной 1.0.0, и в transformers выигрыш поедет уже после неё.
Первоисточник
