Разработка & Кодинг Jul 23, 2026В закладки

Марсель Рёд публикует *GigaToken*, токенизатор для языковых моделей, который обещает ускорение примерно на три порядка по сравнению с эталонными реализациями. Остановимся на том, что было оптимизировано.
Вы предобучаете языковую модель или должны закодировать набор данных объёмом в несколько терабайт текста для fine-tuning. Токенизатор — этот компонент, который преобразует необработанный текст в числовые идентификаторы, — часто является невидимым узким местом: в эталонных реализациях он может потреблять столько же времени, сколько и прямой проход модели на огромных корпусах.
GigaToken, опубликованный Марселем Рёдом на GitHub, заявляет о ~1000× ускорении по сравнению с эталонными реализациями токенизаторов BPE (Byte-Pair Encoding). Это цифра, которую стоит воспринимать всерьёз: даже с поправкой на порядок величины это меняет то, что возможно на одной машине.
Токенизатор BPE выполняет три задачи:
t + h → th, затем th + e → the) согласно заранее изученному словарю.Массивные ускорения достигаются за счёт нескольких рычагов, работающих совместно:
tokenizers в чистом Python или первая версия tiktoken) перебирают список правил на каждом шаге. Оптимизированные реализации (например, tiktoken на Rust) используют предварительно вычисленное дерево слияний и приоритетную очередь, чтобы обрабатывать только активные пары. GigaToken идёт ещё дальше.Токенизаторы не броские. Они остаются незамеченными в статьях, и большинство людей предполагает, что они работают за O(бесплатно). Но когда речь идёт о подготовке обучающих корпусов масштаба нескольких триллионов токенов (как у Llama 3, DeepSeek V3 и др.), даже десятикратное ускорение токенизатора оборачивается неделями сэкономленного машинного времени.
Конкретные случаи, где ускорение критично:
Быстрый токенизатор не заменяет корректный токенизатор. Перед внедрением стоит проверить:
Экосистема open source для LLM зреет в части «инфраструктуры» — после серверов инференса (vLLM, TGI, llama.cpp) и фреймворков для обучения (Megatron, DeepSpeed) пришла очередь оптимизировать компоненты обработки данных. GigaToken вписывается в этот тренд наряду с tiktoken-rs, arrow-rs и систематическими переписываниями на Rust или C++ того, что раньше работало на Python.
Кратко
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.