Dev & Code Jul 23, 2026Adicionar aos favoritos

Marcel Roed publica *GigaToken*, um tokenizer para modelos de linguagem que alega um ganho de cerca de três ordens de magnitude em relação às implementações de referência. Retomada das otimizações realizadas.
Você está pré-treinando um modelo de linguagem ou precisa codificar um conjunto de dados de vários terabytes de texto para um fine-tuning. O tokenizer — esse componente que transforma texto bruto em identificadores numéricos — é frequentemente o gargalo invisível: nas implementações de referência, ele pode consumir tanto tempo quanto a passagem forward do próprio modelo em corpora massivos.
GigaToken, publicado por Marcel Roed no GitHub, alega ser ~1000× mais rápido que as implementações de referência em tokenizers BPE (Byte-Pair Encoding) comuns. É um número a ser levado a sério: mesmo em uma ordem de magnitude, isso muda o que é possível em uma única máquina.
Um tokenizer BPE faz três coisas:
t + h → th, depois th + e → the) de acordo com um vocabulário pré-aprendido.Os ganhos massivos vêm de vários alavancas, cumulativamente:
tokenizers em versão pura Python, ou o primeiro tiktoken) percorrem uma lista de regras a cada etapa. As implementações otimizadas (como tiktoken em Rust) usam uma árvore de fusão pré-calculada e uma fila de prioridade para processar apenas os pares ativos. O GigaToken leva a lógica ainda mais longe.Os tokenizers não são glamurosos. Eles passam despercebidos em artigos, e a maioria das pessoas supõe que eles rodam em O(grátis). Mas quando falamos em preparar corpora de treinamento na escala de vários trilhões de tokens (como Llama 3, DeepSeek V3, etc.), mesmo um fator 10× no tokenizer se traduz em semanas de compute economizadas.
Casos concretos onde o ganho importa:
Um tokenizer mais rápido não substitui um tokenizer correto. Os pontos a verificar antes de adotar:
O ecossistema open source de LLMs está amadurecendo sua camada de "encanamento" — após os servidores de inferência (vLLM, TGI, llama.cpp), após os frameworks de treinamento (Megatron, DeepSpeed), é a vez das peças de dados serem reescritas em termos de performance. O GigaToken se insere nesse movimento, ao lado do tiktoken-rs, arrow-rs e das reescritas sistemáticas em Rust ou C++ do que antes rodava em Python.
Para lembrar
Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.