开发与编程 Jul 23, 2026加入收藏

Marcel Roed 发布了 *GigaToken*,一种针对语言模型的分词器,据称在基准实现上实现了约三个数量级的提升。回顾其优化之处。
您在预训练语言模型,或需要为微调编码数太字节的文本数据集。作为将原始文本转换为数字标识符的分词器——这一看不见的瓶颈——在参考实现中,其耗时可能与模型本身的前向传播相当,甚至在大规模语料库上更高。
GitHub 上由 Marcel Roed 发布的 GigaToken 声称在常用 BPE(字节对编码)分词器上实现了约 1000×的参考实现速度。这一数字值得重视:即使仅以一个数量级计算,也足以改变单台机器的极限。
BPE 分词器主要执行三个步骤:
t + h → th,再 th + e → the)。巨大的性能提升来自多个叠加的优化手段:
tokenizers 或早期 tiktoken)会在每一步遍历规则列表。而经过优化的实现(如 Rust 版 tiktoken)则使用预计算的合并树和优先队列,仅处理活跃的字节对。GigaToken 进一步深化了这一逻辑。分词器并不“高大上”。它们在论文中默默无闻,大多数人理所当然地认为其运行成本为“免费”。但当涉及准备数万亿级别 token的训练语料库(如 Llama 3、DeepSeek V3 等)时,即使分词器仅提升 10×,也意味着节省数周的计算资源。
性能提升在以下场景中至关重要:
更快的分词器并不等于正确的分词器。在采用前需验证以下要点:
LLM 开源生态正在成熟其“管道”层——在推理服务器(vLLM、TGI、llama.cpp)和训练框架(Megatron、DeepSpeed)之后,现在轮到数据处理组件被重写以提升性能。GigaToken 正是这一趋势的一部分,与 tiktoken-rs、arrow-rs 以及 Python 版本向 Rust 或 C++ 的系统性重写并驾齐驱。
关键要点
本文由人工智能撰写,并经人工编辑审核。