头版Folia Daily Briefing
← 返回头版
半导体

GigaToken:语言模型分词性能提升逾千倍

GigaToken 是一款高性能分词器工具,在语言模型处理中展现出显著的速度优势 。与 HuggingFace tokenizers 相比,该工具的分词速度快约 1000 倍 ,可达到 GB/s 级别的吞吐量 。

GigaToken 是一款高性能分词器工具,在语言模型处理中展现出显著的速度优势 [1]。与 HuggingFace tokenizers 相比,该工具的分词速度快约 1000 倍 [1],可达到 GB/s 级别的吞吐量 [1]。

具体性能表现方面,GigaToken 在 Apple M4 Max 上的分词速度比传统方案快 1353.13 倍,在 AMD EPYC 9565 上快 989.21 倍 [1]。在 AMD EPYC 9565 处理器上,其吞吐量可达到 24532.45 MB/s,相当于 5564.94 Mtok/s [1]。基于这一性能水平,该工具可在 6.5 小时内完成对整个 Common Crawl 数据集(130 万亿 tokens)的分词处理 [1]。

GigaToken 采用 Rust 语言实现,通过 SIMD 指令集、缓存优化和减少 Python 交互等技术手段实现了性能突破 [1]。该项目支持 HuggingFace Tokenizers 和 Tiktoken 的兼容模式 [1],可作为这两款工具的即插即用替代品 [1],兼容多种 CPU 硬件架构和常见分词器 [1]。


GigaTokentokenizerLanguage Model性能优化SIMD