Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.019 — 2026-07-23
NEWS 约 1 分钟

Gigatoken把分词速度再推百倍

Gigatoken用底层优化把分词推到GB/s级,但百倍提速仍待独立复测。

把海量文字喂给 AI 前,程序得先把它切成模型能读的 token(词元),再换成数字编号。数据一大,这道“备菜”工序就可能拖慢训练预处理和在线文本计数。开源项目 Gigatoken 想把等待压到更短:作者称其速度约为 Tiktoken 的 100 倍,并可兼容 Tiktoken 与 Hugging Face Tokenizers 的 API——也就是现有程序约定好的调用方式,迁移时通常不用大改代码。

最具体的一组公开测试来自项目作者:在 72 核 AMD EPYC 9565 上,Gigatoken 处理约 11.9GB 文本用了 0.486 秒,吞吐约 24.5GB/s;对照的 Hugging Face Tokenizers 只测前 100MB,换算后慢约 989 倍。作者称,20401 篇文档的输出验证一致。它的关键做法,是用 SIMD(让处理器一次计算多份数据)加速切词前的文本拆分,缓存重复词的结果,并减少 Python 与多线程之间的额外开销。需要注意,接入兼容接口会牺牲部分速度;上述成绩也仍是作者自测,能否稳定复现百倍乃至千倍差距,还有待独立复测。


供稿材料 SOURCES — 1

← 返回 2026-07-23 · 开源板块