你问一个大语言模型:“artificial intelligence”里有几个字母“i”?它可能答错。问题未必是不会数数,而是它读到的常常不是一个个字母,而是已经切好的词块。2026年发表于《Nature》的研究提出“byteification”:不从头训练新模型,而是改造现有LLM,让它直接处理字节,在保留原有能力的同时补上字符级理解的短板。
这里的结论主要来自论文作者的实验。同期《Nature》News & Views评论介绍了同一工作,但它引用的仍是这篇论文,并非独立复现。
模型为什么会看不清字母?
多数LLM使用子词分词。Token——模型读写文字的基本单位——可能是一个词、半个词或标点。分词则像先把句子剪成词块,再交给模型阅读。
这种做法效率很高,却会遮住词块内部的细节。模型看见“artificial intelligence”时,拿到的未必是一串清楚分开的字母。因此,逐字母计数、判断拼写或处理任意字符,都可能变得别扭。代码和生物序列也更依赖细粒度信息:其中一个字符发生变化,含义就可能不同。
字节(byte)是计算机保存文本等数据的基础单位。让模型直接读取字节,相当于把已经装箱的词块重新拆开,让它看到更底层的文本编码。好处是字符细节不再被分词预先藏起来。代价则是:过去的端到端字节模型,实际表现一直落后于主流子词模型,也没有得到广泛采用。
关键不是重练,而是改装
研究团队认为,字节模型落后的一个重要原因不是路线本身不行,而是比赛方式不公平。主流子词模型持续吸收更好的数据整理、模型架构和训练后优化;字节模型若每次都从随机初始化开始训练,很难以同样速度跟进,成本也很高。
byteification换了一个起点:直接把训练成熟的子词LLM改造成字节级模型。这里的“retrofitting”可以理解为给现成机器换一套输入与输出装置,而不是把整台机器重新制造一遍。
论文采用两阶段转换与训练流程,总共使用49.1B个token,作者称这不到一次典型预训练预算的1%。研究团队由此得到Bolmo 7B、Bolmo 1B、Bwen 8B和Blama 8B,分别从Olmo 3 7B、OLMo 2 1B、Qwen3 8B Base和Llama 3 8B改造而来。
字节很多,不能一个个硬读
直接把所有字节依次送入大模型,会让输入序列变得很长。论文因此先把连续字节聚合成patch——每个patch包含一个或多个字节——再交给大型Transformer处理,最后把模型内部结果展开回字节。
这类架构被称为latent tokenizer language model,简称LTLM。所谓“latent tokenizer”,可以理解为:它不在输入前用固定词表把文本切成子词,而是在模型内部把字节临时组织成更适合计算的小组。既保留细节,也避免主干模型逐个处理全部字节。
类似思路此前已有DTP、BLT和H-Net。此次工作的重点,是让这种架构适合承接现成子词模型的能力。论文称,团队处理了子词切分与内部字节patch在表达能力上的不匹配,再配合两阶段训练,使改造后的模型快速恢复源模型表现,并在部分情况下超过源模型。供稿节选没有给出两个训练阶段的具体操作,因此这里无法进一步拆解。
它真正打开了什么可能?
按论文报告,byteification得到的模型在字符级推理任务上表现突出。同期评论用“数清artificial intelligence里有几个i”作为醒目例子。这个例子虽小,却点出了改变所在:模型终于更容易看见词块里面发生了什么。
论文还称,这些模型超过了此前参数量相近的字节级方法,总体能力接近先进的子词系统;通过高效处理字节信息,它们也达到了实用的推理速度。由于改造从已有LLM出发,模型还能复用源模型周围已经形成的生态,而不必另起炉灶。
这项工作的价值因此不只是“让AI更会拼写”。它提供了一条成本相对低的研究路线:主流LLM已经花重金学到的能力可以保留,研究者再为它补上直接理解原始文本编码的入口。论文据此认为,长期阻碍字节模型的性能门槛已经被移除,字节模型可以更有竞争力地扩展。不过,这些判断目前仍主要由论文自身支撑。
局限与未知
- 材料没有提供基准名称、具体分数、模型间差值或推理速度,因此“接近”“超过”和“实用”都不能进一步量化。
- 评论中的数‘i’案例没有披露测试条件、成功率,也不能据此断言模型已普遍解决所有字符计数问题。
- 论文认为字节模型适合代码和生物序列等细粒度数据,但现有材料没有给出它在这些领域全面超过子词模型的具体结果。byteification也只是改造既有子词模型,不等同于从零训练纯字节模型。