今天的语言模型写字,通常像从一盒固定字块里逐个挑选:文字先被切成Token(词、词的一部分或标点对应的离散编号),模型再依次预测。AURORA-LM换了一条路:把文本表示成连续变化的数字坐标,在隐藏空间里生成,最后还原成文字。它值得关注,因为它直接追问:语言生成是否必须依赖离散Token?
它最关键的设计,是不为方便生成而压缩这套隐藏表示。模型先用自动编码器——把原文压进隐藏表示、再负责还原——保留较高容量和逐Token还原能力;扩散模型则像反复擦净噪点草稿,在连续潜变量中逐步生成。为降低学习难度,AURORA-LM只限制带噪输入的通道,预测目标仍保留完整宽度;同时按块从左到右生成,块内多个位置并行去噪。
作者称,1B参数版本使用约1500 EFLOPs总计算量,在OpenWebText自由生成和XSum摘要任务上取得其所评估连续及扩散语言模型中的最佳表现,并在统一评测下超过一个更大的公开潜扩散语言模型。这仍是论文作者自述,但它为Token之外的语言建模路线提供了一个具体的规模化样本。