Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.034 — 2026-08-07
PAPER HF 73 约 1 分钟

连续潜变量开始挑战文本Token

AURORA-LM让文字在连续潜空间中生成,探索离散Token之外的路线。

今天的语言模型写字,通常像从一盒固定字块里逐个挑选:文字先被切成Token(词、词的一部分或标点对应的离散编号),模型再依次预测。AURORA-LM换了一条路:把文本表示成连续变化的数字坐标,在隐藏空间里生成,最后还原成文字。它值得关注,因为它直接追问:语言生成是否必须依赖离散Token?

它最关键的设计,是不为方便生成而压缩这套隐藏表示。模型先用自动编码器——把原文压进隐藏表示、再负责还原——保留较高容量和逐Token还原能力;扩散模型则像反复擦净噪点草稿,在连续潜变量中逐步生成。为降低学习难度,AURORA-LM只限制带噪输入的通道,预测目标仍保留完整宽度;同时按块从左到右生成,块内多个位置并行去噪。

作者称,1B参数版本使用约1500 EFLOPs总计算量,在OpenWebText自由生成和XSum摘要任务上取得其所评估连续及扩散语言模型中的最佳表现,并在统一评测下超过一个更大的公开潜扩散语言模型。这仍是论文作者自述,但它为Token之外的语言建模路线提供了一个具体的规模化样本。


供稿材料 SOURCES — 1

← 返回 2026-08-07 · 学术板块