你问 AI 一道题,它通常有两种“打草稿”的方式。一种是把每一步都写出来,人能看懂,但又慢又费字。另一种是在内部用一串数字表示悄悄推理,更紧凑,却像把草稿锁进了抽屉:答案出来了,人不知道它怎么想的。
新论文提出 Self-Explainable Latent Reasoning(SELR,自解释潜空间推理),想在两者之间搭一座桥。模型仍在潜空间里低成本思考,同时学习把自己的内部表示翻译成自然语言。关键是,负责解题和负责解释的是同一个模型,不需要另配一名“讲解员”。
以下方法、数字和效果均来自 Dayuan Zhao、Shengcao Cao、Yu-Xiong Wang 与 Liang-Yan Gui 发布的论文及其实验,尚无独立信源交叉验证。论文已发表于 arXiv,编号为 2608.13570。
不把草稿写出来,也不把它彻底藏起来
常见的 Chain-of-Thought(CoT,思维链)会把推理过程写成一连串文字。它便于阅读,但长篇文字会增加生成时间和计算量,而且写出来的步骤也未必忠实反映模型内部真正发生的计算。
潜空间推理换了一条路。模型不把每一步投射成词,而是把上一轮的隐藏状态直接送回模型,作为下一步输入。隐藏状态可以理解为模型处理信息时形成的一组内部数字。它属于 embedding(嵌入)一类表示:把词句、图像或当前状态映射成数字,供模型继续计算。
这相当于不再逐句誊写草稿,而是把较多信息压进少量连续表示。好处是省去文字生成;代价是这些数字不能直接给人阅读。论文把 Coconut 归为这种不可读的“黑箱”方案,又把 Heima 描述为事后另训解码器来解释内部表示的方案。后一种做法能生成说明,但增加了模型和参数,也让“解题者”与“讲解者”彼此分离。需要强调,这些比较来自 SELR 作者自己的框架,不能替代对相关工作的独立评价。
一份草稿,同时接受两种考核
SELR 的核心并不复杂:让同一个模型同时完成两项作业。
第一项是 Answer Loss(答案损失)。它衡量模型给出的最终答案与正确答案相差多远,迫使潜空间里的推理真正服务于解题。
第二项是 CoT Loss(思维链损失)。它要求模型仅根据自己的潜在表示,复原出人能理解的推理步骤。解码时,模型看不到原始图片或问题,只能读取那段内部“草稿”。这使潜在表示成为一个信息瓶颈:如果里面没有保留足够的题目背景和解题线索,模型就无法把过程讲回来。
训练目标是两种损失的加权和。直观地说,答案损失检查“算对没有”,思维链损失检查“内部草稿能否译回人话”。论文希望借此塑造一种既能解题、又带有可读语义的潜在表示。
模型用 <bot> 和 <eot> 两个特殊标记圈出潜空间推理。标记之间,每一步产生的最后隐藏状态会直接成为下一步输入。作者试过让模型自行判断何时结束思考,但称这一目标很难稳定训练,因此推理时仍要预先设定固定的思考预算。这是一个重要的现实限制:模型还不会可靠地决定自己需要想多久。
先逐步对齐,再压成固定长度
论文同时测试了单阶段和多阶段训练。单阶段版本从头到尾一起优化答案与完整思维链。多阶段版本则像先教翻译,再练速记。
在语言模型上,第一阶段让每个潜在表示对应一个文本推理步骤,第二阶段再改用固定长度的潜在序列,并训练模型复原完整思维链。视觉语言模型(VLM,即同时处理图像与文字的模型)也先逐步对齐,但训练数据中的推理固定分为摘要、图像描述和推理三个位置,因此模型可以让不同位置分别承担不同信息。
消融实验——也就是拿掉某个设计再比较——支持 CoT Loss 的作用。以视觉语言模型为例,只训练答案损失的版本,六项测试平均分为 61.50;加入 CoT Loss 后,单阶段 SELR 达到 63.72,高于原始 Qwen2.5-VL-3B-Instruct 的 62.86。这个结果说明,在作者的设置中,要求内部表示“能被解释”,没有拖累答案,反而与更好的平均表现同时出现。但它只能说明相关设计有效,不能证明解释就是模型计算过程的完整实录。
省下来的,到底是什么?
视觉实验采用 Qwen2.5-VL-3B-Instruct,并在六项基准上评估。表现最好的单阶段 SELR 平均分比原始模型高 0.86 个百分点,平均输出从 49.92 个 token 降至 15.72 个。token 是模型处理和生成文本时使用的基本片段,不完全等同于一个字或一个词。
多阶段版本更省:平均输出约为 13 个 token,比原始模型减少约 73%。这里统计的是潜空间特殊标记和最终答案等实际生成内容,不包括后来解码出来供人查看的解释。论文还报告,在语言模型实验中,SELR 只使用 6 个潜在 token;作为对照,普通文字思维链每题生成超过 150 个文本 token。把文字思维链也强行限制到 6 个 token 后,其 GSM8k 正确率为 10.31%,SELR 为 42.46%。
但压缩并非处处占优。SELR 的多阶段版本在 MMVet 上低于原始模型。作者将下降主要归因于多步数学题和长文本生成,因为这类任务更依赖较长输出。换句话说,固定而紧凑的“脑内草稿”能省成本,也可能提前压扁本来需要展开的复杂过程。
能说出来,不等于已经证明忠实
SELR 最值得关注的地方,是它缩短了解题模型与解释模型之间的距离。同一组参数既形成潜在表示,也负责把它译回文字。与另设事后解码器相比,这在结构上更直接,也避免了多个辅助模型。
作者还做了初步的忠实性分析。他们让 GPT-4o 评价解码思维链与最终答案的一致程度。在 LLaVA-CoT-100k 留出的 5% 测试集上,多阶段指数采样版本总体得分为 0.4788;正确作答时为 0.5320,答错时为 0.2399。MathVista 上,单阶段 SELR 的一致性分数为 0.2097,Heima 为 0.1671。
这些数字说明,解码解释与作答成败存在一定关联,也显示 SELR 在这套代理指标上优于论文复现的 Heima。但一致性评分仍不是因果审计。模型可能学会从内部表示复原一段与答案相符的说明,却未必逐步揭示真正决定答案的计算。所谓“自解释”,目前更准确的理解是:模型被训练成能把自己的潜在状态译成可读步骤,而不是它已经提供了一份完全忠实的思维记录。
局限与未知
- 所有效果来自研究团队自己的论文实验,尚缺独立复现;部分视觉任务还使用 GPT-4o 评分,评价本身也是代理测量。
- 固定思考预算提高了可控性,却不能随题目难度自动伸缩;作者称学习稳定的停止机制仍是未来方向。
- SELR 缓解了解释模型与推理模型分离的问题,但没有解决解释忠实性的根本难题。要把它用于真正的审计,仍需更直接的因果检验。