像一个人学会伸手拿杯子,却在训练后更难判断杯子离自己多远。研究者想知道:视觉语言模型(VLM——能同时理解图像和文字的模型)变成视觉—语言—动作模型(VLA——还能输出机器人动作)后,原有的空间感是否还在。为此,他们逐层检查一对结构和初始权重相同、仅动作后训练不同的模型:Molmo2-ER 与 MolmoAct2-LIBERO。
研究者冻结模型,再尝试从每层内部信号读出画面深度,也就是物体远近。结果显示,VLA 在全部 36 层都弱于基础 VLM,差距在最后几层尤其明显:第 35 层的深度准确率从 0.752 降至 0.506。更反直觉的是,第 28 至 35 层本来会让 VLM 的深度信息变得更清晰,VLA 却在同一区间继续退化。
作者进一步做了干预实验:去掉后层 MLP——Transformer 中负责加工并写回信息的模块——的大部分输出后,末端损失多数能够恢复;对注意力模块做同类处理,则没有相近效果。这提示动作能力的获得,可能不是简单增加一项本领,而是改写了模型后层保存空间信息的方式。不过,“能从内部信号读出深度”不等于机器人决策时一定会使用它。