Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.015 — 2026-07-19
PAPER H 13 · 2 信源 约 1 分钟

机器人微调,别把预训练语义洗掉

两种“语义锚定”方案,让机器人学新动作时别忘了原本看懂和听懂的能力。

教机器人学会“拿起绿杯子”,它却可能把“绿色”也当成动作口诀:换成粉色杯子,即使指令改了,仍照旧伸手。问题出在微调——用少量示范继续训练模型——可能冲掉预训练阶段形成的语义结构。两项新工作都在尝试给这种训练加一根“安全绳”,让 VLA(同时看画面、听指令并输出动作的模型)学会新动作,却别忘了如何理解颜色、位置和语言。

Anchor-Align 保留一份冻结的原模型作为老师,在微调时逐层约束新模型的视觉和文字表征;同时把连续动作转成“向左、向右”等离散方向,让语言判断与动作预测在同一段机器人观察上接受训练,避免模型嘴上说“左”、手却往右。另一项工作则把动作表征拆成共享的语义通道和私有通道,再将前者锚定到预训练编码器的“语义地图”;这些辅助结构部署时全部移除,不改变最终模型。

两篇论文都报告了不同 VLA 骨干、仿真与真实机器人上的改善。其中第二项工作作者称,真实场景常规任务最高提升 18.7%,未见分布下的泛化最高提升 21.5%。共同信号很明确:机器人微调不只是把动作练准,还要保护它原本理解世界的坐标系。


供稿材料 SOURCES — 2

← 返回 2026-07-19 · 学术板块