Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.085 — 2026-09-27
PAPER H 1 约 1 分钟

世界动作模型改在潜空间演化

LeWAM让动作与环境变化在潜空间共同演化,以小模型绕开昂贵的视频扩散骨干。

让机器人学会抓取物体,常见做法像是先让它在脑中“生成一段未来视频”,再决定手该怎么动。问题是,这套视频扩散模型——通过多轮去噪生成连贯画面的模型——训练和运行都很昂贵。

LeWAM换了一条路:它把当前画面压成潜空间里的“浓缩现场笔记”,直接在其中同时学习动作和环境变化。研究者比较多种视觉编码器后发现,I-JEPA——通过预测图像内部表示来学习视觉规律的编码器——比用于压缩、还原画面的VAE更适合直接生成动作。训练时,单个预测器一边生成动作,一边预测执行动作后的未来表示;部署时则删去未来预测环节,只输出动作,不再依赖大型视频扩散骨干。

作者报告,LeWAM仅训练4亿参数,在RoboTwin 2.0上的平均成功率为92.28%,与当时先进的视觉—语言—动作模型和世界动作模型相当,并在真实机器人操作中保持实用效果。不过,这些效果目前仍是论文作者的实验结论。


供稿材料 SOURCES — 1
01
Latent evolving World Action Model arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-27 · 学术板块