Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.049 — 2026-08-22
PAPER 约 1 分钟

JEPA不靠高斯先验也能站稳

用“看状态猜动作”防止JEPA学成一团,在复杂场景中胜过高斯约束。

看见门从关到开,人会猜到有人推了门。研究者把类似任务交给 AI:如果模型能从变化前后的状态认出中间动作,它就不能把所有画面都记成同一个答案。这正是 AC-MTM 想解决的问题——防止 JEPA(不重画未来画面、只预测其内部表示的世界模型)发生“表征坍塌”,同时留下对规划有用的动作信息。

现有 LeWM 用 SIGReg 规定内部表示接近各向同性高斯分布,也就是先替模型定好“笔记版式”。AC-MTM 不设这种先验,而在训练时加入对比式逆动力学:让每段状态变化从同批候选中找出真正导致它的动作。若表示全部相同,模型只能靠猜,因此这项任务会直接惩罚坍塌。训练结束后,逆动力学分支被丢弃,测试时的编码、预测、规划和计算量与 LeWM 相同。

作者报告,在四项标准像素控制任务中,AC-MTM 从头训练保持稳定,平均表现与 SIGReg 相当;在更复杂的 OGBench Visual Scene 中,三次训练的成功率均值为 80.0%,高于 SIGReg 的 58.0%,每次分别领先 24、20 和 22 个百分点。不过 PushT 上它仍落后,说明“认出动作”可能低估那些只能被动作微弱控制的物体状态。


供稿材料 SOURCES — 1

← 返回 2026-08-22 · 学术板块