想象机器人要从几种推法里选一种:世界模型会先在内部“彩排”结果,但画面预测得最像目标的动作,实际未必成功。D-JEPA关注的正是这道缝隙——“预测得准”不等于“选得对”。
这类模型常在潜空间——把复杂状态压成一组数字后的内部空间——比较候选结果与目标的距离。论文审查了96个PushT起点:LeWM和TD-JEPA都曾在8个起点把失败动作排在可用的成功动作之前;当范围缩到最受青睐的4个候选时,预测成本与实际结果的相关性从0.90和0.80分别跌至0.11和0.13。问题恰好在临门一脚时最严重。
D-JEPA让候选动作彼此比较,并用执行后的成败调整排序,同时限制修正幅度,尽量保留原有预测结构。它最终仍可通过潜空间距离直接选动作。作者报告其在PushT上达到87.89%成功率,并在实体机器人任务上提升17个百分点;这些效果尚以论文自述为准。