过去的视觉世界模型像几位互不交流的专家:一个判断照片调亮后会怎样,一个预测视频下一刻,还有一个根据动作规划未来。UniJEPA想让同一个模型兼顾这些任务。它统一采用JEPA(联合嵌入预测架构):不生成每个像素,而是在“潜空间”——模型提炼出的内部表示——里预测图像变化或下一状态,通常更省计算。
关键一步是让图像的亮度、对比度、饱和度和色相变化,与视频的时间变化,共用编码器、预测器和训练目标。为防止“表示坍缩”——所有画面被编码成几乎相同的结果——作者加入高斯正则约束,并给出理论上的防坍缩保证;训练无需预训练编码器等额外机制。经过带动作的离线轨迹训练后,模型还能朝视觉目标做零样本规划,即不靠专家示范或奖励信号。作者称,它在多类基准上达到或超过专用JEPA,并以相近准确率比生成式世界模型快至数十倍;这些效果仍以论文自述为准。