训练 AI 看视频,麻烦不只在于画面多,还在于模型可能“偷懒”:给不同视频都写出几乎相同的内部摘要,训练看似顺利,实际什么也没分清。以往的 JEPA——在压缩后的特征空间预测内容,而非逐像素还原画面——通常靠一个更新较慢的教师副本、预测器等结构防止这种“表征坍塌”。LeVJEPA 想把这些经验性装置拿掉,让视频预训练更便宜,也更容易检验和扩展。
它只保留一个编码器和一个小型投影器,并用 SIGReg 直接约束特征分布;作者称,这套统计约束可排除坍塌,因此不再需要指数移动平均目标编码器、预测器或停止梯度。最值得注意的是,模型还能采用“帧内双向、帧间因果”的注意力:理解当前帧时只能使用它和过去的帧。作者报告,这种设置在冻结编码器后的评测中不损失准确率,却能让新画面到来时直接续算,无须重新处理整段视频。论文还称,其精度可与主流视频联合嵌入方法相当,而预训练计算量更低;这些效果目前均来自作者实验。