想象 AI 要记住一场球赛:如果位置、速度、球衣纹理全挤在同一页笔记里,醒目的细节很可能反复占位,真正影响下一步的线索反而记不清。Orthogonal JEPA 针对的正是这个问题。JEPA(联合嵌入预测架构)不逐像素还原画面,而是在内部特征空间预测被遮挡或未来的状态;但标准做法通常只用一份目标表示和一条预测路径。
新方法把这份“预测状态”拆成多个因子,每个因子由独立分支预测,再合成为完整状态。它还加入正交约束——像让不同笔记栏各管一类要点,尽量减少重复;同时用额外正则避免某些栏长期空着,或整个表示退化成几乎不变的内容。最值得注意的是,这种拆分并不等于自动获得了可解释、彼此独立的概念,论文也明确承认这一点。
在一项受控视觉实验中,使用 DINOv3、相同数据与读出设置时,标准 JEPA 的留出组合准确率为 0.572,Orthogonal JEPA 为 0.581,折叠率则从 0.426 降至 0.417。提升不大,但方向清楚:它尝试优化的不是“预测更多”,而是让模型把有限的内部容量分配得更有结构,为后续预测、规划和推理留下更整齐的状态。