让 AI 看着一间摆满物品的屋子移动镜头,杯子暂时出画后再回来,它可能还会生成一个“像杯子的东西”,却已经不是原来那只。OPIS 是一套面向视频世界模型——根据画面与动作继续生成场景的模型——的长期多物体记忆测试。它把最初输入里的物体列成固定清单,只按这份真实输入核对后续画面,避免模型借自己生成的历史或特定回访镜头“找答案”。
OPIS 收录 500 个案例、12,672 个物体实例,并从物体是否仍在、身份是否一致、结构是否保持三个层次评分。论文作者报告,在八款模型中,物体存在得分为 85.63—93.49,身份得分却只有 28.12—36.88;当场景中的参考物体从不超过 20 个增至 40 个以上,平均身份得分又从 40.22 降到 23.11。说白了,模型不难生成一个看起来合理的世界,难的是记住这个世界里每件具体东西。上述结果来自论文作者的基准实验,尚不能代表所有视频世界模型。