你让视频模型“把这张钞票折成乌龟”,画面清晰流畅还不够:结尾必须出现由那张钞票折成的乌龟,而不是悄悄换成一只真的乌龟。SemComp-Bench要解决的,正是视频生成评测长期偏重“像不像”、较少追问“事情办没办成”的问题。
研究团队把这种能力称为“语义任务完成”:结果既要符合指令,也要与参考图里的具体对象保持关系。评测不强求完整展示每一步,只验收关键结果。配套数据集SemComp-Data覆盖艺术与精细操作、美妆时尚、手工、烹饪、园艺宠物、运动健身六类场景,每项包含参考图、长短两版指令和围绕结果截取的视频。
评分时,视觉语言模型——能同时理解图像和文字的模型——回答预先设定的是非题,并为判断指出画面证据。OA Score检查结果是否达成及语义是否落地;GR Score检查物理违和、模糊、渲染瑕疵和局部不稳定等问题。作者实验称,现有代表性视频模型仍难同时把任务做成并守住参考图中的关键关系;论文未在所给正文中披露可供引用的具体领先幅度。