Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.064 — 2026-09-06
PAPER HF 23 约 1 分钟

WorldReward给世界模型当裁判

WorldReward把长视频拆成动作片段,让同一个“裁判”同时检查镜头听不听话、画面稳不稳定。

你让 AI 把镜头向前推进,它可能交出一段看似漂亮的视频,场景却没有按指令靠近;也可能方向对了,物体却在途中变形、闪烁。WorldReward 想补上这个“裁判”:它是一种奖励模型——为生成结果打分,并把分数反馈给训练系统——专门评判受镜头动作控制的世界模型。

它最关键的做法,是不让视觉语言模型(能同时理解画面和文字的模型)一次看完整段长视频。短暂的转向或推进很容易淹没在大量画面里,因此 WorldReward 把两段候选视频按动作切块,每块包含连续四个动作,并展示各动作开始、中间和结束时的画面。裁判据此同时判断指令有没有执行,以及外观、结构和前后运动是否连贯,最后对各块投票,得出整段视频的偏好。

作者在含 760 对生成结果、由人标注的 WorldReward-Bench 上报告,它与人类判断的一致性在动作、外观和运动三项上均为最高,分别超过 GPT-5.5 3.42、1.45 和 3.56 个百分点。用于 HY-WorldPlay 1.5 的强化学习后训练时,作者称它也同时改善了镜头执行和视觉质量。


供稿材料 SOURCES — 1

← 返回 2026-09-06 · 学术板块