Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.021 — 2026-07-25
PAPER 约 1 分钟

世界模型先学会探索动作

PAVXploreRL让世界模型主动尝试罕见动作,借此补上只看熟练示范留下的物理盲区。

如果只让 AI 看机器人成功拿起物体,它可能学会复现顺利过程,却不知道手臂推得太猛、方向偏了或发生碰撞时会怎样。PAVXploreRL要补的正是这块空白:让世界模型——根据机器人动作预测接下来画面的虚拟环境——先探索不常见的动作,再从结果中学习物理规律。这值得关注,因为这类模型常被用来代替昂贵、危险的真机试验;没见过失败动作,就容易高估一套控制策略的能力。

具体来说,研究者在常见的专家动作上加入控制噪声,制造分布外动作——超出训练示范常见范围的操作。即使没有与这些动作配套的真实视频,系统也能借助改造后的 VJEPA-2,从物理合理性、动作遵循和视觉保真度三个方面给生成结果打分,再用强化学习——依据奖励反复调整模型——继续训练。作者报告称,相比预训练基线,该方法在全部基准上的平均提升为 5.6%,并减轻了只用专家数据训练的模型对策略表现的高估;这些效果目前均为论文作者自述。


供稿材料 SOURCES — 1

← 返回 2026-07-25 · 学术板块