Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
PAPER 约 1 分钟

世界模型也要主动挑数据

ConfAL把补训预算优先投向世界模型最没把握的任务、画面与局部区域。

给机器人补课,没必要把所有新场景从头学一遍。更划算的办法,是先找出它最容易“心里没底”的题:比如机械臂碰到物体、目标被遮住,或动作持续较久后,预测开始跑偏。ConfAL-WM正是为此设计。它面向动作条件世界模型——根据当前画面和机器人动作预测接下来会发生什么的模型——用主动学习挑选最值得补训的数据。

具体来说,研究者在EVAC世界模型上加了一个轻量置信度探针,从UNet解码器的中间特征判断预测是否可靠。它输出的不是整段视频一个总分,而是置信度图:逐帧、逐块标出模型哪里没把握。团队选择解码器特征,是因为它既保留画面局部位置,也包含整体上下文;判断还在潜在空间——视频压缩后的内部数字表征——中完成,以控制计算开销。

ConfAL-WM先用少量目标领域数据适配模型,再把更多采样预算分给较难任务,最后可对低置信度的帧和局部区域加大训练权重。作者在RoboTwin2.0实验中称,这种做法比只给轨迹或画面一个分数的奖励、进度和评审式基线,更能改善预测质量与具身轨迹一致性;现有材料未给出具体提升幅度。


供稿材料 SOURCES — 1

← 返回 2026-08-30 · 学术板块