给机器人补课,没必要把所有新场景从头学一遍。更划算的办法,是先找出它最容易“心里没底”的题:比如机械臂碰到物体、目标被遮住,或动作持续较久后,预测开始跑偏。ConfAL-WM正是为此设计。它面向动作条件世界模型——根据当前画面和机器人动作预测接下来会发生什么的模型——用主动学习挑选最值得补训的数据。
具体来说,研究者在EVAC世界模型上加了一个轻量置信度探针,从UNet解码器的中间特征判断预测是否可靠。它输出的不是整段视频一个总分,而是置信度图:逐帧、逐块标出模型哪里没把握。团队选择解码器特征,是因为它既保留画面局部位置,也包含整体上下文;判断还在潜在空间——视频压缩后的内部数字表征——中完成,以控制计算开销。
ConfAL-WM先用少量目标领域数据适配模型,再把更多采样预算分给较难任务,最后可对低置信度的帧和局部区域加大训练权重。作者在RoboTwin2.0实验中称,这种做法比只给轨迹或画面一个分数的奖励、进度和评审式基线,更能改善预测质量与具身轨迹一致性;现有材料未给出具体提升幅度。