同样是“把杯子放进水槽”,不同机器人的手臂、相机和动作方式都不一样,训练数据很难放在一起比较。RynnValue换了一个更通用的问题:从眼前状态到完成指令,还要多久?这项“时间距离”类似导航软件显示的剩余路程,可作为价值判断——估计当前状态离未来目标还有多远。
它的关键不只是扩大数据量,而是防止模型作弊。训练时,团队随机抽取不规则时刻的画面,并打乱画面顺序,让模型不能靠“第几帧”猜进度;同时用“价值隔离注意力”限制每次判断只能读取对应的画面和指令。由时间戳生成标签后,训练集超过7000小时,约含300万个带指令的片段,无需人工标注偏好。
作者报告,RynnValue-8B在未见任务、机器人身体和视角的轨迹排序测试中,Kendall相关系数达到0.675,高于使用完整偏好监督的方法0.655,也高于只学归一化进度的版本0.292。结果说明,把“还剩多久”作为统一标尺,可能让奖励与价值判断更容易跨机器人迁移;不过这些效果目前仍以论文作者的实验为准。