教机器人叠衣服,如果只在最后告诉它“成功”或“失败”,就像做完整张卷子只拿到总分:它不知道哪一步做对了,也不知道何时把先前成果弄乱。这篇综述关注进度奖励——在执行过程中判断机器人正接近目标、停滞,还是倒退,为漫长任务补上更密集的反馈。
作者没有把不同方法简单排成榜单,而是用三层框架整理:模型看见什么、目标如何表达、输出哪种进度信号;信号怎样构造;训练数据与评测究竟验证了什么。其中最值得注意的提醒是:一种奖励可能让机器人的最终成功率提高,却未必忠实描述了任务进度;反过来,进度估计准确,也未必适合实时控制。换句话说,“能帮机器人学会”与“能准确衡量离目标多远”是两项不同能力。综述的价值正在于把这些常被混用的标准拆开,方便后续研究真正横向比较,而非只看一个终局成绩。