Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.021 — 2026-07-25
PAPER 2 信源 约 2 分钟

机器人走出模拟器,现场学会操作

机器人先看示范、再读旧记录,最后到现场补课:真实世界强化学习开始挑战操作落地。

你教机器人倒水,最怕它一上来就靠摔杯子“积累经验”。模拟训练更安全,但模拟环境终究不是真厨房;只模仿人类,又容易被示范的质量限制。Kun Lei 等人发表于《Science Robotics》的研究,尝试让机器人先打好基础,再到真实现场谨慎练习。同期,Johannes A. Stork 也以《Beyond imitation》讨论机器人在真实世界学习的问题。

先学样子,再补经验

据 arXiv 论文摘要,团队提出 RL-100。它先用人类示范训练扩散视觉运动策略——一种把相机画面直接变成机械臂动作、并通过多步修正生成动作方案的模型。随后,机器人从已有记录中做迭代式离线强化学习;最后才在线操作,用真实反馈处理仍会失败的情形。

这条路线像学徒上岗:先看师傅示范,再复盘旧案例,最后在现场补课。关键是把高风险的盲目试错压到后段。离线阶段还用 Offline Policy Evaluation(离线策略评估)判断是否采用类似 PPO 的更新,意图让改进更保守、稳定。

现场成绩意味着什么?

论文摘要称,研究覆盖七类真实机器人任务,包括动态推物与保龄、倾倒液体和颗粒、折叠布料、旋拧,以及多阶段榨橙汁。作者报告,系统在所评估的 900 次真实机器人试验中全部成功,其中一项任务连续完成最多 250 次,并展示最长两小时不间断运行。

扩散策略通常要反复“去噪”才能决定动作,可能拖慢控制。团队加入轻量一致性蒸馏,把多步采样压成单步;作者称延迟约降低一个数量级,同时保持任务表现,完成速度接近或超过人类遥操作。

真正值得看的,是训练路线

这项工作的看点不只是“机器人学会了几项任务”,而是把模仿、低风险的离线改进和少量现场探索串成一条路线,正面回应真实世界学习的三道门槛:数据昂贵、设备可能受损、在线试错耗时。它提示我们,机器人走出模拟器未必意味着从零乱试,而可能是把最危险的探索留到最后,并用评估机制控制更新幅度。

局限与未知

  • 现有供稿没有论文全文、基线对比和现场条件,无法独立判断“全部成功”的适用边界。
  • 900 次成功、速度和延迟数据均来自 arXiv 摘要中的作者报告,尚不能据此推断系统可在任意场景自主学习。
  • Stork 的文章是否属于针对该研究的同期评论、与研究团队是否存在关联,供稿材料没有说明。

供稿材料 SOURCES — 2

← 返回 2026-07-25 · 学术板块