球在滚,机器人也得边跑边想
追一个滚动的足球时,人不会先停下来算好路线,再照计划走完。我们会一边跑,一边根据球的新位置调整步幅和方向。人形机器人也要做到这一点:把看到的画面、下一步决定和全身动作连成实时回路。
发表于 Science Robotics 的这项研究,正是要学习这种“视觉驱动的反应式足球技能”。论文作者来自清华大学、ByteDance 与中国农业大学。据 arXiv 与 Dryad,预印本于 2025 年 11 月公开,相关数据于 2026 年 7 月发布。现有结果主要来自论文及配套数据,仍属单一来源主体。
不再让三个模块排队
传统做法常把感知、规划和控制拆开:先识别球,再计算路线,最后驱动身体。研究团队换了一种思路。据 arXiv 摘要,他们把视觉感知和运动控制直接接入同一个强化学习控制器。强化学习(Reinforcement Learning, RL)就是让机器人在仿真中反复试动作,再根据踢球是否成功、身体是否稳定等奖励修正策略。
这形成了“感知—动作闭环”:机器人不是执行一套固定动作,而是根据机载视觉的新画面持续调整。Zenodo 的数据说明称,策略仅靠机载视觉,就能找球、追球和向多个方向踢球。
训练先在仿真中完成,再部署到真实机器人,这叫 Sim-to-real。难点是虚拟世界总比现实干净。Dryad 说明显示,团队用虚拟感知系统模拟视觉噪声和检测失败,并以 Adversarial Motion Priors——一种引导动作更接近自然运动的训练方法——约束机器人动作。
为什么足球是块试金石
足球把问题压缩到几秒之内:球会滚,视角会晃,机器人还得保持平衡。公开摘要报告,与规则式基线相比,球位置估计误差降低 46%,最快踢球用时缩短 64%,前场位置的踢球成功率约为 90%。这些数字意味着,改进不只发生在“看见球”,也延伸到及时完成动作。
据 Dryad 数据集 README,实验还包含真实 RoboCup 比赛。RoboCup 是始于 1990 年代的国际机器人足球赛事与研究倡议,常被用来综合检验自主机器人的感知、协作和运动控制。数据覆盖不同初始球位、滚动速度和接近角度;其中真实初始球位实验每个条件汇总 10 次试验。
局限与未知
- 现有材料没有说明真实比赛的完整赛制、对手配置,以及是否使用标准足球。
- “找球、追球和踢球”仍不等于完整比赛能力;材料未提供团队协作或整场胜率。
- 效果数字来自论文摘要及同一研究主体的配套数据,尚无独立信源交叉验证。