你拿起杯子时,不只是手臂在动:双腿要站稳,躯干会微调,另一只手也可能帮忙保持平衡。对人形机器人来说,这种看似随意的动作很难,因为它必须同时协调许多关节。SONIC瞄准的正是这个瓶颈:用更大规模的人类动作数据和训练算力,构建更通用的全身控制器。
把动作示范变成练习题
这项工作的核心是运动追踪(motion tracking)——给控制器一段目标人体动作,让机器人尽量跟上,同时保持平衡,动作也要符合机器自身的物理条件。
动作捕捉数据会把真人各部位的位置和姿态记录成数字轨迹。它不能直接塞给机器人照抄,却可以变成密集的训练信号。机器人由此学习“人通常怎样自然地动”,也就是运动先验;面对新指令时,它不必从零摸索腿、躯干和手臂如何配合。
据项目官网,SONIC把运动追踪控制器从约120万参数扩大到4200万参数,并使用超过1亿帧、约700小时的高质量动作捕捉数据。这里的“参数”可以理解为控制器内部可调整的旋钮:数量增加,不等于能力必然提高,但意味着模型有更大的学习容量。
一个控制器,接多种指令
项目官网称,SONIC用单一统一控制策略处理机器人动作、人类动作及混合动作指令,并用共享的Token空间连接不同输入。Token可以理解为控制器通用的“动作词汇”:无论指令来自游戏手柄、VR遥操作、人体视频、音乐,还是VLA模型——把视觉、语言与动作联系起来的模型——最终都交给同一套控制策略执行。
研究还加入实时运动学规划器,把动作追踪接到导航等目标任务,并演示由VLA模型驱动、需要手脚配合的移动与操作。值得关注之处正在这里:SONIC尝试把“会模仿许多动作”变成可被不同上层系统调用的全身运动底座。
局限与未知
- “Supersizing”是论文的研究定位。现有材料没有基线、成功率或泛化结果,不能据此断言性能显著提升。
- 专题所说的“动作库”是宽泛概括;材料只确认其使用大规模动作数据,并未说明发布了可下载动作库。
- 训练规模存在版本差异:项目官网写约2.1万GPU小时,较早的arXiv摘要写9000 GPU小时。刊期也有不同口径:Science Robotics条目标为2026年8月,NVIDIA Research页面则称2026年7月发表。