你让一个数字人照着录像上楼,它不能只学会“把腿抬高”。它还得知道台阶在哪里、脚何时落下,以及换成另一副身材后,这套动作会不会穿过地面、扯断肌腱或踩空。问题是,许多动作数据只记录人怎么动,并没有同步记录周围的坡道、台阶和椅子。
TERRA 想把这块缺失的信息补回来。它从身体运动轨迹反推与动作有关的支撑地形,再把动作迁移到由肌肉驱动的数字身体上,最后训练一个控制器执行这些动作。换句话说,它把“看懂动作、猜出地形、换一副身体重演、真正控制肌肉”串成了一条流水线。
本文数字与效果均来自 TERRA 论文及其作者实验,尚不能视为独立复现或多方验证。
身体动作也在泄露地形
TERRA 的关键判断很直观:即使画面里没有地形,身体也会留下线索。
一只脚在某个高度短暂停住,通常意味着那里存在支撑面。脚掌的倾斜方向,可以帮助区分斜坡和平面。脚在两次落地之间如何抬起,则能进一步判断它是在顺着坡面移动,还是跨过一级台阶。与此同时,身体经过但没有碰撞的空间构成“负自由空间证据”——既然小腿从这里摆过去,这里就不该突然多出一块实体。
系统把这些线索与四类地形先验结合。所谓地形先验,就是预先规定几种可解释的基本形状:独立支撑块、斜坡、楼梯和座椅。它不是从零雕刻整个场景,而是像拿着几套积木模板,根据落脚点、脚掌方向和身体扫过的空间,选择并调整最合适的一套。
这一步解决的是“动作重建”中的环境缺口。动作重建通常从录像、动捕点或人体轨迹恢复姿态,却不会直接告诉系统地面长什么样,更不会告诉它每块肌肉出了多少力。
换一副身体,不能机械照抄
地形补齐后,TERRA 还要做动作重定向——把一个人的动作迁移到比例、关节和力量条件不同的数字身体上。它类似让不同身材的人学同一段舞:动作意图可以相同,但不能逐个照抄关节角度。
论文使用的 MyoFullBody 模型包含 354 个肌肉—肌腱执行器和 83 个 MuJoCo 关节。肌骨模型不直接命令膝盖转到某个角度,而是要求控制器协调肌肉和肌腱来产生运动。因此,一段在人类动捕数据里看似正常的动作,迁移后可能出现脚底打滑、身体穿进台阶、双腿互相碰撞,或肌腱长度突然跳变。
TERRA 在重定向时同时照看三类约束。第一类是解剖约束,避免关节和身体结构进入不合理状态;第二类是肌腱连续性,避免肌腱状态突然断裂式变化;第三类是接触约束,让脚在该踩住时踩住,并为摆动中的脚留出越过地形的空间。检测到坐姿时,它还会让骨盆后侧与重建出的座面接触。
这些修正不是装饰。去掉 TERRA 专门加入的残差约束后,接触时序 F1 为 88.49%,地形穿透比例为 33.45%;完整方法把两项分别变为 93.80% 和 0.16%。这里的 F1 用来综合衡量该接触时有没有接触、以及不该接触时有没有误接触。
一套肌肉控制器,处理四类地形
研究从 5 个动作捕捉数据集整理出运动—地形配对数据。用于控制训练的总运动时长为 9.4 小时,包含平地、坡道、楼梯、平台和座椅相关动作。研究者随后用强化学习训练一个统一的肌肉驱动策略。强化学习可以理解为让控制器反复尝试,并依据动作是否跟得上参考轨迹获得奖励。每个策略训练 40 亿步,论文报告的设置使用 8192 个并行环境,并在 4 张 A100 GPU 上训练约 20 小时。
控制器不只读取身体关节和肌肉状态,还接收以骨盆为中心的局部高度图,以及未来 0.2、0.4、0.6 和 0.8 秒的动作目标。它因此既知道身体现在怎样,也能提前看到附近地形与即将执行的动作。
地形重建实验中,TERRA 对坡道、楼梯等地形类别的总体识别准确率为 99.9%;去掉脚掌方向和摆脚净空线索后,这一数字降到 73.5%。这说明真正有价值的不只是“脚停在哪里”,还有脚如何朝向、如何跨向下一处支撑。
在 993 段缺少场景几何的 AMASS 非平地动作上,TERRA 的接触高度平均绝对误差为 10.24 毫米;接触最小二乘基线为 47.46 毫米,Voronoi 高度场基线为 25.57 毫米。它对抬高支撑面的识别 F1 为 93.9%,两项基线分别为 62.9% 和 81.1%。
最终的留出测试更能说明闭环是否成立:训练时未见过的动作能否真的跑完。总体上,TERRA 的完成率为 87.59%,高于 OmniRetarget 的 80.29% 和 TERRA+Voronoi 的 82.16%。但优势并非覆盖每个场景。TERRA 在平地、坡道、独立平台和座椅上完成率最高;楼梯上则是 TERRA+Voronoi 更高,为 85.01%,TERRA 为 81.90%。TERRA+Voronoi 的总体姿态误差也更低:MPJPE——各身体关键点位置误差的平均值——为 71.65 毫米,TERRA 为 74.47 毫米。也就是说,TERRA 更常把动作做完,却不总是跟得最精确。
为什么值得继续看
TERRA 的意义不只是让数字人会爬楼梯。它展示了一条数据利用路线:旧动作库即使没有同步场景,也可能从身体轨迹中恢复出足够的支撑几何,再用于训练肌肉级控制器。这让动作数据、身体差异与环境接触不再是三个割裂的问题。
肌肉级控制也提供了另一层观察窗口。论文把策略产生的肌电活动和垂直地面反作用力,与平地、坡道、楼梯及坐下起立的人体记录做了定性比较。结果既有波形时序上的相似,也有明显不匹配。作者因此只把它视为未来研究生理过程的一条可能路径,而不是已经验证了数字肌肉等同于人体肌肉。
局限与未知
- 标题中的“走向真实地形”应理解为开始处理多种非平坦地形。论文材料没有说明已在真实机器人、真实人体或户外环境完成验证。
- 当前地形由静态的简单几何体组成,重点覆盖坡道、楼梯、独立支撑面和座椅。动态几何、移动表面与在线动作重定向仍是作者明确列出的开放问题。
- 生理信号比较经过逐条最小—最大归一化,重点是波形形状和时序;论文也明确报告了相似与偏差,不能据此推断肌肉用力大小已经逼真复现。