你让机器人铺床,它不只要认出床单、听懂指令、控制手指,还得移动双臂和躯干,同时保证双腿站稳。过去,这些能力往往分散在不同系统里,每项技能也可能需要单独训练。UnifoLM-WLA-1.0 想做的是另一条路:用同一个模型,把看、听、判断和全身行动串起来。
这正是视觉—语言—动作模型(VLA)所追求的方向:模型接收摄像头画面和语言指令,再直接输出机器人动作。供稿所依据的一篇 Reddit 帖子称,这个模型规模为 6B,即约 60 亿参数,使用约 2,500 小时真实机器人数据训练,覆盖 64 项任务。不过,目前没有收录项目官网、论文或代码仓库的原始材料,以下技术与效果信息都只有这一处独立信源支持。
一个模型,管到手脚
帖子把 UnifoLM-WLA-1.0 称为通用人形机器人基础模型。所谓“基础模型”,目标不是只练会一个动作,而是从大规模、多任务数据中学到可以迁移的能力,减少“每项技能单独配一套策略”的需要。
这 64 项任务被分成两组:10 项全身任务和 54 项桌面任务。全身控制不只是让机器人迈步。它要求躯干、双臂、双腿等多个关节协同;机器人伸手拿东西时,还得同时处理重心与平衡。桌面任务则更强调手臂和手部的精细操作。帖子还称,同一模型支持平行夹爪和两种不同的灵巧手。
官方演示据称展示了 Unitree G1 铺床、把衣物装入洗衣机、叠衣服和分拣物体。这里最值得看的不是某个动作有多吸睛,而是这些动作是否真由同一套模型完成。若这一点成立,它代表人形机器人正在从“技能节目单”转向一套较统一的控制系统。
它怎么把“想做”变成“做出来”?
按帖子描述,系统以 UnifoLM-ER-1 为基础。这是一个基于 Qwen3-VL 的具身推理器——“具身”指 AI 不只在屏幕里回答问题,还要借助机器人身体感知环境并采取行动。
模型还会预测画面中接下来可能发生变化的区域。它使用 optical flow(光流,用相邻画面中像素的移动估计物体运动)和 VQ-VAE(一种把复杂视觉信息压缩成离散表示的方法)来完成这一步。可以把它理解为:机器人不只看当前这一帧,还试着判断手臂、衣物或其他物体下一刻会往哪里动。
控制动作本身也被分成两步。系统先用 residual VQ,把末端执行器、手部和下肢的动作离散化。末端执行器就是机械臂最前端真正接触物体的部件,例如夹爪或手。离散化近似于先从一套动作“词表”里选出基本动作,再用残差逐层补足细节。随后,MMDiT action expert 继续生成连续控制信号,让动作不只停留在几个固定档位,而能平滑执行。
为什么值得关注?
具身智能比聊天模型多了一层现实约束:一句回答不够准确,可以重新生成;机器人动作偏了几厘米,却可能碰撞、失去平衡,或者抓空。人形机器人又把移动、站立和操作叠在同一副身体上,因此,用一个模型同时覆盖全身任务与桌面任务,本身就是更难的目标。
这种变化也回应了公众印象与研发现实之间的落差。美联社、Le Monde 和《华尔街日报》曾报道 Unitree 机器人登上春晚,展示跳舞、舞剑、越桌和空翻等节目。观众看到的是一个动作完整的“角色”,研究团队面对的却是另一道题:如何让机器人理解陌生指令和现场环境,再把运动、视觉、语言与操作收进更通用的模型。UnifoLM 所代表的,正是从编排好的展示向通用控制继续收敛的尝试。
局限与未知
- 目前材料无法核实 Unitree、UniGen-X 与作者团队之间的准确关系,因此不能把 Reddit 帖子的发布主体描述当作已经确认的官方归属。
- “覆盖 64 项任务”可能指训练或演示范围,不等于这些任务都在统一成功率门槛下稳定完成。演示视频也不能单独证明泛化能力、实时性,或无需任务专用微调。
- 帖子称模型在具身智能基准上超过许多开源模型,并具有较强空间推理能力,但没有提供基准名称、对手、分数和统计条件;约 2,500 小时数据的统计与去重口径也未披露。