你让机器人把桌上的杯子拿起来,它不能只认出“这是杯子”。它还要知道杯子在三维空间中的位置、夹爪该碰哪里、以什么角度靠近,以及接下来怎样移动。RynnBrain 1.1想把这些原本分散的能力装进同一个模型,并把模型规模从20亿参数一路推到总参数约1220亿。
这次值得关注的,不只是数字变大。具身AI——面向机器人等“有身体”系统的人工智能——正在沿着大语言模型的规模化路线扩张,但它还必须把视觉理解落到真实空间和动作上。RynnBrain 1.1试图同时推进两件事:扩大模型容量,并让训练输出更接近机器人真正能用的操作线索。
本文数据与比较均来自论文作者的技术报告,尚无第二个独立信源交叉验证。尤其是领先幅度和真实机器人效果,需要把它们视为作者报告的结果。
“千亿级”究竟是什么意思?
RynnBrain 1.1包含2B、9B和122B-A10B三个版本,均以Qwen3.5相应型号为基础,并采用统一的时空与物理基础训练框架。
标题里的“千亿级”需要拆开看。122B-A10B通常表示模型共有约1220亿参数,但每次处理输入只激活约100亿参数。这是稀疏MoE——“混合专家”模型——常见的标法:模型像一个拥有许多专科部门的机构,每次只调动其中一部分。它有千亿级总容量,却不等同于每次都调用1220亿参数的稠密模型。
三个版本共享整体架构、训练方式和输出规范。模型把图像、视频和文字整理成同一串信息,再用同一种自回归方式逐步生成文字、边界框、点位和轨迹。通俗地说,它不再把“描述画面”和“指出位置”交给两套互不相干的系统,而是让语义理解与空间定位在同一套表达里学习。
时空训练负责让模型连接不同时间的画面,例如记住物体是否仍在原处、怎样移动。物理落地训练则要求模型不要只说“可以抓杯子”,还要输出杯子所在区域、可操作位置或运动轨迹。
从“看见杯子”走到“该碰哪里”
相较RynnBrain 1.0,1.1全系列新增了接触点预测。旧版用一个旋转矩形描述平面抓取,但论文认为,同一物体往往有多个有效抓法,矩形的宽高又容易受夹爪结构和数据标注习惯影响。两个功能等价的抓法,可能因为矩形重合度不高而被判得很差。
新版改为预测抓取中心点和夹爪在图像平面内的旋转角度。它更像告诉机器人“从这里、朝这个方向接触”,而不是要求模型画出一只特定夹爪的完整轮廓。团队从五类数据源经过渲染、投影和筛选,得到260万条训练样本。
不过,这还不是一套可直接执行的完整抓取姿态。论文明确说明,深度、接近方向、夹爪开合量、碰撞约束和机器人运动学,仍由下游操作策略处理。
2B和9B版本还加入了原生3D grounding——三维指代落地。模型接收图像、文字指令和相机内参,直接预测物体在相机坐标系里的三维框,包括中心、尺寸和朝向,共9个数值。它不只回答“杯子在画面左边”,还尝试给出杯子在真实空间里的位置与方向。
这部分训练混合了两类互补数据:一类覆盖广,但由二维标注自动提升到三维,仍可能有噪声;另一类来自合成环境,几何信息更准确,但对象覆盖较窄。论文列出的相关数据规模包括WildDet3D Essential的102,979张图像、过滤后37.4万条人工核验标注,以及FoundationPose的184.9万张合成图像。
不同机器人,先说同一种“动作语言”
基础模型最终要接到VLA上。VLA即视觉—语言—动作模型:它看到环境、理解指令,然后直接预测机器人动作。
难点是,不同机器人身体不同。有人形机器人的手指、双臂机器人的夹爪和灵巧手系统,控制维度无法直接对齐。RynnBrain-VLA为此建立统一的跨具身动作空间,把动作按左臂、右臂、夹爪、灵巧手、躯干和头部等语义分组;再用“具身专用掩码”,只启用某台机器人实际拥有的部分。
这像设计一张覆盖全身的控制面板。每台机器人只点亮自己装有的按钮,其他按钮保持关闭。这样,不同机器人的轨迹可以放在同一批数据中训练;共有的双臂移动、抓取和协作经验可以共享,不兼容的控制维度又不会被强行对齐。
团队把这套系统部署到Unitree G1、Astribot-S1和Tianji-Wuji三种平台。模型每次预测32步动作,但执行5步后就重新观察和推理,并参考上一段尚未执行的动作,使相邻动作块尽量平滑。
规模变大,能力是否真的跟着涨?
论文报告了一些清楚的递增趋势。在多视角与空间推理测试MindCube上,2B、9B和122B-A10B分别得到61.7、86.9和89.6;MMSI则从40.5升至47.0和52.0。语言指令空间定位测试RefSpatial-Bench从58.5升至67.2和79.1。
与旧版相比,9B在十个共有认知基准中的八个上领先。比如MindCube从56.6升至86.9,RynnBrain-Spatial从59.9升至67.9。2B的进步没有这么整齐:MMSI从34.1升至40.5,但若干RoboSpatial与EmbSpatial结果仍低于旧版2B。这一点很重要,它说明“模型和训练更新后处处更好”并不是论文数据支持的结论。
作者还称,122B-A10B在VSI-Bench、MMSI和RefSpatial-Bench上超过所有受评测的闭源与开源模型。真实机器人对照实验中,以RynnBrain初始化的策略也优于Qwen-based策略和论文选取的代表性通用VLA;联合进行多任务、多具身训练时,平均过程分和最终成功率高于逐任务单独微调。
这些结果把规模化与实际动作训练连了起来:更大的模型不只是回答空间问题,还被用作机器人策略的初始化底座;不同身体的数据也开始进入同一策略共同训练。我们7月10日报道RynnWorld时,重点还是用生成式数字世界制造机器人训练数据,并把人的动作重定向到不同机器人。RynnBrain 1.1则把问题推进到模型内部:怎样用统一表示承接这些数据,并把理解转换成三维位置、接触点和动作。
局限与未知
- 论文没有给出“超过全部受评模型”这一概括所对应的完整分数、误差范围、实验次数和统计显著性,不能据此判断领先是否稳定。
- 真实机器人优势与联合训练收益缺少具体提升数值;“已部署”也不等于已经达到稳定量产或通用自主操作水平。
- 原生3D grounding目前只提供给2B和9B版本。122B-A10B虽参与主要规模比较,但材料没有说明它何时或如何获得同等的原生三维能力。
RynnBrain 1.1最值得记住的变化,因此不是简单的“机器人模型也做到了千亿参数”。更准确的说法是:它把总容量推到122B-A10B,同时把时间记忆、三维定位、接触线索和跨机器人动作训练放进一条相对统一的路线。规模化的大门已经推开,但模型是否能在更多真实环境中稳定转化为可靠动作,仍要等待更透明的评测与独立验证。