Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.085 — 2026-09-27
PAPER HF 6 约 7 分钟

InternW0:让世界模型边想边行动

InternW0让机器人一边预想未来、一边根据新画面和触觉改动作,把世界模型推向持续交互。

你让机器人倒一管液体。它先“想象”接下来会发生什么,刚准备动作,容器却被碰歪了;相机、触觉和控制器又各按自己的节奏更新。如果机器人必须停下来重算整段未来,它会反应迟缓;如果照旧计划执行,预测很快就会过时。InternW0要解决的正是这个问题:让世界模型边想边做,并用不断到来的新观测修正下一步动作。

这是上海人工智能实验室 InternW 物理世界模型系列的首个实例。所谓物理世界模型,就是从观察和动作中学习环境如何变化,让机器人能在内部预想“这样推一下,东西接下来会去哪”。研究团队进一步要求这种预想及时影响正在执行的动作,而不只是生成一段看起来合理的未来视频。

本刊此前介绍过联合预测环境变化和机器人动作的 OpenWAM,也讨论过不同步的传感器为何会破坏常见世界模型的假设。InternW0承接了这两个问题:同一个系统怎样在持续变化、信息并不齐全的现实环境里,同时预测与控制。

一套模型,两种节奏

InternW0把工作交给两个能力和速度不同的“专家”。高容量的 video expert 负责预测较长时间范围内的视觉变化;更轻量的 action expert 以更快的节奏生成连续机器人动作。两者采用非对称的 video–action 架构:视觉预测尽量保持通用,不直接读取特定机器人的动作标记或数据域身份;动作一侧则结合预测结果、最新画面、机器人自身状态、语言指令和特定机型接口来做决定。

它们通过 Flow Matching 联合训练。Flow Matching是一种训练生成模型的方法,可以理解为学习一条从随机状态逐步走向合理结果的连续路线。InternW0用它同时学习未来画面和动作序列,让“会发生什么”与“应该怎么做”共享表征,而不是两个互不相干的任务。

这种分工对应现实中的快慢节奏。相机、机器人状态、力和触觉不会同时刷新,控制也往往比完整的视频预测更频繁。InternW0采用异步多频处理:video expert较慢地更新长时预测,action expert则根据最新反馈连续生成短动作片段。第一份预测完成后,机器人可以继续执行,下一轮视频预测同时在后台计算。

不重画未来,而是修改它的用法

关键一步是:每次动作更新时,InternW0不重新生成完整未来。

video expert会留下逐层的 K/V——可以把它理解为模型处理预测内容时保留的中间线索。action expert复用这些线索,再通过 observation-conditioned context routing,也就是“由当前观测决定如何取用预测上下文”,为每个动作片段构造一份经过修正的视图。

具体来说,新画面先被编码成一组查询。它从缓存的预测中找出与当前状态有关的信息,再把这些信息送回原有视频位置,形成小幅残差修正。原始的长期预测不被覆盖;每个动作片段都根据刚看到的状态,得到自己的局部版本。

这像是拿着一张路线图前进。遇到临时障碍时,不必重新绘制整座城市,只需要按眼前路况调整下一个路口。这样既保留较长时域的方向,也避免机器人一直依赖已经过时的画面。论文把预测是否准确、是否与决策相关、是否来得及影响执行,并列为三个设计标准。

不同机器人,接入同一套骨架

机器人形态和控制方式差异很大。InternW0用领域专用的状态编码器、动作编码器与解码器处理这些差异,再给每个训练域配置 soft prompt——一小组可学习的提示信号,用来告诉共享模型当前面对哪类数据、机体和感知配置。缺失的输入通道会被置零并用有效性掩码排除,避免模型把“没有这个传感器”误解成“传感器读数恰好为零”。

预训练数据约为7,200小时,实际表中合计7,233.5小时、811,969段数据,来自七个数据集,覆盖真实机器人、仿真机器人和人类第一视角实验室视频。机器人动作和状态被映射到统一的37维表示;训练共划分25个域。数据采样按各域有效样本量的平方根加权,让大数据集获得更多机会,同时降低它们完全淹没小数据集的风险。

其中,团队采集的 EgoLab包含275.4小时、3,192段真实湿实验室第一视角视频,涵盖移液、称量、滴定、过滤、研磨、搅拌和清洗玻璃器皿等操作。它只提供视频监督,没有机器人动作标签。换句话说,这部分数据教模型观察实验过程如何展开,但不直接教它输出控制指令;带动作标注的机器人轨迹才同时训练 action expert。

接触不能只靠“看”

精细操作里,画面并不能说明全部情况。夹住没有、阻力多大、工具是否已经碰到容器,往往要靠力和触觉判断。InternW0因此加入 contact-aware post-training,即面向接触任务的后训练:action expert读取已有的力、触觉、视觉和机器人自身状态,同时预测动作以及接下来可能出现的接触反馈。

论文中的力学输出包含六个维度:三个力分量和三个力矩分量。历史信号告诉系统刚才发生了什么接触,预测信号则表示接下来可能承受什么载荷。团队强调,这些新增接口不需要改动共享的视频预测骨架。

评测覆盖仿真和真实科学任务。已披露的真实任务包括一套15阶段的金属有机框架合成流程,以及一套面向通用定量移液、包含5个阶段的接触与力感知灵巧操作。这里的15和5都是工作流阶段数,不是成功次数。

仿真部分包括单臂操作基准 LIBERO和50项双臂任务组成的 RoboTwin 2.0。论文对 LIBERO的40项任务各执行50次,并报告四个任务组的平均成功率。已给出的表格显示,InternVLA-M1平均为95.9%,GR00T-N1.7为96.9%;但供稿在 InternW0对应结果出现前截断,因此不能据此判断它是否领先这些对照模型。

为什么值得关注

InternW0真正有意思的地方,不是“视频生成得更像”,而是重新安排预测和行动的关系。长期预测负责提供方向,快速控制负责应对眼前变化,新观测则不断改变动作端读取预测的方式。它把世界模型从一次性生成未来画面,推进到持续交互中的可执行上下文。

这也解释了为什么实验室任务是一个合适的试验场:流程长、步骤多,移液等操作又高度依赖接触反馈。模型既要记得实验正进行到哪里,也要在工具与样品发生细微接触时及时调整。若这套快慢协作方式能够稳定工作,它瞄准的正是世界模型进入真实环境时最难绕开的门槛。

局限与未知

  • 上述架构、训练数据和评测均来自研究团队论文,尚缺独立复现。论文所称“foundational”“universal and efficient”属于作者定位;仅凭现有材料不能把它们写成已经验证的普适性或效率优势。
  • 供稿中的结果表不完整,无法获得 InternW0在 LIBERO及其他基准上的具体成功率,也不足以比较速度、精度、统计显著性或确定其是否领先。
  • 论文展示了多种机器人数据、仿真任务和科学流程,但这些覆盖面还不能回答模型面对全新机体、意外扰动或长期连续运行时能否稳定泛化。

供稿材料 SOURCES — 1

← 返回 2026-09-27 · 学术板块