教机器人做新任务,过去常要重新采集数据、训练模型。现在,一些团队想换个办法:先让机器人看人演示一遍,再照着完成。这里的 In-Context Learning(上下文学习)指模型不修改参数,只从当前输入的示例里临时学习;示例不只是文字,还包括视频、视觉观察和动作历史。
据量子位报道,Skild AI 的 S1 可接收最长 10 分钟、包含几十步操作的演示。在未见过的任务上,加入视频上下文后,表现约为只用语言指令的 7 倍;但在训练数据仅 1000 小时时,语言指令仍然更好,数据规模增加后,视频上下文才反超。这个结果提示,机器人的新 Scaling(通过扩大某个维度持续提升能力)方向,可能不只是堆训练数据,也包括让模型读懂更长、更复杂的多模态上下文。
Generalist AI 的 GEN-1.5 也展示了看一次示范、无需微调便适配任务的能力。不过,两家公司尚未完整公开技术细节,现阶段更适合把它看作值得跟踪的路线信号,而非已经验证成熟的通用方案。