像司机换了一辆陌生车,需要先摸清刹车和转向的手感,AI 到了新环境也会遇到类似问题。它脑内的世界模型——根据当前状态和动作预测下一步的“环境模拟器”——可能随之失准,规划也就不再可靠。重新训练整套模型既慢,又需要大量现场数据。
CLAW 的做法,是预先训练一个超网络——专门为另一个神经网络生成参数的模型。部署后,它读取少量现场交互记录,只做一次前向计算,就为世界模型各层生成 LoRA 适配器。LoRA 是一小组低秩附加参数,相当于不改动原模型,只装上轻量的校准件。这里的“摊销式”是指:如何校准的学习成本已在预训练阶段付过,换环境时无需再用梯度反复优化。
作者在动力学、机器人形态和奖励设置有所变化的移动与操控环境中测试 CLAW,并称它仅用数秒测试数据,在线适配表现优于梯度更新和上下文学习,也较少在数据稀缺时过拟合。值得注意的边界是,新环境来自预训练时已知的环境家族;论文摘要未给出更具体的提升数字。