Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.063 — 2026-09-05
PAPER H 1 约 1 分钟

VLA开始学习可复用动作程序

REFACTOR-VLA让机器人自行整理可复用的动作套路,用“程序积木”组合长任务。

让机器人完成一串长操作,如果它每次都从头计算关节怎么动,就像做菜时逐字重读菜谱:经验难复用,前面的小错也会一路累积。REFACTOR-VLA想把这些零散动作整理成“动作程序”——可反复调用的动作套路。它面向VLA(同时看画面、理解指令并控制机器人的模型),无需人工逐段标注技能,就能从示范轨迹中归纳程序库。

系统会比较两段动作在学习到的环境模型中是否产生相近结果,而不只看动作轨迹是否相似;再把重复结构编成“带类型”的程序,像规定积木接口,只有输入输出匹配才能组合。候选程序还须通过压缩收益和任务回报保持两道检查。论文称,在LIBERO基准上,系统最终收录了3个抽象动作程序,其中2个被控制器实际调用,并用程序库改写了抽取的全部256条示范。这说明VLA不只能输出原始控制量,也可能开始积累可组合的动作经验;不过这些效果目前仅据论文作者报告。


供稿材料 SOURCES — 1

← 返回 2026-09-05 · 学术板块