Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.051 — 2026-08-24
PAPER H 9 · HF 12 约 1 分钟

VLA用自主探索补上新任务数据

EXIMO让VLM带机器人先探索、再用成功经验微调VLA,减少新任务对人工示范的依赖。

教会机器人“把香蕉放进碗里”不算难;换成“把猴子爱吃的水果放进碗里”,它却可能卡住。难点不是不会抓放,而是不懂怎样把陌生目标拆成自己会做的步骤。EXIMO瞄准的正是这道坎:让机器人少等人手把手示范,先自己收集有用经验。

它分三步走。探索时,VLM(视觉语言模型,能同时理解画面和文字)充当规划者,把长任务拆成较短的自然语言指令,再交给VLA——一种把画面、语言指令直接转成动作的模型——执行;系统只保留被环境判定为成功的过程。随后,VLA用这些经验微调,也就是在原有模型上继续训练;最后再用强化学习做动作修正。

作者在模拟环境的22项操作任务上报告,VLM引导提高了数据利用效率,完整方法也优于基础VLA及若干对照方案。值得注意的是,这条路线目前依赖环境提供准确的成功判定;论文把改用VLM判断成败列为未来方向。


供稿材料 SOURCES — 1
01
EXIMO: VLM Guided Exploration of VLA Policies arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-24 · 学术板块