Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.068 — 2026-09-10
PAPER H 33 约 1 分钟

VLA在线强化学习瞄准精细操作

让机器人边做边学,同时校准判断,在精细操作中兼顾成功率与训练效率。

让机器人反复完成倒液、取放这类精细操作,难点不只是“会做”,而是每次都做准。视觉—语言—动作模型(VLA,把画面和文字指令直接转成动作)虽有通用能力,一到真实环境仍容易被细小误差绊倒;直接在线试错又慢又贵,错误反馈还可能把原本会的动作练坏。

VLA-Precision 的关键是“非对称协同自举”:训练早期先快速吸收成功动作和人工介入示范,提高后续试错质量;经验积累后,再结合整段任务回报与局部动作偏好,逐步校准价值信号——也就是判断“照这样做下去有多大机会成功”。更新策略时还参考原有模型,抑制策略漂移。配套的 ACoB-Stream 则复用冻结的视觉语言上下文,并按需传输训练状态,减少大模型反复计算。

作者报告称,该系统在四种机器人上的九项高精度化学操作中,平均成功率为 98.3%,每项任务训练 45.8 分钟;系统吞吐与计算效率最高提升 10.9 倍。这些结果来自论文作者的实验,材料未披露独立复现情况。


供稿材料 SOURCES — 1

← 返回 2026-09-10 · 学术板块