Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.036 — 2026-08-09
PAPER 约 1 分钟

VLA实时推理也能投机执行

Deltoris只算连续画面的变化,再先猜后验,把扩散式VLA推向实时控制。

机器人端起杯子时,不能算完一步就停下来等模型。VLA(视觉—语言—动作模型)要把画面和指令直接变成控制动作,通常每秒更新50至200次;但扩散式VLA要像反复修改草稿一样,多轮去噪才能生成动作,移动端往往跟不上。

Deltoris抓住一个朴素现象:控制间隔很短,相邻画面变化也很小。作者实验中,连续帧常有超过98%的像素不变。系统因此采用“比特级稀疏”——只计算输入变化后仍活跃的二进制位,最多减少92.9%的运算。可少算之后,频繁搬运中间数据又会拖慢系统;于是轻量VLA先猜出多个未来动作,再由更可靠的大模型统一核验,摊薄数据读取成本。未经核验的动作不会交给机器人执行。

作者称,配合专用加速器,Deltoris在三种VLA模型上保持相近任务成功率,相比移动GPU最高加速34.2倍、相比既有专用加速器最高6.1倍。这个结果来自论文原型评估,尚不能等同于各类机器人上的普遍实测表现。


供稿材料 SOURCES — 1

← 返回 2026-08-09 · 学术板块