Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.056 — 2026-08-29
NEWS 约 4 分钟

12帧记忆,重建万帧3D世界

高德ABot-Recon只保留最近12帧,让万帧级3D重建更快、更省,也更不易漂移。

IMAGE — 量子位

你拿手机穿过一座商场,镜头不断拍下走廊、店铺和转角。要让机器人把这些二维画面实时拼成三维地图,难点不只是“看见”,还要始终知道自己走到了哪里。视频越长,历史信息越多,系统往往越慢、越占显存,小误差也会一路累积。高德8月28日发布的ABot-Recon,试图用一种更轻的办法解决这个问题:持续接收视频,但每次只看最近12帧。

需要先说明,现有材料来自高德官方供稿,相关性能数字尚无独立信源交叉验证。

12帧不是全部输入

“以12帧重建万帧世界”很容易引起误解。ABot-Recon并非只输入12张图片,就凭空生成一万帧场景。它仍然持续接收单目RGB视频——也就是普通摄像头拍到的彩色画面,只是处理每个时刻时,仅保留最近连续12帧作为局部上下文。

这绕开了所谓长程依赖:当前预测需要反复查阅很早以前的信息。传统流式3D重建——一边接收画面、一边更新三维地图——常设置记忆锚点,保存、检索并融合历史状态。序列拉长后,这套“翻旧账”机制会增加计算和显存负担。

ABot-Recon不保存持续增长的学习式长程记忆。高德称,它的内存占用和单帧计算量因此不会随视频长度增长。但这不等于整个系统没有历史状态,也不代表累计处理成本或最终地图的存储恒定:模型仍需在线组合此前得到的轨迹和场景。

先拼小段,再接成长路

它采用“局部位姿预测+残差优化”。位姿指相机在三维空间中的位置和朝向。系统先预测当前相机坐标系里的局部点云——一组描述物体表面空间位置的点——以及相邻帧之间的相对位姿,再把这些局部结果逐步接成全局轨迹和三维场景。

可以把它理解为测量一段很长的步行路线:每次只判断刚走过的一小段,再连续拼接,而不是不断回看从起点至今的全部记录。

问题在于,每一步哪怕只偏一点,接上几千次也会形成明显漂移。高德称,ABot-Recon在预测端加入运动—视觉旋转细化,并在训练中使用面向位姿合成的损失约束,通过纠偏机制压低误差累积。这里的“无长程依赖”,准确说是不用不断扩张的长程记忆锚点,而不是完全抛弃全局轨迹。

为什么值得关注

按照高德披露的结果,ABot-Recon在Oxford Spires长序列基准上,平均轨迹误差比LingBot-Map低40.6%;相对旋转误差RPE-R为0.12°,较其所称的前代SOTA降低约40%。SOTA指特定评测条件下的当前最佳结果。

在KITTI-02测试中,它达到24.45 FPS,即每秒处理24.45帧,速度为所选行业代表方法的1.24倍。官方还称,其峰值显存约6.71 GB,约为同类模型的三分之一,并可在GTX 1080 Ti消费级显卡上运行。

如果这些结果能在统一条件下复现,价值不只是一项指标领先。固定大小的局部窗口意味着设备运行得更久时,单帧负担不会跟着历史长度膨胀。对自动驾驶、机器人和空间智能而言,这提供了一条明确的工程路线:不把所有旧画面留在模型的“脑中”,而是提升局部运动估计和在线拼接的可靠性。它只需单目RGB视频,也降低了对额外深度传感器和已知相机参数的依赖。

局限与未知

  • “首个”“最低误差SOTA”“吞吐最高、显存最低”等说法均来自高德,公开供稿没有完整限定比较范围、基线版本和统一实验设置。
  • 40.6%、1.24倍和约三分之一等数字缺少分辨率、硬件及软件环境等完整条件;不同数据集上的指标也不能直接横向比较。
  • 6.71 GB峰值显存不能单独证明所有GTX 1080 Ti环境都能顺利运行,仍取决于输入规格和算子支持。

高德已在GitHub开放推理及评测代码和权重,并在魔搭社区提供体验专区。接下来更关键的,不是“12帧”这个醒目数字,而是第三方能否在相同设置下复现实验,并检验它面对更长、更复杂真实环境时的稳定性。


供稿材料 SOURCES — 1

← 返回 2026-08-29 · 科技板块