机器人长期在办公室里工作,如果每经过一次桌椅都把细节重新记一遍,地图会越堆越大,处理新画面也会越来越慢。JITOMA 想把建图改成“用到哪,长到哪”:平时只保存稀疏、低成本的环境线索,任务来了再补齐相关区域,而不是先精细测绘整座“城市”。
具体说,它先用任务热力图——标出哪些位置更值得关注的优先级图——筛选连续视频,只留下少量关键画面和休眠的“锚点”。收到指令后,大语言模型(LLM,即理解文字并辅助推理的模型)判断机器人想做什么,再唤醒相关锚点;物体描述、功能关系推断等高成本操作,只在这块局部三维场景图中进行。三维场景图把环境写成“杯子在桌上”这类对象及关系,便于查询和规划。任务切换时,旧区域重新休眠,新区域再展开。
作者称,这种做法能缩小活跃地图、降低描述生成延迟,并让长程任务切换时的处理时间保持稳定。不过,现有材料未给出完整实验数字,因此实际节省幅度仍待进一步核对。