给 AI 几张房间照片,它既要搭出立体结构,又要认出不同画面里的同一处,还要回答“椅子是否挡住桌子”。以往,这些工作常由多套专用模块接力完成。SPARGen则尝试把它们都改写成同一种事:模型读图和指令,再直接生成所需结果。
关键在于,它没有强迫所有答案采用同一格式。深度图、点图和光流——分别描述远近、三维位置及像素如何移动——保留为与原图对齐的图像式表示,交给模型原有的图像生成通道;相机姿态和空间问答等较紧凑的结果,则写成一串符号或文字,由文本生成通道输出。两条通道共享同一个多模态骨干,因此三维重建、稠密对应(在两幅图中逐像素寻找同一位置)和空间推理可以共同训练,而不必另接任务专用的预测头或外部几何模块。
作者称,单个 SPARGen 在多类基准测试中达到有竞争力的表现,并观察到不同训练任务之间存在正向作用。论文材料未给出足以在此展开的具体数字;眼下更值得关注的是这条路线本身:空间能力或许能成为多模态模型的原生生成行为,而不再是一组后装工具。