现在的多模态 AI,大多像是“先让眼睛整理画面,再让大脑回答”:视觉编码器先把像素提炼成物体、形状等特征,语言模型再接手。新研究追问,如果把这双预先训练好的“眼睛”拿掉,让模型直接从原始像素学起,规模做大后能否追平传统方案。这关系到视觉和语言能否真正由一套架构统一处理。
作者用 11 个稀疏 MoE 模型做对照——MoE 是每次只调用部分“专家”模块的架构,总参数从 11 亿到 440 亿。结果显示,无视觉编码器的模型在小规模时表现较差,也需要把更多算力投入扩大模型;但随着训练计算量增加,它的多模态损失下降得更快。Scaling Law(规模定律,即用模型、数据和算力的增长规律预测效果)据此推算,两种路线可能在现实可及的预训练预算内交会,不过原文抽取内容未保留具体 FLOPs 数值。
模型也不是简单地“少装一个零件”。分析显示,语言模型的浅层会更早承担图像处理,视觉 token——图像切块后形成的输入单位——之间的双向交流也随算力增加而更有用。换句话说,视觉编码器没有消失,它的工作被逐步内化进了统一模型。