Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.036 — 2026-08-09
PAPER H 10 · HF 47 约 1 分钟

多模态预训练开始追问底层规律

研究追踪视觉与语言如何互相影响,把多模态预训练从试配方推向找规律。

把一个擅长文字的 AI 后来再接上“眼睛”,看似省事,却可能让它遇到图像时仍靠文字经验猜答案。这项研究追问的正是:文字、视觉理解和图像生成应该何时一起学,又会彼此帮助还是互相拖累。

作者用合成数据与真实数据做受控实验,发现知识流并不对称,模态能否协同还取决于数据复杂度与模型结构。最值得注意的是“视觉懒惰”:如果较晚才引入图像,模型的视觉部分优化得更少,更依赖已有的语言先验;从预训练早期就统一文字与视觉,并同步训练,效果优于晚期对齐或分阶段训练。团队还用多个 13.5B 参数的 MoE——每次只启用部分“专家”模块的模型——在 2T tokens 上验证这些规律。作者称,据此整理的配方只用 5% 计算预算也能取得较强生成表现,但摘要未交代这一比例对应的具体基线。


供稿材料 SOURCES — 1

← 返回 2026-08-09 · 学术板块