让 AI 看图答题,并不是图片信息给得越多越好。小模型替大模型起草答案时,当前一步可能只需看清一个数字或小物体;塞入整张图的全部信息,反而增加计算,还可能干扰判断。论文的对照分析发现,25% 的视觉 Token 预算——也就是只让模型读取约四分之一的图像信息块——在 56.0% 的受测状态中最优;完整视觉输入仅在 2.9% 的状态中最优。
FOVEA 的做法像按问题临时翻资料:先把图像编码成一份可重复查询的“视觉记忆”,再由当前起草状态挑出最相关、数量也动态变化的证据。关键在于,它不把这些证据插回已经生成的上下文,而只修正当前词的评分表示。这样就不会破坏 KV Cache——模型保存过往计算结果、避免每次从头重算的缓存。作者在三个视觉语言模型骨干和九个多模态基准上的实验称,该方法提高了草稿被大模型接纳的程度和端到端解码速度;原文材料未给出完整的具体加速倍数。