Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.055 — 2026-08-28
PAPER 约 1 分钟

投机解码只补最需要的视觉证据

FOVEA按生成状态补充关键视觉证据,同时保住缓存复用与解码速度。

让 AI 看图答题,并不是图片信息给得越多越好。小模型替大模型起草答案时,当前一步可能只需看清一个数字或小物体;塞入整张图的全部信息,反而增加计算,还可能干扰判断。论文的对照分析发现,25% 的视觉 Token 预算——也就是只让模型读取约四分之一的图像信息块——在 56.0% 的受测状态中最优;完整视觉输入仅在 2.9% 的状态中最优。

FOVEA 的做法像按问题临时翻资料:先把图像编码成一份可重复查询的“视觉记忆”,再由当前起草状态挑出最相关、数量也动态变化的证据。关键在于,它不把这些证据插回已经生成的上下文,而只修正当前词的评分表示。这样就不会破坏 KV Cache——模型保存过往计算结果、避免每次从头重算的缓存。作者在三个视觉语言模型骨干和九个多模态基准上的实验称,该方法提高了草稿被大模型接纳的程度和端到端解码速度;原文材料未给出完整的具体加速倍数。


供稿材料 SOURCES — 1

← 返回 2026-08-28 · 学术板块