Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.088 — 2026-09-30
PAPER HF 6 约 1 分钟

极少视觉Token也能自我补课

只保留5%视觉Token,模型沿自己的答题轨迹向完整版本“补课”

把一张图压成几张小便签交给 AI,它跑得更快,却也更容易漏掉关键细节。LT-OPD 想解决的正是这个取舍:当多模态大语言模型(能同时理解图像和文字的模型)只保留极少视觉 Token——也就是机器读取画面的基本单位——如何尽量找回丢失的能力。

它最妙的一步,是让压缩后的“学生”先自己作答,再让读取完整画面的同一模型充当“老师”,沿着学生实际走过的答题路径逐步纠正。这叫在线自蒸馏:训练针对模型部署时真正会犯的错,而非只照着固定范例模仿。为避免一开始压缩过猛、学生连有效答案都生成不了,训练还会逐渐收紧 Token 预算。

据作者在九项基准上的实验,Qwen3.5-4B 仅保留 5% 视觉 Token 时,相对完整模型的平均性能由未经适配的 68.6% 回升至 82.3%,并超过同预算下最强基线的 77.6%;KV Cache(生成时保存中间结果的“草稿纸”)用量和预填充计算量分别下降 85.2% 和 85.4%,且不增加额外推理开销。效果目前仍以论文作者报告为准。


供稿材料 SOURCES — 1

← 返回 2026-09-30 · 学术板块