让 AI 看图回答问题时,等待往往发生在答案一个词一个词“吐”出来的阶段。Liquid AI 为轻量视觉语言模型 LFM2.5-VL-3B 配套了 DSpark:它用一个较小的 drafter(草稿模型)提前猜出一组词元——模型处理文字的基本单位,再交给原模型批量核验。猜得准,就能少跑几轮计算,同时保持原模型的输出分布。
这个草稿模型约有 2.8 亿参数,相当于在 30 亿参数的目标模型上增加 8.9%。团队测试时让它每次起草 8 个词元。作者自述,在 M5 Max 上,逐词生成速度提升 2.30 至 3.13 倍,包含看图和理解问题在内的端到端速度提升 1.56 至 2.62 倍;H100 上端到端最高提升 2.27 倍。它还首日接入 llama.cpp、MLX-VLM 和 SGLang 三套常用部署工具。
边界也很清楚:DSpark只加速答案生成,不能缩短图像编码和首次处理输入的时间。因此,看图准备阶段占比越高,用户实际感受到的整体提升就越有限。