Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.082 — 2026-09-24
PAPER 约 1 分钟

端侧推理把量化接上投机解码

SpecQuant让同一模型的多种精度分工猜词与验证,兼顾端侧速度、显存和准确率。

在电脑或手机上跑大模型,常遇到两道墙:算得慢,显存也不够。SpecQuant把两种省资源办法接在一起。量化像把精密尺换成粗刻度尺,用更少位数保存模型;投机解码则是先快速猜出几个词,再由更可靠的模型一起核验,减少逐词生成的等待。

它最值得注意的一步,是从同一个 Qwen2.5 基础模型生成 INT4、FP8 和 FP16 三种精度版本。系统先按提示词长度、句法复杂度和专有名词密度判断难度:简单问题交给轻量版本,复杂推理或长输入交给高精度版本。由于这些版本共享基础权重,低精度版本可以承担“猜词”工作,高精度版本负责验证,不必另训、另存一个独立的草稿模型——也就是传统投机解码中专门负责先猜答案的小模型。

作者在 MMLU、AlpacaEval 和 GSM8K 上报告,SpecQuant带来 35%—43% 的加速,准确率下降不超过 2%。这些结果来自论文作者,全文未在所给材料中披露各硬件配置下的细分数据;但它瞄准的问题很实际:端侧设备的算力和显存会同时吃紧,加速方案不能只顾其中一头。


供稿材料 SOURCES — 1

← 返回 2026-09-24 · 学术板块