想让本地 AI 读完一部长文,还要回答得快,显存往往先撑不住。LlamAmpere 这次把目标转向12GB的 Ampere 显卡——也就是 RTX 30 系所用的 NVIDIA GPU 架构:作者称,测试中的 Qwen 27B 量化模型在约11GB显存下,可同时启用 MTP 和20.5万至23万 token 的上下文。上下文窗口是模型一次能记住的输入、历史与输出总量;MTP(多 token 预测)则会先猜多个后续 token,再验证哪些可用,以减少逐字生成的等待。
关键在于更紧地压缩运行时数据。作者缩小了 MTP 缓存,采用16位激活值、移除冗余开销,并加入新的分阶段、带日志 KVaRN 缓存方案。帖子称,3/3位和3/2位设置分别对应约0.001和0.0024 nats 的 KLD——衡量压缩后输出分布偏离程度的指标;在 RTX 3060、3080及 Ti 型号的七次 LiveCodeBench 测试中,2.3 bpw 模型保留了 BF16 版本约85%的表现,3080/Ti 借助 MTP 平均达到约65至70 token/s。作者也明确承认模型并非无损;这些数字目前来自项目作者自测,摘要未提供独立复现结果。