让 AI 一次多猜几个词,通常能答得更快,但也得在显存里多存几份“后悔药”:后面的猜测没通过验证,就回滚到最后一个正确位置。对只有 16GB 显存的用户,这些备用状态会挤占上下文长度——也就是模型一次能记住的对话或代码量。
开发者 ea_man 为 llama.cpp 的 QWEN 模型 MTP(Multi-Token Prediction,一次预测后续多个 Token)做了 Compact Rollback 改版。它允许最多推测 5 个 Token,却只保留 1 份即时回滚快照;再根据近期猜中率,动态调整实际推测数量。作者在 Reddit 公布的一组调校过的 QWEN 27B、16GB 测试中称:可用上下文从 72,192 增至 77,312 Token,生成速度从每秒 39.53 增至 46.39 Token,提升 17.35%。这说明低显存设备不必为了 MTP 提速同等幅度地牺牲长上下文,不过目前材料只有作者自测,尚无更广泛配置下的独立验证。