让本地 AI 一次读进接近百万 token 的长文,难点不只是模型够不够聪明,还在于显卡能不能装下。模型权重已经占去大半空间,阅读过程中积累的“笔记”也会迅速膨胀。这则用户实测的看点,是在一张24GB显存的 RTX 3090 上,把约17GB的 Qwen 3.5 35B A3B 衍生模型推到了接近100万 token 的上下文。
据 Anbeeld 转述,用户 manu69x 使用 BeeLlama.cpp fork 的 v0.4.3 preview,并以 KVarN 4-bit 同时压缩 K、V。这里的 KV缓存,是模型保存已读内容中间结果的“草稿纸”;上下文越长,它越可能成为模型权重之外的主要显存开销。4-bit 则意味着用较低精度存放这些结果,以换取更小占用。
这次“跑起来”不只是服务没有崩溃。按帖文说法,用户还从超长文本的不同位置找回了7条预埋信息,也就是“大海捞针测试”。作者据此认为,KVarN 在低位宽下可能比普通 q4 量化更可靠。不过,这仍是单次社区用户报告;材料没有披露完整配置、准确 token 数和更广泛任务结果,大海捞针也不能代表所有长文推理能力。