Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.071 — 2026-09-13
NEWS 约 1 分钟

32GB显卡挑战27B最大上下文

32GB 显卡先保留高精度 KV 缓存,空间不足时再动态让路

长对话像一张越写越满的草稿纸:AI 每读一段,就要把历史内容的中间结果留在显存里。wadeAlexC 在 32GB 显卡上运行 Qwen3.8-27B-UD-Q4_K_XL 时,启用 MTP 与 mmproj 后,只能容纳约 17 万个 token。直接压缩 KV 缓存——模型保存这张“草稿纸”的区域——可以腾出空间,但作者称,即使采用 q8_0 精度,自己也能感到质量差异。

于是他做了 llama-manager:一个套在 llama.cpp 分支外的小工具。它能在模型权重不动的情况下,运行中重建上下文和其他组件;切换配置时暂存并恢复既有 KV 缓存,不必重新处理整段输入。生成撞上上下文上限后,系统会在不中断生成的情况下尝试腾空间,例如关闭推测解码。这个思路的看点不是彻底拒绝 KV 缓存量化,而是先尽量保留完整精度,只在空间确实不够时再调整。供稿未给出最终可达到的最大上下文及任务质量测试,因此目前更像一项值得跟踪的社区工程尝试。


供稿材料 SOURCES — 1

← 返回 2026-09-13 · 开源板块