长文塞给本地 AI,难点往往不是模型会不会读,而是显卡装不装得下。Fz1zz 分享了一套日常使用的 vLLM 配置:在单张 RTX 5090 上运行 Qwen3.8-27B,并完整容纳 262,144 个词元的上下文,同时保留视觉、工具调用和普通 KDE 桌面。这里的词元是模型切分文字的基本单位;262K 意味着它能一次接收非常长的输入。
关键在显存编排。模型采用 NVFP4 版本,KV Cache——模型保存已读内容中间结果的“草稿纸”——则使用精度较低、占用更小的 FP8 格式。作者自测称,短上下文生成速度为 77.2 tok/s;已有 128K 上下文时仍为 64.7 tok/s,只下降约 16.2%。但别把它理解成超长输入也能秒开:128K 输入的预处理耗时 47.128 秒,端到端输出仅 5.01 tok/s;262,000 词元的预处理更用了 166 秒。换句话说,这套配置证明的是“确实装得下并能跑完”,不是“262K 跑得很快”。而且 128K 与 262K 都只测了一次,更适合作为可复现的容量参考,而非稳定性能结论。