Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.051 — 2026-08-24
NEWS 约 1 分钟

单张5090跑满26万上下文

一套可复现配置,让27B模型在单张RTX 5090上装下262K上下文

长文塞给本地 AI,难点往往不是模型会不会读,而是显卡装不装得下。Fz1zz 分享了一套日常使用的 vLLM 配置:在单张 RTX 5090 上运行 Qwen3.8-27B,并完整容纳 262,144 个词元的上下文,同时保留视觉、工具调用和普通 KDE 桌面。这里的词元是模型切分文字的基本单位;262K 意味着它能一次接收非常长的输入。

关键在显存编排。模型采用 NVFP4 版本,KV Cache——模型保存已读内容中间结果的“草稿纸”——则使用精度较低、占用更小的 FP8 格式。作者自测称,短上下文生成速度为 77.2 tok/s;已有 128K 上下文时仍为 64.7 tok/s,只下降约 16.2%。但别把它理解成超长输入也能秒开:128K 输入的预处理耗时 47.128 秒,端到端输出仅 5.01 tok/s;262,000 词元的预处理更用了 166 秒。换句话说,这套配置证明的是“确实装得下并能跑完”,不是“262K 跑得很快”。而且 128K 与 262K 都只测了一次,更适合作为可复现的容量参考,而非稳定性能结论。


供稿材料 SOURCES — 1

← 返回 2026-08-24 · 开源板块