Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.059 — 2026-09-01
NEWS 约 1 分钟

EXL3让30B塞进12GB显存

一名用户实测:3比特EXL3让30B稠密模型在12GB显存跑出约10万上下文

IMAGE — r/LocalLLaMA 日榜

想在普通笔记本显卡上运行更大的本地模型,常见难题不是算不动,而是显存装不下。Reddit 用户 PyaesoneP 称,他把 Muse Glimmer 30B 的 EXL3-SC 版本压到 3.00 bpw——即每个模型权重平均只占3比特——让这款300亿参数的稠密模型完全驻留在12GB显存中,推理时不必频繁搬运权重。

更具体的看点是,它还能同时保留约10万上下文,并达到约30 token/s;token 是模型处理和生成文字的基本片段。这里搭配了 Q8_O KV 缓存:KV 缓存像模型阅读长文时留下的草稿,保存此前的注意力计算结果;把它也量化,能为更长上下文腾出显存。作者还称,自己的 Hermes Agent 用途中没有察觉明显质量差异,速度则快得多。不过这些数字和体验来自单名 Reddit 用户的自述,材料未提供标准化测试或独立质量评估。


供稿材料 SOURCES — 1
01
Don't Sleep on EXL3 Quants r/LocalLLaMA 日榜 · NEWS
原文 ↗

← 返回 2026-09-01 · 开源板块