想在普通笔记本显卡上运行更大的本地模型,常见难题不是算不动,而是显存装不下。Reddit 用户 PyaesoneP 称,他把 Muse Glimmer 30B 的 EXL3-SC 版本压到 3.00 bpw——即每个模型权重平均只占3比特——让这款300亿参数的稠密模型完全驻留在12GB显存中,推理时不必频繁搬运权重。
更具体的看点是,它还能同时保留约10万上下文,并达到约30 token/s;token 是模型处理和生成文字的基本片段。这里搭配了 Q8_O KV 缓存:KV 缓存像模型阅读长文时留下的草稿,保存此前的注意力计算结果;把它也量化,能为更长上下文腾出显存。作者还称,自己的 Hermes Agent 用途中没有察觉明显质量差异,速度则快得多。不过这些数字和体验来自单名 Reddit 用户的自述,材料未提供标准化测试或独立质量评估。