Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
NEWS 约 1 分钟

Qwen新量化再压到2.5比特

GSQ与RCO把Qwen 27B压到2.5至3.0 bpw,并让精度分配与量化器一起学习。

IMAGE — r/LocalLLaMA 日榜

把大模型装进显存有限的电脑,像往行李箱里塞衣服:压得越狠,越容易损失能力。Loginhe 发布的 GSQ + RCO,瞄准的正是这个取舍。它把 Qwen3.8-27B 压成三款 GGUF——一种便于本地推理工具加载的模型文件,分别为 2.50、2.75 和 3.00 bpw(每个权重平均占用的比特数),文件大小为 8.4 至 10.1 GB。

关键不只是“压得更小”,而是让压缩方案自己学习哪里值得多留精度。GSQ 是后训练标量量化:模型训练完成后,再逐个压缩权重,并共同学习量化格点与缩放比例。RCO 则在固定文件预算下,直接根据任务损失,为每个张量——模型内部的一组数值——分配量化类型。换句话说,它不再让所有部分吃同一份精度配额。作者自述,3.00 bpw 版本在 AIME25 得分 100.00,与 BF16 基础模型相同;GPQA-Diamond 为 88.89,对方为 89.90。模型还能直接运行于 llama.cpp、Ollama 和 LM Studio。现有成绩来自发布者测试,尚不足以说明它在所有实际任务中都同样稳健。


供稿材料 SOURCES — 1

← 返回 2026-08-30 · 开源板块