Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
NEWS 约 5 分钟

QUASAR:27B模型全身压进NVFP4

QUASAR把27B模型全身压成4-bit,文件缩近三分之二,两项测试仍贴近原版。

IMAGE — r/LocalLLaMA 日榜

把整台机器换成“小零件”

给大模型做量化,有点像把一套精密仪器换成更小、更省电的零件。换一部分通常不难;难的是连最敏感的部件也一起换掉,还不让整台机器明显失准。

QUASAR 团队这次发布的 Qwen3.8-27B-QUASAR-NVFP4,尝试解决的正是这个问题。它把一个 27B——约 270 亿参数——的模型完整压到 NVFP4。NVFP4 是 NVIDIA 面向低精度 AI 计算的 4-bit 浮点格式;这里的 W4A4,表示权重和运行时的激活值都采用 4-bit。项目方称,模型文件从原始 BF16 版本的 55.6 GB 缩至 19.7 GB,同时在两项测试中接近原版成绩。

这比“下载模型后再压一下”更值得看。我们 8 月 16 日报道 Qwen3.8-27B 时,讨论过社区 4-bit、8-bit 版本在显存、速度与能力之间的取舍。QUASAR 把补救动作提前到了训练阶段:先让模型经历低精度造成的误差,再教它适应。

需要先说明,本文数字全部来自项目方 Hugging Face 页面,目前没有独立复现。

不只压权重,还让模型重新适应

量化,就是用更少的数值位数保存参数和参与计算。位数越少,文件和计算负担通常越小,但可表达的数值也更粗糙,模型更容易损失能力。

QUASAR 使用的是量化感知蒸馏,英文为 quantization-aware distillation,简称 QAD。它结合了两个思路。其一是量化感知训练:训练时就模拟低精度误差,让模型提前适应未来真正部署时的数值格式。其二是知识蒸馏:让受约束的“学生”模仿能力更完整的“教师”。

在这次发布中,原始 BF16 模型充当教师。BF16 是精度更高、占用也更大的数值格式。量化后的学生模型接受了 2,446 steps 的蒸馏训练。可以把它理解成:不是把教科书复印模糊后直接交卷,而是让学生拿着模糊版本练习,再由清晰原版不断纠正。

项目方强调,其量化配置相当激进:所有 transformer blocks——模型内部反复堆叠的主要计算模块——中的每一个线性层都采用 NVFP4。Attention 和 GDN 层也包括在内。项目方称,这些层通常会保留为 FP8 或 BF16,因为进一步压低精度可能明显伤害质量。QUASAR 的关键主张因此不是“也做了一个 4-bit 版本”,而是完整 W4A4 之后仍能守住能力。

两组成绩说明了什么?

项目方给出的文件大小对比很直观:原始 BF16 模型为 55.6 GB,QUASAR 版为 19.7 GB,约减少 65%。同表中的 unsloth NVFP4 和 Inferact NVFP4 分别为 23.4 GB、26.4 GB,QUASAR 版也更小。

能力方面,GPQA-Diamond 是一项高难度问答测试。项目方报告,原始 BF16 得分 0.9141,QUASAR 为 0.9091,相差 0.005;unsloth 与 Inferact 版本分别为 0.8939 和 0.8763。该项结果标注为 2 runs、样本数 n=396

在 AIME26 数学测试上,原始 BF16 与 QUASAR 都是 1.0000;另两个 NVFP4 检查点为 0.9778 和 0.9667。这里标注为 3 repeats、n=90

这两组数字支持一个较窄的结论:在项目方选择的两项评测中,QUASAR 版本接近原始 BF16,并领先表中两个对比检查点。项目方将其概括为“near-BF16 performance”,但现有材料还不足以把这个说法外推为模型总体能力几乎无损。

部署收益开始变得具体

该检查点支持通过 vLLM——用于运行和提供大模型服务的软件——部署在 NVIDIA Blackwell GPU 上。项目方示例把最大上下文长度设为 262144。换句话说,它已经给出面向新一代 NVIDIA 低精度硬件的软件入口,而不只是一个实验表格。

真正值得关注的,是压缩目标发生了变化。过去常见做法会给敏感层留出高精度“安全区”;QUASAR 则试图取消这些例外,让整套主要计算统一落到 NVFP4。如果后续能被独立验证,这种做法可能让低精度硬件的部署路径更直接。

局限与未知

  • 2,446 个蒸馏步骤并不能说明完整训练代价。项目方没有披露训练数据、GPU 数量、Blackwell 型号、耗时或能耗,因此暂时无法判断省下的部署成本需要多久才能抵消训练投入。
  • 19.7 GB 是项目方列出的模型大小,统计口径未说明,不能直接等同于实际运行显存。示例中的 262144 也只是启动参数,不能证明模型在完整 262K 上的质量与稳定性。
  • 评测仅有两项。AIME26 样本数为 90,满分结果还需要核查数据污染、判分与重复运行汇总方式;GPQA-Diamond 的 2 runs 也未说明表中数字如何汇总。Attention、GDN 是否全部实际落入 NVFP4,以及所需 vLLM 版本和内核,同样有待独立核对。

供稿材料 SOURCES — 1

← 返回 2026-08-27 · 开源板块