Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.044 — 2026-08-17
NEWS 约 1 分钟

3.3GB量化模型找回推理能力

同为约3.3GB的IQ2模型,精度分配不同,推理得分可从28.9升至69.5。

IMAGE — r/LocalLLaMA 日榜

把模型压进小设备,不能只看“压到了几比特”。这就像行李限重:每件东西都削掉同样分量,未必最划算。开发者 devildip 测试了一种约 3.3 GiB 的 IQ2_XXS 极低比特模型;IQ2_XXS 是存储和编码方案的名称,并不保证实际能力。按其自测,仅改变精度分配,推理得分便从 28.9 升至 69.5。

关键在“张量级量化分配”。张量可理解为模型内部存放权重的多维数字表,不同张量对压缩损失的敏感程度不同。作者先用面向不同能力类别的校准语料估计损伤,再在固定容量内,给敏感张量多留精度、其余张量少留精度。作为参照,BF16 原模型得分为 71.875;作者称该量化版保留了其 96.74% 的推理表现,体积约为 BF16 的 24%,且没有追加训练、LoRA、剪枝或权重更新。

这些数字来自作者在 Reddit 发布的自有测试,尚未独立核查;11 类指标中稳定性也出现退步。但结果至少提醒我们:同写着 IQ2、同为约 3.3GB,模型质量仍可能相差很远,真正值得看的还有有限精度被分给了哪里。


供稿材料 SOURCES — 1

← 返回 2026-08-17 · 开源板块