想在显存有限的设备上跑大模型,通常得先给它“瘦身”,但压得越狠,推理能力越容易掉。开发者 devildip 给 Qwen3.8-27B 做了一套任务感知量化:量化就是用更少比特保存模型数值;“任务感知”则是不求面面俱到,专门照顾推理任务。作者称,成品体积约为 BF16——一种16位浮点高精度基线——的15%,推理得分为82.81%,达到 BF16 的83.59%的约99%。
这套方案名为 TAK(Task Aware Knapsack)。它先用推理语料建立重要性测量,再找出模型接近崩溃的最小体积,最后在固定字节预算内,按不同张量受损程度分配精度。与体积匹配的 Unsloth UD IQ2_S 相比,TAK 得分高5.47个百分点:82.81% 对77.34%。值得留意的是,这不是通用能力不缩水的证明。作者已确认有人拿它写代码时遇到重复循环,并说明代码不在当前优化范围内;上述结果也来自作者在 Reddit 公布的自测,尚待独立复核。