Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.035 — 2026-08-08
PAPER H 41 约 1 分钟

KV缓存压到2比特,先转对方向

OptR先重排KV缓存数值,再压到INT2,让长上下文更省显存,也尽量少伤模型判断。

让 AI 读更长的材料,就像给它铺开更大的草稿纸:KV缓存——模型保存已读内容的注意力中间结果——会迅速吃掉显存和带宽。把它压成 INT2,即每个数只留2比特、四个档位,能大幅缩小缓存;但少数异常大值会撑宽刻度,让其他数更容易失真。

OptR 的关键不是单纯让压缩后的缓存更像原数据,而是直接追踪误差经过注意力计算和输出投影后,究竟多大程度改变模型输出。它先给 key 做不改变注意力分布的居中处理,再为每个注意力头学习正交旋转——相当于换一套坐标,把异常值摊开后再量化。校准时模型权重保持冻结,推理时旋转固定,原有分页式缓存布局也能保留。

论文中最醒目的结果来自 Qwen3-8B 的 AIME25:在 QuaRot 基础上加入 OptR,准确率由17.33%升至66.67%;BF16为68.00%。作者还称,它在三种模型、五项推理与编程基准上持续改善 QuaRot 和 OSCAR,且推理开销可忽略;这些效果目前以论文报告为准。


供稿材料 SOURCES — 1
01
Output-Aware Rotation for INT2 KV-Cache Quantization arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-08 · 学术板块