Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.049 — 2026-08-22
PAPER 约 1 分钟

TileMix把注意力精度拆到小块

TileMix按GPU计算块分配FP16或INT8,在长文本预填充中兼顾速度与精度。

让 AI 先读完一部长文再回答,真正费时的不只是“读得多”,还包括反复判断每段内容与其他段落有多相关。这个准备阶段叫预填充(prefill);文本越长,注意力计算中的两两比较增长越快,算力和数据搬运压力也随之上升。以往量化常让整次计算统一使用较低精度,虽然更省资源,却可能损失回答质量。

TileMix 的关键变化,是把精度选择拆到 Tile——GPU 实际批量处理注意力矩阵的小计算块。它让重要块走 FP16(较高精度),其余块走 INT8(较低精度),像关键账目多留小数、粗略统计少留几位。路由决定被压进紧凑的位掩码;两条计算路径随后汇入同一套在线 softmax 状态,也就是边计算边完成注意力权重归一化。这样既不删掉任何词之间的联系,也无需重新训练模型。

作者在 LLaMA、Qwen 和 Vicuna 的长上下文任务与 A100 预填充测试中称,TileMix 能挽回统一 INT8 带来的部分质量损失,同时比 FP16 提高吞吐量。材料未给出具体提升数字,因此目前更值得关注的是它的设计取向:把混合精度直接对齐 GPU 的执行颗粒度。


供稿材料 SOURCES — 1

← 返回 2026-08-22 · 学术板块