GPU 利用率很高,就像餐厅后厨人人都在忙,但端上桌的菜未必多。论文指出,常见的 SM 利用率——GPU 计算单元忙碌时间的比例——会让大模型推理看似接近满载,却掩盖真正完成的有效计算。
问题在 LLM 解码阶段尤其明显:模型每轮通常只为每个请求生成一个新 Token,送进 GPU 的矩阵乘法很零碎。Hopper 架构的 GMMA 矩阵乘法指令必须按固定的 64 行计算块工作;实际数据不够时,剩余位置仍会占用资源。作者在单张 H100 NVL、BF16 精度下测试四个模型,发现小批量解码的有效数据只填满计算块的 1.6%—12.5%,因此单个计算内核的吞吐读数可能把有效矩阵计算高估 8—64 倍。这不是简单调整计算块大小就能补回的余量,更可行的方向是把更多请求的 Token 合并起来,增加每轮实际参与计算的数据行。论文因此用八组指标替代单一利用率,分别观察填充率、资源上限、等待原因和任务覆盖等机制;具体数值能否推广到其他 GPU、FP8 精度或真实流量,作者尚未验证。