把程序想成一趟通勤:AI 就算把其中一段路修快十倍,只要这段原本只占一分钟,总行程也不会缩短多少。这篇论文追问的正是这一点:LLM 生成的 GPU 内核——交给 GPU 并行执行的小段底层程序——在真实工作负载里,究竟能碰到多少耗时。
作者在 KernelBench 上测试五种模型配置。GPT-5.6 生成的内核有 91.1%通过正确性检查,56道有效题中有22道经独立复核后快于 PyTorch。但把视线移到完整应用,差距就出来了:七个工作负载中,可由这类内核覆盖的耗时仅占8.9%至58.2%。Transformer 有80%至86%的时间花在已高度优化的 cuBLAS GEMM 和 FlashAttention 上,因此现实中的整体提速上限约为1%;模型越大,可改进部分反而越少。
推荐系统更有机会:DLRM 推理中58.2%的耗时可触及,而且主要集中在一个嵌入内核。作者据自建的12题 DLRM-Bench 测得41.7%的胜率,并推算端到端可提速8.63%。论文的价值不在再报一个漂亮倍数,而在补上 Amdahl 定律这笔账:局部跑得快,不等于整个产品快。