Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.082 — 2026-09-24
PAPER 约 1 分钟

LLM写的GPU内核离生产还有多远

LLM会写更快的GPU内核,但真正能加速多少,还要看它覆盖了整段程序的多少时间。

把程序想成一趟通勤:AI 就算把其中一段路修快十倍,只要这段原本只占一分钟,总行程也不会缩短多少。这篇论文追问的正是这一点:LLM 生成的 GPU 内核——交给 GPU 并行执行的小段底层程序——在真实工作负载里,究竟能碰到多少耗时。

作者在 KernelBench 上测试五种模型配置。GPT-5.6 生成的内核有 91.1%通过正确性检查,56道有效题中有22道经独立复核后快于 PyTorch。但把视线移到完整应用,差距就出来了:七个工作负载中,可由这类内核覆盖的耗时仅占8.9%至58.2%。Transformer 有80%至86%的时间花在已高度优化的 cuBLAS GEMM 和 FlashAttention 上,因此现实中的整体提速上限约为1%;模型越大,可改进部分反而越少。

推荐系统更有机会:DLRM 推理中58.2%的耗时可触及,而且主要集中在一个嵌入内核。作者据自建的12题 DLRM-Bench 测得41.7%的胜率,并推算端到端可提速8.63%。论文的价值不在再报一个漂亮倍数,而在补上 Amdahl 定律这笔账:局部跑得快,不等于整个产品快。


供稿材料 SOURCES — 1

← 返回 2026-09-24 · 学术板块