像老师只给“错了”却不指出哪一步,学生再勤奋也只能反复猜。如今生成GPU内核的Agent也有类似困境:GPU内核是让显卡大批并行处理数据的小程序,但传统编译流程往往只返回报错、结果是否正确和运行时间,很难说明究竟是哪项安排拖慢或弄坏了程序。
CAKE的关键变化,是让Agent直接编写Cake IR——一种可检查的“施工图”,明确记录哪些线程组负责计算或搬运数据、怎样同步,以及如何安排流水线。编译器可在真正运行前定位同步、内存和硬件规则问题,成本模型则提示可能的性能瓶颈;最终性能仍以显卡实测为准。
更值得注意的是,这套环境本身也会演化:反复出现的崩溃可沉淀为新的检查规则,缺失的硬件能力可变成新的IR操作,预测偏差则推动成本模型校准。换句话说,Agent不只改内核,也参与完善教它写内核的工具。论文称CAKE覆盖NVIDIA Ampere至Blackwell架构;供稿中的部分效果数字缺失,因此这里不作量化比较。