你让餐厅同时做几十道菜,厨房设备固然重要,备料和上菜的编排也决定速度。AI推理也是如此:芯片参数更强,不代表模型一定跑得更快。量子位转述Inferact的测试称,16块Google TPU v7 Ironwood运行Kimi K3时,每秒生成709个Token,比16块NVIDIA GB200的452个快57%。Token是模型生成文字时处理的基本单位,每秒Token数越高,通常代表系统产出越快。
这组结果值得看,不是因为它已经证明TPU全面胜过GPU,而是因为差距主要出现在软件与芯片如何配合。需要先说明:目前全部数字来自量子位对Inferact材料的转述,属于单一信源;它是一组特定软硬件配置下的benchmark(基准测试),不能直接推广到其他模型或任务。
快57%,到底比的是什么?
这次对比的两边都使用16块芯片、Kimi K3和vLLM。vLLM是运行大模型推理的软件引擎,支持超过500种模型架构,社区贡献者超过2000人。区别在于芯片及底层kernel实现。Kernel即推理内核,是直接指挥芯片完成计算和数据搬运的小程序。
709 Token/s还包含DSpark的帮助。DSpark是DeepSeek提出的推测解码方案:先让一个小模型快速猜出一串候选Token,再由大模型一次验证。猜对就直接采用,猜错再回退。Inferact的测试中,平均每轮有6个候选Token通过验证,单步解码约耗时8.5毫秒。
关掉推测解码后,TPU在batch size为1时达到249 Token/s,GB200为127;batch size为8时,两者分别为865和636。Batch size指系统一次并行处理的请求数量。两组数字说明TPU的优势不只来自DSpark,但它们对应不同负载,不能与709 Token/s直接混算。
它把“小工序”焊成了一个大程序
Inferact的关键改动是megakernel。传统推理会调用许多小内核,像一道菜在多个工位之间反复交接;每次切换都会带来调度和数据搬运开销。Megakernel则把这些细碎操作融合成较大的执行单元。
据量子位转述,Inferact用Google面向TPU的底层编程语言Pallas,把Kimi K3的92层MoE计算合并进一个程序。MoE即“混合专家”结构,模型每次只调用部分专门模块参与计算。团队还加入跨层权重预取:当前层计算时,下一层需要的数据已经开始从HBM搬进片上内存。HBM是芯片旁边的高带宽内存,存放模型权重等数据。
这种编排利用了TPU的内存设计。材料称,TPU v7每个TensorCore配有64 MiB、由软件管理的VMEM;Blackwell的片上内存则分散在152个SM中,总量约38 MiB。不过两组数字涉及不同硬件单元,不能据此单独判定优劣。更稳妥的结论是:Inferact针对TPU的结构做了深度定制。
手写megakernel也缩短了开发迭代。材料称,编译时间从XLA的30分钟以上降至不到90秒。XLA是TPU常用的编译工具链;在这项工作里,工程师选择直接控制数据何时搬入、存放和释放。
松动的是哪一层护城河?
这次结果提醒行业,AI芯片竞争不只看纸面算力和带宽。材料给出的HBM带宽分别为TPU v7的7380 GB/s和GB200的8000 GB/s,后者更高,却没有在这项测试中取得更高吞吐。真正影响结果的,还有推理引擎、内核和模型结构之间的配合。
这也解释了Inferact为何值得关注。它由vLLM原始开发者创办,CEO Simon Mo是vLLM原始维护者,联合创始人Woosuk Kwon是项目发起人。公司已完成1.5亿美元种子轮融资,估值8亿美元,由a16z和Lightspeed领投。此次TPU megakernel是Inferact与Google Cloud的联合工程成果,代码已经开源。
但“英伟达护城河松动”仍然只能写成问号。更准确地说,这项工作展示了一条可行路径:当成熟的推理软件开始认真适配另一种芯片,GPU并非天然在所有模型上领先。竞争焦点可能从“谁的芯片参数更高”,进一步转向“谁能让模型、软件和硬件共同工作得更顺”。
局限与未知
- 这不是完全相同的软件条件。两边虽都用vLLM,底层kernel不同,而TPU端恰恰使用了为Kimi K3定制的megakernel。
- 材料没有披露输入与输出长度、并发、精度、数据类型、量化、功耗、成本、延迟口径和完整复现环境。吞吐量只有在这些设置一致时才适合直接比较。
- Inferact称TPU上的GPQA-Diamond和GSM8K得分分别为94.4%和97.2%,并称与GPU一致,但材料未给出GPU具体分数和完整评测方法;这套megakernel更换模型架构后也仍需重新适配。