企业把开放权重模型搬到自己的服务器上,并不等于“免费下载、直接开跑”。这篇实测算了一笔更接近采购现场的账:Kimi K3有1.4TB权重,8张B200共1.5TB的HBM——GPU旁存放模型数据的高速内存——虽然勉强装得下权重,却没有空间留给KV cache,也就是模型生成时保存上下文计算结果的运行缓存。团队因此换用8张B300,整机HBM增至2.3TB,硬件成本平均高约20%,具体仍取决于租赁商。
代价不只在采购。作者自述,K3同时服务16个会话,GLM-5.2可到24个;16名用户时总吞吐量为每秒122个token,较后者的170低约30%,任务中位耗时也从26分钟增至38分钟。不过,K3解决了86.4%的任务,比GLM-5.2和Opus 4.8的62.5%高24个百分点。换句话说,企业多花约20%的硬件钱,买到的是更高的任务完成率,却要接受更慢速度和更低并发。作者也提醒,SWEBench Pro测试题可能进入过K3训练数据,因此86.4%这一结果仍需谨慎看待。