你把一套超大模型搬进自己的服务器,难点不只是“能不能装下”。它还得及时开口、持续生成,并且账单不能失控。一名 Reddit 作者用 8 张 B300 GPU 跑起了 2.8 万亿参数的 Kimi K3:首个结果约 1 秒出现,稳定生成速度达到 92 tok/s,同时也把冷启动和按 Token 计费的代价摊在了桌面上。以下数字全部来自这名作者及其个人评测,尚无模型机构、云平台或第三方复测。
8 张卡怎样装下 2.8 万亿参数?
作者在 Modal 上租用 8 张 B300,每小时费用为 56.79 美元。部署使用 vLLM 推理框架,并把 Tensor Parallelism 设为 8——也就是把模型同一层的计算拆给 8 张 GPU 同时完成。这样能运行单卡装不下的模型,代价是多张卡之间需要频繁通信。
模型采用原生 MXFP4。它是一种微缩放 4 比特浮点格式:一小组低精度数值共用一个缩放因子,以减少内存和计算负担。实际平均存储会略高于每个数值 4 比特,速度也取决于硬件和推理软件是否配合。
真正费时间的是开机。一次冷启动约需 27 分钟,其间要加载 1.56 TB 数据、执行即时编译,并完成 51 次 CUDA graph capture。换句话说,它不像打开普通应用那样随叫随到。频繁关停会反复支付启动时间,持续保温又会持续计费。
92 tok/s,不等于所有请求都跑这么快
部署完成后,作者测得 TTFT 为 0.92 至 1.02 秒。TTFT(Time to First Token)指提交请求后,等到第一个输出 Token 的时间,决定聊天时是否有“马上回应”的感觉。Token 是模型处理文字的基本片段,并不严格等于一个汉字或一个单词。
模型进入稳定解码后达到 92 tok/s,即每秒生成 92 个 Token。但在 4 个提示词的小样本中,平均速度是 83 tok/s。前者是稳定生成阶段的速度,后者是几次完整测试的平均值,两者不能混写成同一个指标。
作者估算,每百万输出 Token 约花费 190 美元。一次完整运行消耗约 36 美元 GPU 时间;如果保持实例全天在线,则约为每天 1363 美元。这些数字对应 Modal 的特定价格和作者的运行方式,并不是 Kimi K3 放在哪里都适用的固定价目表。
便宜的卡,为什么每个 Token 反而更贵?
作者还测试了另一条路线:把 Unsloth Dynamic GGUF 的 1-bit UD-IQ1_S 版本装入 8 张 A100-80GB,通过 llama.cpp 运行。这个版本大小为 594 GB,每小时租金为 19.99 美元,单看机器租金约比 B300 方案便宜 2.8 倍。
但它的生成速度约为 9 tok/s,TTFT 在 7 至 60 秒之间。作者估算其每百万 Token 成本约为 620 美元,单位 Token 成本反而约是 B300 方案的 3.3 倍。道理不复杂:机器便宜,不代表出活便宜;如果生成速度慢很多,每小时能完成的工作也会少很多。
作者称 1-bit 版本仍能正确完成算术并生成连贯文本。不过,这只是个人观察,不是标准化基准测试,不能据此断言极低精度量化没有质量损失。
为什么值得关注
这次个人实验的价值,不只是“8 张卡跑起一个大模型”。它把容量、等待时间、生成速度和费用放进了同一张账单:B300 方案租金高,却用更快吞吐压低了单位输出成本;A100 方案每小时便宜,却可能因为速度慢而更加昂贵。
这也是私有部署最容易忽略的一点。能装下模型只是入场券。真正决定体验和预算的,是它多久开口、之后生成多快,以及设备空闲时是否仍在烧钱。
局限与未知
- 全部结果来自同一名 Reddit 作者,且只测试了 4 个提示词,没有独立复现。
- 190 美元和 620 美元的口径受计费时长、输入输出长度、批量大小及冷启动是否摊销影响;后者是否同样只计算输出 Token,材料没有明确说明。
- 1-bit 版本的质量判断来自算术与连贯文本等非标准化观察,不能替代系统性的质量评测。