多张显卡一起跑大模型,不只看算力,还要看它们传数据时会不会“绕远路”。P2P(点对点传输)允许显卡之间更直接地搬运数据,少经 CPU 和系统内存中转。一位 LocalLLaMA 用户实测发现,即使主机配有约 150GB/s 内存带宽,开启 P2P 仍可能明显改善 vLLM——一个面向大模型推理与服务的开源框架——的多卡效率。
测试平台使用 AMD EPYC 与四张 16GB RTX 5060 Ti,显卡运行在 PCIe 4.0 x8 模式。相同测试中,开启 P2P 后,pp2048 项的速度从 1648.96 tokens/s 升至 2305.20 tokens/s,首次结果返回时间则从 1241.77 毫秒降至 913.50 毫秒。换句话说,现成消费级多卡机器的瓶颈未必只在显卡算力,数据怎么走也很关键。不过这些结果来自作者单一配置的自测,供稿未披露模型、P2P 开启方法及更多完整结果,不能直接外推到所有硬件。