Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.037 — 2026-08-10
NEWS 约 1 分钟

消费级英伟达多卡还有P2P红利

实测显示,消费级 NVIDIA 多卡开启 PCIe P2P 后,vLLM 数据搬运效率仍有明显提升空间。

多张显卡一起跑大模型,不只看算力,还要看它们传数据时会不会“绕远路”。P2P(点对点传输)允许显卡之间更直接地搬运数据,少经 CPU 和系统内存中转。一位 LocalLLaMA 用户实测发现,即使主机配有约 150GB/s 内存带宽,开启 P2P 仍可能明显改善 vLLM——一个面向大模型推理与服务的开源框架——的多卡效率。

测试平台使用 AMD EPYC 与四张 16GB RTX 5060 Ti,显卡运行在 PCIe 4.0 x8 模式。相同测试中,开启 P2P 后,pp2048 项的速度从 1648.96 tokens/s 升至 2305.20 tokens/s,首次结果返回时间则从 1241.77 毫秒降至 913.50 毫秒。换句话说,现成消费级多卡机器的瓶颈未必只在显卡算力,数据怎么走也很关键。不过这些结果来自作者单一配置的自测,供稿未披露模型、P2P 开启方法及更多完整结果,不能直接外推到所有硬件。


供稿材料 SOURCES — 1

← 返回 2026-08-10 · 开源板块