一张新显卡显存不够,又不想拆机升级,可以把 NAS 里的旧卡也拉来帮忙。作者用 llama.cpp 的 RPC——让一台机器通过网络调用另一台机器的显卡——把 5070 Ti 与 1080 Ti 接在千兆以太网上,尝试运行 Qwen 3.8 27B。这相当于用通信时间换取更大的总显存,适合论坛式问答和异步任务,不追求即时聊天。
最有价值的是取舍很具体。在 12k 上下文、UD-Q4_K_XL 模型和 q8 KV Cache 设置下,开启 MTP 并偏向逐词生成时,作者测得 prefill 约 350、生成约 36;关闭 MTP、偏向 prefill 时,则变为约 560 和 19。Prefill 是先读完整段提示词,生成则是随后逐个吐出 token;后者每一步都更容易被网络延迟拖慢。作者还称,开启 MTP 会立即让 prefill 下降约 30%,并占用显存。原帖未进一步说明 pp、tg 数值的单位和完整测试方法,因此这些结果更适合作为旧卡再利用的配置参考,而非通用性能结论。