单张旧显卡装不下大模型,不等于两张规格不同的卡只能闲置。Reddit 用户 OkBase5453 把一张 16GB 和一张 32GB 的 Tesla V100 合用,在本地运行 Qwen3.8 27B,给预算有限、手头已有旧硬件的人提供了一个具体样本。
关键是用 llama.cpp 的 Tensor split——按显存容量分配模型张量——而不是强求两张卡平均承担工作;同时启用 Flash Attention,减少注意力计算中的显存读写。作者自测,Q6_K_M 量化版本在 2k 输入下可处理每秒 1,376.87 个提示词元,生成速度为每秒 39.88 个词元;输入拉长到 16k 时,前者仍有每秒 1,221.49 个词元。量化就是用较低精度保存模型,以节省显存。
这不是旧 V100 胜过新卡的证明,也不是通用性能结论,但它说明:容量不对称的老卡经过合理拆分,确实能拼成可用的本地推理实验室。