Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.079 — 2026-09-21
NEWS 约 1 分钟

不对称老卡也能拼成本地实验室

16GB与32GB两张旧V100混搭,借助llama.cpp跑通27B模型本地推理。

单张旧显卡装不下大模型,不等于两张规格不同的卡只能闲置。Reddit 用户 OkBase5453 把一张 16GB 和一张 32GB 的 Tesla V100 合用,在本地运行 Qwen3.8 27B,给预算有限、手头已有旧硬件的人提供了一个具体样本。

关键是用 llama.cpp 的 Tensor split——按显存容量分配模型张量——而不是强求两张卡平均承担工作;同时启用 Flash Attention,减少注意力计算中的显存读写。作者自测,Q6_K_M 量化版本在 2k 输入下可处理每秒 1,376.87 个提示词元,生成速度为每秒 39.88 个词元;输入拉长到 16k 时,前者仍有每秒 1,221.49 个词元。量化就是用较低精度保存模型,以节省显存。

这不是旧 V100 胜过新卡的证明,也不是通用性能结论,但它说明:容量不对称的老卡经过合理拆分,确实能拼成可用的本地推理实验室。


供稿材料 SOURCES — 1

← 返回 2026-09-21 · 开源板块