Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.047 — 2026-08-20
NEWS 约 1 分钟

四张3060装下DeepSeek V4

四张 RTX 3060 配合 128GB 内存,跑起 144GiB 量化模型和 36万上下文。

IMAGE — r/LocalLLaMA 日榜

大模型装不进老显卡,不一定只能换机器。作者 syscomua 把四张各有 12GB 显存的 RTX 3060 与 128GB 系统内存拼在一起,运行约 144GiB 的 DeepSeek V4 Flash 量化模型,同时保留 36万至37.6万 token 的上下文窗口——也就是模型一次能参考的文本范围。这里的 GGUF 是本地推理常用的模型格式;量化则用较低精度保存权重,以减少内存占用。

关键不是平均分配,而是给不同硬件安排不同工作。这个模型采用 MoE(混合专家)结构,每次只调用部分“专家”子网络。作者把前 34 个区块的专家留在 CPU 和系统内存,把其余九层专家分给三张显卡,并让第一张显卡承接大部分注意力与 KV cache——模型处理长文本时保存中间结果的“草稿纸”。据作者用约 2.05万 token 提示词实测,36.864万上下文下,提示词处理约 99.4 token/s,生成约 10.1 token/s;模型载入约需 198 秒。这说明混合卸载仍能把旧显卡变成大模型的可用容器,但速度与效果来自逐项试配,不能视作通用配置。


供稿材料 SOURCES — 1

← 返回 2026-08-20 · 开源板块