Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.041 — 2026-08-14
NEWS 约 1 分钟

DeepSeek超大模型也能借内存投机

单卡跑下284B模型后,草稿模型放系统内存竟比放显存更快

一张显卡装不下超大模型,就像小书桌摆不下整套资料:一部分只能留在系统内存,需要时再搬给显卡。通常,这段搬运会拖慢生成。但一位开发者实测 DeepSeek V4 Flash 284B 时发现,把约 10.15GB 的 DSpark 草稿模型放进系统内存,反而比塞进显存更快。

DSpark 用的是投机解码——先由较小的草稿模型猜出一批 token(模型生成文字时的基本单位),再交给大模型统一核验。测试所用模型文件为 144.4GB,单张 RTX PRO 6000 只有 96GB 显存,因此部分“专家层”必须卸载到系统内存。把 DSpark 移出显存后,腾出的空间能让大模型多放三个专家层进显卡。作者报告,在尽量对齐显存占用后,无草稿模型为 26.52 tok/s,DSpark 放显存为 29.86 tok/s,放系统内存则为 31.16 tok/s:相对前者约快 4.4%,相对不用 DSpark 快约 15%—17%。

这个结果说明,关键不只是多少数据经过系统内存,还包括这些数据被读取得有多频繁。不过,这只是作者在特定硬件和编程任务上的实测,不能直接视为普遍规律。


供稿材料 SOURCES — 1

← 返回 2026-08-14 · 开源板块