Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.085 — 2026-09-27
PAPER 约 1 分钟

KV缓存落盘,瓶颈不只在SSD

KV缓存搬到CXL-SSD仍不够快,块接口与数据搬运才是隐藏瓶颈。

把 AI 常用的“开场白”存起来,下次就能少算一遍。但这份速查笔记一旦从内存搬到 SSD,等待时间并不只花在闪存上。KV Cache 是模型保存历史计算结果的中间状态;前缀缓存则复用系统提示、共享文档等重复开头,缩短首个词出现前的等待时间(TTFT)。

作者用 Qwen3-4B 测试发现,即使把 SSD 的 NAND 闪存换成 DRAM,只要仍走块设备接口,读取也比直接访问本地 DRAM 慢 1.8 倍。原因包括 I/O 线程争抢 CPU 末级缓存,以及数据必须经过主机 DRAM 中转;仅隔离缓存争用,P99 TTFT 最多就能降低 44%。普通 CXL-SSD 虽允许处理器像访问内存一样读取设备,仍约比本地 DRAM 慢 3 倍,且不快于 NVMe SSD。

为此,团队提出 LM-CXD:让设备按 KV 数据块理解、搬运并报告进度,再把设备 DRAM 直接作为 GPU 的读取缓冲区,按层预取后续数据。作者报告,其平均 TTFT 相比普通 CXL-SSD 最多降低 4.03 倍,平均可控制在本地 DRAM 的 1.5 倍以内。关键启示是:缓存“落盘”后,真正要协同管理的是整条数据路径,而不只是换一块更快的盘。


供稿材料 SOURCES — 1

← 返回 2026-09-27 · 学术板块