大模型像一张越写越长的书桌:模型权重和对话记录不断堆上去,昂贵但容量有限的HBM很快放不下。于是,SSD不再只是开机时读取模型的“仓库”,而开始在推理——模型生成答案的过程——中随时搬运数据,直接影响GPU要不要等待,以及每个Token的成本。
一个代表是月之暗面的Mooncake。它把KV Cache——模型为避免反复计算上下文而保存的中间状态——分散存入CPU、DRAM和SSD,再按请求调回计算节点。论文披露,这套端到端架构将有效请求承载能力提高59%至498%,但收益来自缓存、网络和调度的整体协同,不能算作单块SSD的功劳。NVIDIA的CMX则更进一步,在HBM与共享存储之间加入Pod级Flash层,并称持续Token吞吐与功耗效率最高可达传统存储方案的5倍;这是厂商口径,实际效果仍取决于缓存命中率、网络和调度。信号已经清楚:SSD开始争的不只是存储容量,而是HBM在实时推理链路中的部分戏份。