大模型像一本塞不进书桌的巨型工具书:模型权重——训练后得到、推理时反复读取的海量数字参数——常常超过单张加速卡的显存容量。FLINT 的思路,是在高速但容量有限的 HBM(高带宽显存)旁边,加一层容量可达多 TB、但读取更慢的 HBF(高带宽闪存),让单卡和小型节点不必只为“装下模型”而堆更多加速器。
它最值得注意的一步,是不再让编译器提前猜下一批要搬哪些权重。运行时,FLINT 的硬件控制器观察加速器实际发出的零散读取请求,把集中于同一权重块的请求合并成一次较大的闪存读取,并在当前一批数据用完前启动下一批。像厨师根据案板上食材的消耗速度备下一道菜,而不是按固定时刻表备料。论文称,这还能直接利用闪存内部已有的页缓存,省去专门的 SRAM 暂存区;同时把耗时的闪存刷新移出推理关键路径。实验覆盖稠密模型和 MoE(混合专家模型,即每次只调用部分参数的模型),但供稿中的部分效果数字缺失单位或格式,本文不据此作定量比较。