Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
PAPER H 12 约 1 分钟

闪存加入大模型推理内存层级

FLINT把高带宽闪存接入显存层级,让单卡有机会容纳更大的模型。

大模型像一本塞不进书桌的巨型工具书:模型权重——训练后得到、推理时反复读取的海量数字参数——常常超过单张加速卡的显存容量。FLINT 的思路,是在高速但容量有限的 HBM(高带宽显存)旁边,加一层容量可达多 TB、但读取更慢的 HBF(高带宽闪存),让单卡和小型节点不必只为“装下模型”而堆更多加速器。

它最值得注意的一步,是不再让编译器提前猜下一批要搬哪些权重。运行时,FLINT 的硬件控制器观察加速器实际发出的零散读取请求,把集中于同一权重块的请求合并成一次较大的闪存读取,并在当前一批数据用完前启动下一批。像厨师根据案板上食材的消耗速度备下一道菜,而不是按固定时刻表备料。论文称,这还能直接利用闪存内部已有的页缓存,省去专门的 SRAM 暂存区;同时把耗时的闪存刷新移出推理关键路径。实验覆盖稠密模型和 MoE(混合专家模型,即每次只调用部分参数的模型),但供稿中的部分效果数字缺失单位或格式,本文不据此作定量比较。


供稿材料 SOURCES — 1

← 返回 2026-08-30 · 学术板块