你想让本地 AI 读完整个大型代码库,再根据末尾的一处修改继续工作。问题不只在于文字太长,还在于模型本身可能已经塞不进显卡。LayerStoRm 的思路很直接:既然每一步只会用到部分“专家”,就别把整套模型都留在显存里,按需搬过去即可。项目作者称,这让一套总显存96 GB的四卡机器运行了186 GiB的GLM-5.3-Flash,并宣称可支持100万上下文。它值得看,不是因为显存需求消失了,而是因为需求被重新分配到了主机内存和数据通道。
本文数据均来自项目作者在 Reddit 的发布帖,尚无独立复现。尤其是“100万上下文”目前属于能力宣称,帖子没有给出完整100万长度下的吞吐、延迟、内存占用或正确性测试。
把专家留在仓库里
GLM-5.3-Flash采用MoE——混合专家模型。它把模型分成许多“专家”,每次生成只激活其中一部分。这样,实际计算量可以低于同等规模的稠密模型,但所有专家的权重仍然需要存放。
传统做法像是把整座仓库搬进工作间,取货很快,房间却未必装得下。LayerStoRm选择把专家固定在主机内存,也就是CPU一侧容量更大、但离GPU更远的RAM里;模型每生成一个token——可以粗略理解为一个文字片段——系统才把需要的专家权重送进GPU。数学计算仍由GPU完成,CPU不参与模型计算,但它显然仍承担运行时管理和数据输送。
这就是“专家流送”。它用搬运换容量:模型权重可以大于显存,代价是性能更依赖内存带宽、PCIe链路和传输调度。LayerStoRm还会识别NUMA——多颗处理器或多片内存各有“就近区域”的服务器结构——尽量汇聚不同内存区域的DDR带宽。作者称,继续加速后,最终瓶颈会落到PCIe链路速度上。
96 GB显存背后还有208 GB内存
作者测试的配置是两张RTX 5090加两张RTX 5080,总显存96 GB;运行的是186 GiB量化模型GLM-5.3-Flash UD-Q4_K_XL。模型约需208 GB被固定占用的主机内存。实测机器则配有512 GB DDR5和64 GB Xeon Max HBM。
因此,“只需96 GB显存”需要读完整:它不是把186 GiB模型压进96 GB,而是用大量主机内存保存专家,再持续送往四张显卡。作者表示Xeon Max及其HBM并非必需,但没有提供去掉HBM后的对照测试。这更像是把昂贵的显存容量问题,改造成主机内存容量和高速搬运问题,并不等于普通电脑已经能轻松运行。
在已披露的测试中,8k上下文的解码速度为每秒24.5 token;空上下文标注为每秒27.0 token。27k输入的预填充速度为每秒159 token。预填充是模型先读完输入,解码才是随后逐段生成答案,两组速度不能直接混为一谈。更重要的是,每秒24.5 token对应8k测试,不能写成“百万上下文下每秒24.5 token”。
长上下文不只占模型权重
上下文是模型一次推理可以参考的输入历史。它越长,KV Cache也越大。KV Cache可以理解为模型阅读长文时留下的中间笔记,避免每生成一步都从头计算。因此,所谓百万上下文不仅要求模型权重有地方放,还会带来很大的运行时内存压力。
LayerStoRm面向代理式编程加入了前缀缓存和提示词中段检查点。前缀缓存会保留已经处理过的共同开头;检查点则像在长文中插入存档。若修改发生在提示词98%的位置,系统可以从最近的存档继续,而非重读全文。作者报告,8k场景的首token等待时间从67.5秒降至18.4秒;97k场景从约923秒降至79秒。
这个降幅很醒目,但条件也很具体:系统已经有缓存和检查点,而且编辑发生在98%深处。它不代表冷启动,也不代表任意请求都能获得同样改善。
为什么值得关注
LayerStoRm展示了一条务实路线:本地推理未必非要让全部模型常驻显存。对于MoE,系统可以围绕“每步只用部分专家”重新编排存储和传输。作者还提供单命令自动配置,声称系统能根据模型权重与硬件生成方案并解释各字段;其他RTX 50系列混搭理论上也应可用。不过,目前只有这台机器经过测量。
据项目作者在Reddit的介绍,LayerStoRm主要利用业余时间开发。2026年8月25日首次公开时,GLM-5.2约为每秒10 token;不到两周,作者换用GLM-5.3-Flash并公布了8k下每秒24.5 token的结果。这种快速迭代说明个人开发者也能探索大模型推理的系统边界,但它离成熟、通用的产品仍有距离。
局限与未知
- “100万上下文”缺少完整实测。现有延迟数据最高到97k,吞吐数据对应的长度更短,也没有百万长度下的正确性结果。
- 项目仍属experimental,采用MIT许可证开源,当前仅支持NVIDIA SM120;性能、稳定性和复现性尚未得到独立验证。
- 自动配置及其他RTX 50系列组合“应能工作”只是作者推测。当前证据只能说明已公布的四卡机器结果,不能外推到普通消费级主机。