显存装不下完整模型时,电脑只能在 GPU 显存和系统内存之间来回搬权重,像做饭时反复去储藏室取常用调料,生成速度也会被拖慢。开发者 nbvehrfr 的做法是:不再把整层模型搬进显存,而只留下“热专家”——在某类任务中被频繁调用的专家模块。
这里的 MoE(Mixture of Experts,混合专家)会把模型拆成许多专家,每个 token 只调用少数几个;但全部权重仍要有地方存放。作者观察到,在编程、重构和代码审查任务中,部分专家的调用较稳定,因此让它们常驻显存,减少从系统内存反复取数。在其 llama.cpp 分支和 Qwen 3.8 Flash Next 测试中,作者自述生成速度由 20 提至 30 tok/s,约快 50%;tok/s 只表示每秒生成多少 token,不代表答案质量。
这项尝试目前只测过编程负载,也只适用于完整模型放不进显存的情况;作者还表示,该改动大概不会被上游项目接纳。