新模型发布后,下载到电脑上并不等于能直接运行。推理引擎还得先读懂它的“装配图”:每一层如何连接,每块张量——保存权重和中间结果的多维数字数组——该放在哪里。现在,llama.cpp 已合并对 Qwen3.8-Flash-Next(内部架构名 qwen4_exp)的支持,这意味着它正从架构讨论走向可由主流本地工具加载和执行。
这次适配并非简单改个模型名称。提交加入了新架构的加载与计算逻辑,包括更宽的残差通道、MoE——每次只调用部分“专家”子网络的结构——以及 PLE N-gram 查表记忆。后者会按当前 token 和前几个 token 组成的短片段查找记忆向量;其哈希常数大到普通 32 位整数装不下,因此 llama.cpp 还新增了 UINT64 数组支持。作者称,缩小版模型与当时唯一可用的参考实现 vLLM 对比时,结果处在数值误差范围内。具体速度与不同量化版本的稳定性仍需更多公开测试。