Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.055 — 2026-08-28
NEWS 约 1 分钟

Qwen新架构为何押注N-gram

社区解读Qwen4Exp:让MoE负责推理,让N-gram承担记忆查找

想象模型一边做题,一边翻常用短语卡片:真正需要推理的部分交给大脑,见过很多次的局部模式则直接查表。这篇社区解读认为,Qwen4Exp值得关注之处,正是把一部分参数从传统MoE转移到N-gram表,尝试重新分配“计算”和“记忆”。目前材料仅来自作者Beamsters的解读,可能存在误差。

MoE(Mixture of Experts,混合专家)会让路由器根据每个token的中间状态,临时挑选少数专家网络参与计算。作者称,这个选择出现得较晚,专家数据又大,因此不适合频繁从SSD读取。N-gram则是连续N个token组成的短片段;这里的表会按最近几个token生成地址,只取少量向量并送回模型,更像查记忆卡。地址能提前确定,单次读取据称通常只有几KB,因此更适合把大表放在容量更大、但速度慢于RAM的SSD中。

按作者给出的数字,Qwen4Exp约有125B参数留在MoE网络,另有51B放入N-gram表,每个token实际激活约6B参数。作者将其概括为“专家做推理,N-gram做回忆”,并称固定预算下,N-gram约占总参数的20%至25%往往有益;再继续挤压推理参数,模型可能退化成只会取回记忆的机器。不过,摘要没有披露实验设置和完整对照数据,这些比例与效果仍应视为社区作者的判断。


供稿材料 SOURCES — 1
01
N-gram vs Experts explained r/LocalLLaMA 日榜 · NEWS
原文 ↗

← 返回 2026-08-28 · 开源板块