Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
NEWS 4 信源 约 5 分钟

Qwen Flash Next:本地推理的新赌注

125B 总参数却每步只激活 6B,再把大表挪进内存:Qwen Flash Next 重算本地推理账。

IMAGE — r/LocalLLaMA 日榜

你想在家里跑一个更强的 AI,通常会先看显卡够不够大。但 Qwen Flash Next 带来的问题更像搬家:有些东西每天都用,必须放在手边;另一些东西只是偶尔翻一次,可以收进储物间。它试图用较少的活跃计算换取性能,同时把一张庞大的查询表留在系统内存里。这个思路可能降低显存门槛,却没有让模型真正“变小”。值得关注的,正是计算量、内存占用和运行速度之间这笔重新安排的账。

目前的信息主要来自 Reddit 社区帖,尚无模型权重、配置文件、计算过程或实测结果可供交叉核验。下文因此讨论的是一种待发布架构及其可能性,不把它写成已经兑现的产品表现。

125B 很大,A6B 又是什么意思?

据 Reddit 用户 pmv143 的说法,Qwen3.8-Flash-Next 由约 125B-A6B 的主模型和一张 51B 规模的 n-gram 表组成。这里的 B 代表十亿;125B 即约 1250 亿总参数。

但总参数不等于每次都要全部计算。这个模型被描述为采用 MoE——Mixture of Experts,中文常译“专家混合”。它像一个拥有多个专科小组的机构,每次接到任务,只叫其中一部分人参与,而不是让全员同时开会。

“A6B”说的是激活参数:模型处理每个 token——可以粗略理解为一小段文字单位——时,实际参与计算的参数约为 60 亿。于是它出现了一个很有吸引力的组合:模型总体容量很大,每一步真正动用的部分却相对小。

问题也在这里。少算不等于少装。完整参数仍然需要存储,运行时也要考虑它们放在哪里。只盯着 A6B,容易低估整套模型的内存需求。

那张 51B 的表是做什么的?

这套架构还被描述为带有大型 n-gram 表。n-gram 是连续出现的 n 个 token 片段。模型可以借助已经记录的片段辅助预测,有点像输入法看到熟悉的词语开头,便从已有组合里寻找后续。

这张表的代价很直接:它也要占空间。pmv143 估算,在理想的 4-bit 量化下,整套模型约需 82 GB 内存,其中主权重约 58 GB,n-gram 表约 24 GB;实际量化版本可能落在 80—90 GB。

量化,是用更少的数字位数保存模型权重,以压低内存需求。它能让模型更紧凑,但“4-bit”并不意味着最终文件和运行占用一定严格等于理论值。格式、额外数据和推理实现都会影响实际结果。更重要的是,这组数字目前只是单个社区用户的估算,没有公开计算细节或实机验证。

本地友好,关键可能不在显卡里

这套设计最值得讨论的地方,是 n-gram 表据称只会被稀疏访问:模型不会在每一步把整张表全部读一遍。pmv143 因此判断,它适合做系统 RAM offload,也就是内存卸载——把不必常驻显存的数据放进电脑的系统内存,需要时再取用。

这相当于把常用工具留在工作台,把偶尔才查的资料放进旁边书架。显卡不必独自容纳全部内容,本地部署的硬件组合也就多了一种可能。

但卸载不是免费扩容。数据需要在系统内存与显卡之间搬运,这可能拖慢推理速度。80—90 GB 的总占用本身也不算轻巧,更不能直接等同于普通消费级电脑可以轻松运行。所谓“本地友好”,目前更准确的理解是:它可能允许用户用较大的系统内存分担显存压力,而不是把硬件要求降到很低。

它为什么值得现在看?

我们在 8 月 16 日讨论 Qwen3.8-27B 时就强调过,本地能不能跑,不能只看参数量,还要同时看量化方式、上下文长度、推理引擎和硬件。Qwen Flash Next 把这套判断框架又推进了一步:现在还要区分总参数、每步激活参数,以及独立检索表分别占用什么资源。

这也让“模型大小”变得更难用一个数字概括。125B 说明完整模型依然庞大,A6B 指向较低的单步计算量,51B n-gram 表则带来额外的存储和内存压力。三者必须放在一起看。

社区 megathread 给出的预计发布时间是 2026 年 8 月 26 日 15:00 UTC,并附上 Hugging Face 与 ModelScope 页面。不过帖子使用的是“即将发布”和“预计时间”,现有材料不能证明权重已经正式公开。另一则 Reddit 帖的标题声称 Unsloth 会提供 day-0 支持,即发布首日适配,但正文只有一句提醒预留磁盘空间,未附官方公告、仓库或可用性证据,因此也只能视为待确认消息。

局限与未知

  • 架构规模、4-bit 内存估算和 RAM 卸载判断都来自同一位 Reddit 用户,尚缺官方模型卡、权重配置与独立实测。
  • 目前没有速度、效果、功耗或不同硬件上的测试数据,无法判断节省显存后会付出多大的性能代价。
  • 材料混用“Qwen3.8-Flash-Next”“Qwen 3.8 Flash Next”和“Qwen Flash Next”等名称;正式型号、发布时间及 Unsloth 支持情况,仍应以之后的官方信息为准。

供稿材料 SOURCES — 4

← 返回 2026-08-27 · 开源板块