你想把一台巨型工厂搬回自己的机房。它每次只开动少数车间,电费未必按整座工厂计算;但所有车间仍得有地方安置。Qwen3.8-2.4T-A95B 大致就是这种模型:总参数约 2.4 万亿,一次处理文本时激活约 950 亿。它用“少干活”控制单次计算量,却没有让庞大的模型权重凭空消失。
这次值得看的,不只是参数数字。我们在 8 月 4 日报道 Qwen3.8-27B 与 Qwen3.8-Max 时,它们还处在预告阶段,缺少权重页面和技术报告。现在,Qwen 已在 Hugging Face 放出 2.4T-A95B 的后训练模型权重与配置文件。关注点也随之改变:问题从“Qwen 3.8 会是什么”,转向“这样一台万亿参数模型,社区究竟怎样接住”。本文事实均来自 Qwen 的这一个模型仓库,尚未经过独立信源交叉验证。
2.4T-A95B,两个数字管两件事
型号里的 2.4T 表示模型总共有约 2.4 万亿参数;A95B 表示每处理一个 token——模型切分文字后的基本单位——约有 950 亿参数参与计算。
这种设计叫专家混合模型(Mixture of Experts,MoE)。模型把参数分给许多“专家”,再由路由机制针对每个 token 挑选少数专家工作。仓库列出的配置是 512 个专家,每次启用 10 个路由专家和 1 个共享专家。
它的好处很直观:模型可以扩充总容量,而不必在每一步都动用全部参数。但“没有参与本次计算”不等于“不必保存”。2.4 万亿参数仍会影响权重的总体积,以及存储和内存规划。950 亿激活参数则更直接地影响一次推理需要完成多少计算。换句话说,这不是普通个人电脑因为 MoE 就能轻松运行的模型。
权重开放,部署问题才刚开始
开放权重,指用户可以下载模型参数并自行部署。它不自动等于训练数据、训练代码和全部开发过程都已开源;实际能否使用,还要看许可证与硬件条件。
Qwen 仓库称,这份模型采用因果语言模型结构,经历预训练与后训练,共 92 层;原生上下文长度为 262,144 个 token,并可扩展到 1,010,000 个 token。上下文长度可以理解为模型一次能够放在眼前处理的文本窗口。仓库同时给出了 Transformers、vLLM、SGLang 和 Docker Model Runner 的加载或服务示例。
不过,示例命令不是一键运行的保证。超大模型往往需要分布式推理——把模型拆到多张显卡或多台机器上协同处理。机器之间还要频繁传递数据,通信本身也会增加开销。仓库页面没有提供一套具体硬件配置、实际内存占用或吞吐数据,因此目前还不能回答“需要多少设备、能跑多快、成本多高”。
为什么这次现身重要
第一,它把 Qwen3.8 的开放模型从消费级讨论推到了万亿参数规模。社区面对的不再只是如何量化后塞进单机,而是怎样切分权重、安排内存,并控制多机通信。
第二,这个仓库装的是后训练模型。后训练指模型在基础训练之后继续接受调整,使其更适合对话和任务执行。Qwen 将其称为开放模型家族中能力最强的一代,并宣称它改善了编程、专业工作、研究和长流程智能体任务。但页面没有给出这份开放权重自身的完整基准结果;所展示的表格主要比较 Qwen3.8-Max 等模型,不能直接拿来证明 2.4T-A95B 的实际效果。
第三,Qwen3.8-Max 与这份开放权重并不是同一个产品。仓库称,Max 以 2.4T-A95B 为基础,另带视觉输入、非思考模式、默认百万 token 上下文和内置工具等功能。读者看到 Max 的功能或成绩时,不应自动视为开放权重也全部具备。
局限与未知
- 所有信息来自 Qwen 自己的 Hugging Face 仓库,尚无独立部署报告可供核对。
- 页面虽声称模型兼容 vLLM、SGLang、TokenSpeed 等工具,但使用指引不能替代第三方兼容性验证。
- 仓库未给出许可证、推荐硬件、实际推理成本及开放权重的完整基准成绩。现阶段最确定的新进展,是旗舰权重与配置已经现身;它是否容易部署、表现是否符合官方定位,仍需社区实测。