Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
NEWS 约 1 分钟

Qwen3.8预演Qwen4架构

Qwen3.8转向多模态MoE,并提前亮出Qwen4的架构方向

IMAGE — Simon Willison's Weblog

让一套大模型每次回答都动用全部参数,像每次办事都召集整家公司,能力虽全,计算成本也高。Qwen3.8-Flash-Next改走MoE(混合专家模型)路线:模型由多个“专家”模块组成,每次只调用一部分。它还是多模态模型,可处理文字、图像等不同形式的信息,并开放权重,方便开发者自行部署和改造。

据Simon Willison介绍,这款模型规模为125B,但每次推理仅激活6B参数;活跃参数才是一次回答中真正参与计算的部分,因此更直接影响计算负担。相比本刊此前报道、每次调用整套参数的稠密模型Qwen3.8-27B,这次变化不只是把模型做大,而是换了一种分配算力的办法。更值得留意的是,他称这套设计也是Qwen4架构的早期预演。Willison已在DGX Spark上测试Unsloth量化版本,但仍处于探索阶段,现有材料尚不足以判断实际能力与量化后的损失。


供稿材料 SOURCES — 1
01
Qwen3.8-Flash-Next Simon Willison's Weblog · NEWS
原文 ↗

← 返回 2026-08-27 · 科技板块