Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.037 — 2026-08-10
NEWS 约 1 分钟

小MoE本地写代码快近四倍

本地代码测试中,Qwen 小 MoE 快约 3.9 倍,常规任务表现却接近稠密版。

在电脑上跑编程助手,等待模型逐字生成往往比修一个小错误还磨人。一位 Reddit 用户的本地测试显示,Qwen 3.6 35B-A3B 生成速度约为每秒 116 Token(模型处理文字的基本单位),而 27B 稠密版约为 30 Token,前者快约 3.9 倍。MoE 是“混合专家”模型:每次只调用部分参数;A3B 表示每个 Token 约激活 30 亿参数。稠密模型则会动用各层的大部分参数,计算通常更重。

更值得注意的是,速度差没有变成同等悬殊的代码能力差。在普通修错和跨文件修改中,两者通常都能正确完成;一项解析器修复测试里,两者暂定得分均为 7/10。任务变难后,27B 稠密版才在隐含规则、罕见边界情况,以及请求未明说的连带影响上显出优势。

这只是作者在 Radeon AI PRO R9700、llama.cpp 和 8K 上下文下做的小规模实验,且两款模型采用了不同量化方案——即用较低精度保存权重。因此它不能证明 MoE 普遍胜过稠密模型,但说明对本地编程助手而言,较少的激活参数未必意味着成比例的能力损失。


供稿材料 SOURCES — 1

← 返回 2026-08-10 · 开源板块