想在资源有限的设备上运行 AI,常见难题是:模型容量越大,计算压力往往也越重。Ling 3.0 Tiny 试图拆开这组矛盾。它共有 7.9B(79亿)参数,但处理每个 token——模型读写文字时使用的基本单位——只激活 1.3B(13亿)参数。
它采用 MoE(Mixture of Experts,混合专家)思路:模型像一个由多名专家组成的团队,每次只请少数人参与,而不是全员同时工作。激活参数因此更接近单步计算负担。不过,未激活的参数仍要存放,1.3B 并不代表它只占一个 1.3B 模型的存储空间。
据发布者 niacolhealth 在 Reddit 的介绍,Ling 3.0 Tiny 是一款原生混合推理模型,可在直接回答与展开中间推理之间切换,面向现实任务、数学、指令遵循和资源敏感部署。现有材料未披露具体评测成绩与设备要求,因此眼下最值得关注的是它的计算配置,而非未经展示的能力提升。