大模型常见的难题是:想装下更多知识,运行成本也会跟着上涨。Xing4.0-29B-A4B尝试折中——它共有约290亿参数,但处理每个词时只调用约40亿参数,像一个大型专家组每次只派少数人上场。近期其下载量增长137%,升至Hugging Face模型趋势榜第六,成为值得留意的新面孔。
这是一款MoE(Mixture of Experts,混合专家)模型,通过路由机制选择少数专家网络参与计算。开发方称,它原生支持256K上下文、可扩展至512K,并针对复杂工程任务优化;公开权重可通过Transformers、vLLM和SGLang等框架运行。不过,趋势榜反映的是近期下载与关注变化,并非独立能力排名;现有材料也未提供基准测试结果,因此眼下更确定的是社区热度,而不是实际能力处于第六。