本地跑模型,有时不是机器带不动,而是工具还“不认识”它;更麻烦的是,模型明明启动了,却反复输出同一段话,或干脆不进入推理。Laguna 这次同时补上两块短板:llama.cpp——让大模型在个人设备上运行的常用工具——已接入 Laguna XS.2 与 M.1,意味着这两个型号的结构和计算方式有了对应适配。
其中,XS.2 是总参数 33B、每个 token 激活 3B 的混合专家模型;M.1 则是 225B、每个 token 激活 23B。混合专家可以理解为模型每次只调用一部分“专门小组”,而非让全部参数同时工作。与此同时,Laguna S 2.1 的部分量化版本仍出现循环输出;量化是用更低精度保存权重,以换取更小文件和更低内存占用。另据 Reddit 用户观察,Poolside 团队在 24 小时内两次更新聊天模板,并修补了关闭 preserve_thinking 后推理无法启动的问题。聊天模板负责把指令整理成模型熟悉的格式,配错就可能导致推理异常或无法停止。现有用户应及时更新 llama.cpp、模型文件与模板;材料尚未说明循环故障是否已在所有量化版本中彻底解决。