想在旧电脑上跑大模型,最先撞上的往往不是模型够不够聪明,而是显存装不下、生成速度又太慢。现在,Ling 3.0 的支持代码已合并进 llama.cpp——一套常用的本地大模型推理工具链。换句话说,用户可以沿用它现有的量化、模型加载和硬件加速方式,运行 Ling 3.0 Tiny 与 Flash;两者都是推理模型。
更值得低配用户留意的是 Tiny 版。它有 8B 参数,但每次生成只激活约 1.3B 参数——也就是只调用模型的一小部分来计算。据 Reddit 用户 cosmos_hu 自述,该模型在一台仅有 4GB 显存的旧电脑上可达到约 36 tok/s,即每秒生成约 36 个 token(模型处理文字的基本单位)。这个成绩只是单台机器的个人实测,速度还会随硬件、量化和上下文设置变化;不过,支持进入 llama.cpp 主线,至少让低显存用户多了一个更容易实际跑起来的选择。