Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.046 — 2026-08-19
NEWS 2 信源 约 1 分钟

Ling 3.0正式接入llama.cpp

Ling 3.0支持代码进入llama.cpp主线,Tiny版低配实测约36 tok/s

IMAGE — r/LocalLLaMA 日榜

想在旧电脑上跑大模型,最先撞上的往往不是模型够不够聪明,而是显存装不下、生成速度又太慢。现在,Ling 3.0 的支持代码已合并进 llama.cpp——一套常用的本地大模型推理工具链。换句话说,用户可以沿用它现有的量化、模型加载和硬件加速方式,运行 Ling 3.0 Tiny 与 Flash;两者都是推理模型。

更值得低配用户留意的是 Tiny 版。它有 8B 参数,但每次生成只激活约 1.3B 参数——也就是只调用模型的一小部分来计算。据 Reddit 用户 cosmos_hu 自述,该模型在一台仅有 4GB 显存的旧电脑上可达到约 36 tok/s,即每秒生成约 36 个 token(模型处理文字的基本单位)。这个成绩只是单台机器的个人实测,速度还会随硬件、量化和上下文设置变化;不过,支持进入 llama.cpp 主线,至少让低显存用户多了一个更容易实际跑起来的选择。


供稿材料 SOURCES — 2

← 返回 2026-08-19 · 开源板块