Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.037 — 2026-08-10
NEWS 约 1 分钟

LongCat-Flash开始接入llama.cpp

LongCat-Flash适配代码进入llama.cpp测试阶段,本地运行路径正在打通

IMAGE — r/LocalLLaMA 日榜

想在个人电脑上运行一个新模型,光有模型文件还不够,常用的本地推理工具也得先“看懂”它。LongCat-Flash 的支持代码如今已提交至 llama.cpp——一个常用于 CPU 和消费级显卡运行大模型的项目——并进入待测试阶段。这意味着它离更方便的本地部署近了一步,但目前仍是 Pull Request(PR,即等待维护者审查、验证和合并的代码改动),还不能视为正式支持。

适配的难点在模型结构。LongCat-Flash-Lite 是一个 68.5B 参数的 MoE(混合专家)模型,每次推理只激活约 3B 至 4.5B 参数;它还包含 256 个普通专家、128 个“零计算”专家,以及特殊的嵌入、注意力和双层映射设计。提交者称,这套实现已能完成 GGUF——llama.cpp 常用的模型文件格式——转换和推理,并在 NVIDIA GB10 上以 Q4_K_M 量化达到约每秒 57 个 token。不过代码仍需测试,复杂结构是否会被项目接受、实际兼容性如何,都还有待确认。


供稿材料 SOURCES — 1

← 返回 2026-08-10 · 开源板块