Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.030 — 2026-08-03
NEWS 2 信源 约 1 分钟

Kimi K3被塞进8GB内存电脑

C99 引擎让 Kimi K3 在 8GB 级内存运行,代价是每个 token 等约半分钟。

IMAGE — r/LocalLLaMA 日榜

把 TB 级大模型塞进 8GB 级内存电脑,有点像不把整座仓库搬进屋,而是用到哪箱就临时取哪箱。社区开发者 FareedKhan557 为 Kimi K3 写了一个 C99 推理引擎——C99 是一版通用的 C 语言标准。它不让全部权重常驻内存,而是利用 MoE(混合专家模型每次只调用少数“专家”模块)的特点,从 NVMe 固态硬盘按需读取。

作者称,K3 的 1.56 TB 检查点中,93% 是可路由专家;每生成一个 token,只启用 896 个专家中的 16 个。引擎直接读取压缩成 4-bit 的专家权重并计算,无需先完整解压;其测试机器峰值内存为 8.24 GB,但速度约为 33 秒一个 token。即使把内存提高到约 128 GB,也只有约 20 秒一个 token。

这不是实用部署方案:作者明确表示,它还需要约 1.7 TB 空闲磁盘,也没有 GPU、BLAS 或框架加速。它的意义更像一次下限测试:权重流式读取确实能把容量门槛压得很低,但代价会转移到硬盘吞吐和等待时间上。


供稿材料 SOURCES — 2

← 返回 2026-08-03 · 开源板块