模型权重能下载,不等于本地软件就能直接打开。Unsloth正在补上Kimi K3的这道“装箱”工序:开始发布GGUF——llama.cpp等本地工具常用的模型文件格式,把权重和运行信息打包在一起。其中MXFP4版本约1.5TB;MXFP4是压缩模型数值、降低内存需求的4位浮点格式。配套的mmproj也已出现,它负责把图片转换成语言模型能接收的表示,让图文理解流程能够接上。
不过,“能够启动”和“用得顺手”仍是两回事。Reddit用户Aroochacha在512GB内存、两张96GB RTX 6000 PRO的工作站上实测:处理提示词约0.41 Token/秒,生成约0.23 Token/秒;回答一个编程问题生成400个Token,用时近30分钟。这说明GGUF落地解决的是工具能否读取的问题,并未消除巨型模型的硬件与速度门槛。