Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.025 — 2026-07-29
NEWS 8 信源 约 7 分钟

Kimi K3开源:巨兽模型如何落地

Kimi K3权重落地,但1.4TB体积、80张5090实跑说明:开源不等于人人跑得起。

IMAGE — r/LocalLLaMA 日榜

你可以把“开放模型”想成公开一辆赛车的整套设计和零件。拿到零件当然重要,但它不等于拧上几颗螺丝就能开走:还要有装配工具、足够大的车库,以及能把整套机器协调起来的工程能力。Kimi K3现在正处在这个阶段。权重已经从“承诺发布”变成可下载对象,llama.cpp适配、数据中心部署估算和80张消费级显卡实跑也随即出现。真正值得看的,不只是模型有多大,而是谁能把它跑起来。

本刊7月18日报道Kimi K3时,它已经可以在云端使用,但完整权重仍承诺在7月27日前发布。如今,多则事后帖子交叉确认权重已经落地,并提供官方MXFP4版本。不过,本期材料主要来自Reddit、转引的X内容和第三方工具页面,缺少可直接核对的Moonshot官方模型卡、技术报告与权重仓库。下文涉及架构、速度和部署成本的说法,仍需按各自来源谨慎理解。

2.8T很大,但不是每次都全用

Kimi K3共有2.8T,也就是2.8万亿个参数。参数可以粗略理解为模型在训练中学到的大量数值设置。它采用MoE——“混合专家”架构:模型内部放着许多分工不同的计算模块,每处理一小段文本,只调用其中一部分,而不是让全部参数同时工作。

材料显示,Kimi K3包含896个专家;据一则部署帖转述的平台资料,每个token只激活16个。token是模型切分文字后的基本处理单位,可能是一个字、词或词的一部分。这样的设计让模型可以拥有极大的总容量,同时避免每一步都计算2.8万亿参数。但“少算一些”不等于“少存一些”:要运行完整模型,896个专家的权重仍要放进内存或显存,并在需要时快速调取。

Kimi K3还支持1M-token上下文窗口,也就是一次可处理约100万个文本单位,并具备原生视觉理解能力。长上下文还会产生KV Cache——模型阅读长内容时留下的中间结果,像一叠避免重复计算的草稿纸。上下文越长,这叠草稿通常越占空间。因此,能装下权重只是部署的第一道门槛。

1.4TB权重,先解决“搬进去”

Kimi K3提供MXFP4权重。它是一种低精度数值格式,作用类似量化:用更少位数保存权重,以降低文件、显存和计算需求。单一部署帖估算,其下载体积约为1.4TB。这个数字已经是压缩后的结果。

这也解释了为什么llama.cpp的适配值得关注。llama.cpp是一款广泛使用的本地大模型推理引擎,负责让不同结构和格式的模型在多种硬件上运行。新增的PR #26185让它开始理解Kimi K3的文本架构,但这仍是一个处于讨论中的PR,不能等同于已经合并进正式版本,更不代表视觉能力也已支持。

这项适配解决了一个很实际的搬运问题。PR作者称,Kimi K3的MXFP4权重与llama.cpp内部格式使用相同的数值编码,只是数据排列顺序不同。因此,转换时可以直接无损重排,不必先展开成约5.5TB的BF16中间文件。换句话说,搬家公司只需重新码放箱子,不必把每件物品拆开、复制成更大的版本,再重新装箱。

模型本身的文本架构更复杂。该PR将其概括为Hybrid KDA线性注意力与MLA完整注意力的混合,并列出跨层残差注意力、latent MoE、situ activation等五项新增设计。对普通读者而言,关键不是记住这些名字,而是:现有引擎不能把Kimi K3当成旧模型直接读取,必须新增计算路径和算子支持。PR讨论还指出,部分操作目前只有CPU和CUDA实现,Metal和Vulkan会回退执行。这意味着“能够加载”与“在各种电脑上高效运行”仍是两回事。

数据中心也要算显存账

一则计划部署Kimi K3的帖子按照约1.4TB权重做了容量估算。8张A100 80GB总显存为640GB,连权重都装不下,按容量至少需要三个节点,而且还没计算KV Cache、框架和通信开销。8张H200总显存约1.13TB,完整权重仍至少需要两个节点。8张B300约有2.3TB显存,才可能在单节点装下权重,并给KV Cache留下空间。

这些是工程估算,不是完整基准测试。多卡部署还要把权重和计算拆到不同GPU上。卡数越多,机器之间的数据交换越容易成为瓶颈。所以“三个节点容量够了”只说明仓库面积可能够用,不代表货物能及时送到生产线。

另一位当事人则声称,已经通过25GbE普通以太网,在80张RTX 5090上运行完整Kimi K3,使用官方MXFP4权重,没有重新量化。其首日、未调优、单流速度为20 token/s。这个结果很醒目:它说明数据中心专用GPU并非唯一道路,消费级显卡组成的大规模集群也可能运行这台巨兽。但80张显卡显然不是通常意义上的“本地电脑”,而且速度、配置和“zero HBM”等说法都只有当事方披露,尚无独立复测。

开源的距离,要分三层看

第一层是研究可见性。权重落地后,研究者终于能查看模型内部,而不只是调用云端接口。HF Viewer也已经提供模型图和896个专家的分析页面。这让架构检查、专家行为研究和后续压缩设想有了真实对象。

第二层是工程可运行性。llama.cpp适配表明社区已经开始搭桥,MXFP4无损重排也避开了巨大的中间存储成本。但桥还在施工:PR尚未正式合并,多模态支持不在本次范围内,不同硬件后端的性能也未齐备。

第三层才是普通开发者能否拥有。现有信息给出的答案很克制:个人可以下载和研究权重,但原生运行完整模型仍更接近集群项目。一则帖子认为2至4张RTX 6000 Blackwell工作站卡“基本不可能”原生运行完整模型,不过“本地”如何定义、是否允许主存卸载以及采用何种分布式方案,都会改变结论。社区已经提出蒸馏和专家合并设想,希望把巨型模型压缩成27B、7B或3B版本,但这些目前只是设计方案,不是已经完成的Kimi K3压缩成果。

局限与未知

  • llama.cpp PR目前只针对文本模型,尚不能据此判断何时进入正式版本,也不能推断视觉能力已经可用。
  • 80张RTX 5090的20 token/s来自单一当事方,缺少独立复测;A100、H200与B300部分目前也主要是容量估算,没有完整速度、首字延迟和成本数据。
  • “每单位计算量获得2.5倍智能”是转引的官方宣传口径。材料没有给出“智能”的定义、比较基线和测量方法,不能把它当作已经验证的客观提升。

Kimi K3的权重发布确实跨过了一道关键门槛,但它也把“开放”的层次照得更清楚:能下载、能被推理引擎识别、能在集群里运行、能被普通开发者负担,是四件不同的事。现在第一件已经发生,第二件正在推进,第三件出现了早期案例。至于第四件,可能要等更成熟的引擎、独立基准和真正完成的压缩版本。


供稿材料 SOURCES — 8

← 返回 2026-07-29 · 开源板块