Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.027 — 2026-07-31
PAPER H 1 · HF 338 约 6 分钟

Kimi K3:万亿MoE押注原生视觉

Kimi K3用稀疏激活驾驭2.8万亿参数,并把原生视觉与百万上下文装进同一模型。

你让 AI 一边翻一整柜资料,一边看图,再连续完成一项很长的编程任务。难点不只是“记得多”,还要在有限算力下找对信息,并把前后步骤接起来。Kimi K3 想把这些能力放进同一个模型:它有 2.8 万亿总参数,却不会每次全部动用;同时支持原生视觉和 100 万 token 的上下文窗口。

这次发布值得看的,不只是一个更大的数字。它展示了一种前沿模型的取舍:模型可以很庞大,但每次只调用一部分;可以一次铺开海量图文材料,但还要设法让信息在长序列和深层网络中流动。需要先说明的是,目前材料全部来自 Kimi 团队论文,尚无外部交叉验证。下文涉及性能和效率的结论,均是团队自报结果。

2.8 万亿参数,不等于每次都算一遍

Kimi K3 是一个 Mixture-of-Experts(MoE,混合专家)模型。可以把它想成一间坐着许多专业顾问的办公室:系统拥有庞大的总知识容量,但面对一道具体问题时,只请少数合适的顾问参与,不必让所有人同时开会。

论文称,Kimi K3 共有 2.8 万亿参数。参数可以理解为训练后保存下来的“数字旋钮”,决定模型如何处理输入。不过,每处理一个 token——模型切分文字或其他输入后的基本单位——实际激活的参数为 1040 亿。激活参数比总参数更接近一次处理所需的计算量。

这套稀疏调用由 Stable LatentMoE 完成。论文称,它为每个 token 从 896 个路由专家中选择并激活 16 个。“路由”就是判断当前输入该交给哪些专家。它的关键不只是专家多,而是能否稳定地选对专家,并避免少数专家过忙、其他专家闲置。

团队还称,通过这套设计、改进后的训练与数据方案,Kimi K3 相较 Kimi K2 的整体 scaling efficiency(规模扩展效率,即增加模型规模后,投入能多有效地转化为能力)提高约 2.5 倍。不过论文摘要没有给出这一指标的定义、计算方法和完整对照条件,因此这个数字目前只能视为团队对自身训练体系的概括。

不只把图片接进来

Kimi K3 的另一条主线是原生视觉。所谓原生视觉,是指模型从训练和架构层面共同处理图片与文字,而不是需要看图时再临时外挂一个工具。换句话说,视觉输入属于模型的核心工作方式。

这和百万 token 上下文结合后,目标就不只是“认出一张图里有什么”。上下文窗口是模型一次能够参考的信息总量,像摊在桌面上的全部工作材料。100 万 token 意味着这张桌子可以放下极长的文本或图文输入,但桌面越大,保存中间信息和找到关键内容就越困难。

论文把 Kimi Delta Attention 和 Attention Residuals 列为核心架构。Attention(注意力)是模型判断输入中哪些部分彼此相关的机制;Residuals(残差连接)则帮助信息跨过多层网络继续传递。按团队的说法,前者改善信息沿长序列的流动,后者改善信息穿过模型深度时的流动。一个处理“材料太长”,一个处理“网络太深”。遗憾的是,现有供稿只有论文摘要,没有披露两种设计的具体结构、训练设置或消融实验,因而还无法判断各自贡献了多少。

长任务不能只靠一口气回答

Kimi K3 的后训练覆盖通用任务、智能体任务和编程任务中的强化学习。强化学习是让模型根据任务结果获得反馈,再调整行为的训练方式。智能体则不只回答一个问题,还要规划步骤、调用工具并根据结果继续行动。

团队还为模型设置了多个 reasoning-effort levels,即不同的推理投入档位。直观地说,简单问题可以少花时间,复杂问题则允许模型投入更多计算。论文将这种训练与 compositional generalization(组合泛化,把学会的不同能力重新组合,用于新任务)和长时程执行能力联系起来。

长任务的训练本身也很棘手。论文称,Kimi K3 支持百万 token 的 agentic RL,也就是在超长上下文中训练智能体,并使用 persistent rollout 和 sandbox states。前者可理解为让一次任务轨迹持续保留,而不是频繁从头开始;后者是保存沙箱环境的状态。沙箱是隔离的任务执行空间,例如程序运行到哪一步、文件发生了什么变化。对长时程编程来说,只保留对话而丢掉环境状态,就像记得讨论内容,却忘了代码已经改到了哪一版。

为什么这次值得关注

这次发布把四个通常彼此牵制的目标放到了一起:极大的总容量、较小的单次激活量、原生视觉,以及百万 token 上下文。Kimi K3 的重点因此不是单项功能,而是尝试让它们在同一系统中共同工作。

团队称,Kimi K3 在长时程编程、智能体、知识、推理和视觉任务上达到“frontier-level performance”。这是论文的自我评价,不能直接当作外部确认。在团队选用的评测套件中,Kimi K3 的整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但超过其余受测的开放与闭源模型。这个排名只适用于该评测套件,不能外推为全面领先;供稿也没有独立说明前两者的正式型号身份与可比性。

开放权重同样重要。团队表示已发布 Kimi K3 的完整模型权重。权重是模型训练完成后的核心参数文件,开放它们能让外部研究者部署和研究模型。不过,开放权重不等于训练过程完全开放:现有材料没有说明许可证、下载版本,也没有确认训练代码与数据是否一并提供。

局限与未知

  • 全部架构、效率和性能结论目前只有 Kimi 团队这一个机构信源。尤其是约 2.5 倍规模扩展效率,缺少指标定义和完整对照条件。
  • “原生视觉”尚未披露视觉编码方式与训练范围;百万 token 也只说明技术支持长度,没有给出接近这一长度时的有效记忆和推理表现。
  • 团队所称的完整权重发布,仍需核对实际下载地址、许可证、具体版本,以及开放范围是否仅限权重。

供稿材料 SOURCES — 1
01
Kimi K3: Open Frontier Intelligence arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-07-31 · 学术板块