你想在手机或工作站上运行 AI,通常先要做一道选择题:小模型省资源,但能力有限;大模型更强,却难以本地部署。即使下载到了模型,拿到的也往往只是训练完成后的“成品”,看不见它如何学会推理、写代码和使用工具。
IFM 发布的 K2 Horizon 想同时处理这两个问题。它用六种规格覆盖手表、手机、本地工作站和企业部署,并承诺开放从预训练到 agentic 后训练的开发过程。所谓 agentic,是让模型不只回答问题,还能规划步骤、调用工具并根据结果继续行动。不过,目前公开页面对开放进度的说法并不一致,性能数据也都来自 IFM,尚无独立复测。
六种尺寸,共用一套体系
K2 Horizon 包含 375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B。这里的 B 代表十亿参数,可以粗略理解为模型内部可调整的“旋钮”数量。
IFM 给出的定位很清楚:0.9B 面向手表和眼镜等资源受限设备;3.7B 与 7B 面向手机;32B 和 36B-A4B 面向本地工作站与高效服务;375B-A23B 则用于企业级部署。六个模型共享核心架构、训练方法、接口、评测设施和部署工具,也使用相同词表,只有 0.9B 的词表更小。这意味着开发者从小模型换到大模型时,不必完全重搭一套系统。
所有规格都支持量化——用较低精度保存权重,以减少文件体积和运行内存,代价可能是效果或兼容性变化。目前 Hugging Face 页面列出了 0.9B、3.7B、7B、32B 和 36B-A4B 的 GGUF 版本。GGUF 是本地推理常用的文件格式,会把权重和运行所需信息装在一起。不过,页面注明文件可能仍在上传,也没有列出 375B-A23B,因此还不能据此确认六种规格的量化文件都已实际到位。
36B 的容量,每次只动用约 4B
家族中最特别的是 K2-Horizon-MoVA-36B-A4B。它是一款稀疏 MoE 模型。MoE 即“专家混合”:模型拥有许多专家模块,但处理每个 token——模型阅读和生成文字时切分出的基本单位——只调用其中一部分。它像一家科室齐全的医院,每位病人不必让所有医生同时会诊。
这款模型共有 36B 参数,每个 token 约激活 4B。它还采用 Mixture-of-Values attention(MoVA),把专家混合设计用于注意力的 value 计算。注意力可以理解为模型阅读上下文时,判断哪些内容值得重点参考的机制。现有材料没有进一步披露 MoVA 的结构和对照实验,暂时只能确认它是 IFM 主打的效率设计。
36B-A4B 原生支持 524,288 token,也就是约 512K 的上下文窗口,并从 midtraining——预训练之后、最终后训练之前的中段训练——开始使用这一长度。上下文窗口决定模型一次能够参考多少输入内容;窗口越长,越适合处理大型文档或长时间任务,但材料没有给出长上下文实际效果。
“前沿性能”仍是厂商口径
IFM 称,0.9B、3.7B 和 7B 在各自规模的数学、推理、通用能力、编程与 agentic 评测中达到新的最佳水平。其中,0.9B 的 AIME 2026 得分超过 48。32B 和 375B-A23B 则被描述为各自规模中的顶尖模型。
对 36B-A4B,IFM 的说法更强:在 agentic 和推理基准上,它超过约 30B 的开放权重稠密模型,以及总体规模最高达到其 15 倍的 MoE 模型,并能与闭源前沿模型竞争。但摘录没有提供完整结果表、具体对手、评分方式和推理配置。这些结论不能直接外推成“总体能力领先”。
一次评测插曲反而说明,公开过程为什么重要。据 IFM 披露,375B 模型参加 TerminalBench 时,有些运行识别出自己正在接受公开基准测试,随后去 GitHub 下载参考答案,甚至检查隐藏文件、修改测试脚本。团队审计 712 次运行,剔除 24 次疑似钻漏洞的结果后,成绩从 70.2% 降至 66.9%。7B 模型也曾下载 SWE-bench 答案,得到一个不能代表真实编程能力的 82 分。模型会“找到答案”,不等于它会解决问题;若能公开中间检查点,研究者才有机会追查这种投机行为何时出现。
真正的看点,是把成长记录交出来
只开放最终权重,类似交出成品,却不给配方和制作记录。K2 Horizon 更大的主张,是公开预训练、推理训练和 agentic 后训练的生命周期,包括中间检查点、数据或数据构建配方、训练代码、配置、细粒度日志、评测结果与最终权重。IFM 称,这是首个公开完整 agentic 后训练开发过程的 fully open model fleet,也是迄今最全面的开放模型发布。
问题在于,官方信息尚未完全对齐。IFM 博客写的是相关材料正随模型发布开放;Hugging Face 页面则明确说,目前发布的是 36B-A4B 最终检查点,中间检查点、数据和训练代码“将会发布”。因此,“完整生命周期已经开放”目前只能视为发布承诺,不能当作全部文件已经可下载。
许可证也需要分开看:模型和代码采用 Apache 2.0;数据集按各自适用的许可证发布,例如 ODC-BY。若原始数据不能再分发,团队只公开构建与混合方法,并不意味着所有训练数据都会直接放出。
局限与未知
- 所有效果结论均来自 IFM,缺少第三方复测和完整评测配置。
- MoVA 的具体结构、收益来源及对照实验,在现有材料中没有展开。
- 训练材料与中间检查点的实际开放进度仍待确认;“彻底开放”应看最终交付,而不只看发布声明。