如果一家公司想把 AI 接进内部系统,它往往不只关心“答得聪不聪明”,还要算另一笔账:每回答一次要花多少算力,敏感数据能不能留在自己手里。10 月 5 日,美国初创公司 Reflection AI 正式发布首款前沿模型 Beam,给出的卖点正是“能力够强、运行更省,还能自行部署”。这让它成为美国开放权重阵营回应 DeepSeek、Qwen 和 Z.ai 的一次重要尝试。
不过,眼下关于 Beam 的参数、性能和成本数据主要来自 Reflection 自己,尚未经过独立验证。公司宣布了模型,但权重及完整技术细节要到本月稍晚时候才会公开。
先把大模型做大,再少叫几个人干活
Beam 是一款纯文本的混合专家模型(Mixture-of-Experts,简称 MoE)——模型内部像是分成多个“专家小组”,每次处理任务只调用其中一部分,以较大的总容量换取较可控的单次计算量。
它共有 5010 亿个参数,但每次运行只激活 230 亿个。Reflection 称,Beam 使用 23.8 万亿个 token 完成预训练;token 是模型处理文字时采用的基本单位,可以粗略理解为拆分后的字词片段。它的上下文窗口达到 100 万 token,也就是一次可以接收和处理的文本范围。
公司把 Beam 定位为面向企业、公共部门和开发者的“workhorse model”,也就是承担日常重活的主力模型。它针对推理、编程和 agentic tasks 做了优化。后者指模型不只回答问题,还能分步骤调用工具、执行任务。
Reflection 宣称,Beam 在高级推理基准上与 Z.ai 的 GLM-5.2 相当,同时以少 3—4 倍的推理算力超过西方领先开放模型。推理算力就是模型收到请求后生成答案所消耗的计算资源;对每天调用成千上万次 AI 的企业来说,这会直接影响速度和成本。
这些数字需要谨慎看。推理基准是在统一题目上测试数学、编程或多步思考能力,适合横向比较,却不能完整代表真实业务表现。TechCrunch 也明确指出,Reflection 的性能说法尚未获得独立验证。
“美国 DeepSeek”首先是一种竞争叙事
开放权重模型会把训练完成后的核心参数交给外部使用,企业可以自行部署或微调。但开放权重不等于完整开源:训练数据、训练代码和许可证未必全部公开。因此,把 Beam 简单称为“开源模型”并不准确。
这个市场近年由 DeepSeek、Qwen 等中国模型推动。我们 9 月 21 日曾报道,中国模型正凭借低价、公开权重和兼容接口进入全球企业工作流。Beam 的意义,在于一家资金雄厚的美国公司开始正面争夺同一套生态。
发布前的多家报道已经为它贴上“美国版 DeepSeek”的标签,并称其可能仍弱于美国最尖端模型,但有望同中国头部开放权重模型竞争。如今 Beam 已经亮相,Reflection 给出的官方比较也沿着这条叙事展开。不过,“美国 DeepSeek”是媒体框架,不是已经得到验证的能力结论。
Reflection 还称,Beam 在双方都公布成绩的四项编程测试中超过 Thinking Machines Lab 的 Inkling。但这是 Reflection 自测,而且 Beam 是纯文本模型,Inkling 是能处理多种信息形式的多模态模型,不能由这四项测试直接推断两者的综合高下。
NVIDIA 押注的不只是一款模型
Reflection 由两名前 Google DeepMind 研究人员在 2024 年创办,NVIDIA 既提供支持,也是其重要股东之一。据 TechCrunch 援引 PitchBook 数据,公司累计融资约 47 亿美元,最近一轮投前估值为 250 亿美元。另有报道称其四轮融资超过 50 亿美元,NVIDIA 两轮合计投入 13 亿美元,但两组数字可能采用了不同时间点或统计口径,目前无法直接合并。
据 The Information 和 Axios 报道,Reflection 最初从事自主编程 agent,创始人与 NVIDIA CEO Jensen Huang 会面后,战略转向开放模型。这个变化与 Huang 长期推广的“AI factory”概念相互呼应:机构把芯片、模型和自己的私有数据组合起来,在本地训练和定制 AI 系统。
Reflection 想把这种“AI 工厂”卖给企业和主权国家,并已宣布与韩国 Shinsegae Group 开展相关合作。公司还与 SpaceX、Nebius 签署了总值超过 70 亿美元的算力协议,以获得 NVIDIA GB300 芯片至 2029 年。换句话说,NVIDIA 押注的不只是 Beam 的排行榜成绩,也是一条会持续消耗 GPU、同时让客户掌控数据的产业路线。
局限与未知
- Beam 的权重和完整技术细节尚未公开,外界暂时无法复现其训练与测试结果。
- “少 3—4 倍推理算力”等关键结论均来自 Reflection,具体比较条件尚不清楚,也没有独立验证。
- 融资总额存在约 47 亿美元与超过 50 亿美元两种口径,仍需以原始融资记录核对。