训练大模型像让一支庞大团队协作:人越多,协调成本越可能吃掉效率。Olmo-core 3不是聊天模型,而是一套开放的训练基础设施,负责把模型在多台GPU上训练出来。它针对混合专家模型(Mixture of Experts,MoE)重做了训练系统:模型包含许多“专家”子网络,但处理每个词元——模型读取文本的基本单位——时只调用少数几个。
最值得注意的是扩容方式。据发布方测试,专家数量从8个增至128个,每个词元仍只调用4个专家,实际参与计算的参数维持在约32亿;模型总参数量则从46亿增至470亿,训练吞吐量下降不到5%。换句话说,底座让模型装下更多“专长”,却没有让每次计算按总规模同步变重。另一项初步测试中,470亿参数MoE在8张NVIDIA B300 GPU上达到每卡每秒5.2万个词元,约为旧实现的2.7倍。
它的意义不只在速度。开放训练比只开放模型权重多走一步:研究团队还能看到并修改生成这些权重的代码与过程,更容易复现和扩展大规模MoE。不过,上述性能数字均来自发布方自测,摘要未提供独立复现结果。