造一台复杂机器,通常只能等完工后看成品;Marin 这次却把“施工现场”直接开放。这个源于斯坦福基础模型研究中心 CRFM 的项目,正在训练 Marin 535B-A23B,并计划连续约三个月公开代码、数据配方、模型配置、技术讨论和 Loss 曲线——Loss 是模型预测误差的数值,整体是否下降,能帮助外界判断训练是否稳定。
据 InfoQ 报道,模型约有 5350 亿总参数,但每处理一个 Token(模型读取文本的基本单位),只激活约 230 亿参数。它计划处理 18.75 万亿 Token,其中约八成用于预训练、两成用于更有针对性的中期训练;算力来自 11 套 NVIDIA GB200 NVL72 系统,总计算量预计约为 2.7×10²⁴ FLOPs。
真正值得看的不是参数纪录,而是训练尚未完成、甚至可能失败时,外界就能检查决策、修改和异常。它目前还不是可供横向比较的成品;价值在于留下一个少见的、接近全过程可审计的超大模型训练样本。