训练大模型像搬一件单机装不下的重家具:团队既要把模型和计算拆给多张 GPU,甚至多台机器,又不想丢掉原来熟悉的模型与工具。NVIDIA-NeMo 的 Automodel 正在补上这层衔接:底层直接使用 PyTorch 的分布式能力,上层兼容 Hugging Face 的模型格式、加载接口和 checkpoint(训练过程中保存的模型状态),让团队能以较少改动沿用现有资产。
它值得关注的地方,不只是“又支持了几个模型”,而是把不同规模、不同微调方式整理进同一套训练入口。项目记录显示,Automodel 已为 Inkling-Small 提供在 64 张 H100 GPU 上进行全参数微调的方案;全参数微调会更新模型全部权重,资源需求较高。它也覆盖 LoRA——只训练少量附加参数的轻量方案,例如用于 Cohere Labs 的 24 亿参数视觉语言模型。换句话说,Automodel 想同时接住 Hugging Face 的模型生态与 PyTorch 的原生分布式训练;不过现有材料主要列出支持范围和训练配方,未披露统一性能对比。