企业让 AI 长时间处理客服、代码或文档时,账单会随着 Token——模型处理文字的基本计费和计算单位——不断累积。NVIDIA 于 8 月 11 日发布开放权重模型 Nemotron 3.5 Lightning,主打的正是这笔推理成本。开放权重意味着企业可以取得模型参数,自行部署或定制,不必只能按次调用厂商 API。
据 NVIDIA 官方模型卡,Lightning 共有 300 亿参数,但每次仅激活约 30 亿。它采用混合专家模型(MoE),像一家公司接到任务后只派相关专家出场,以较少计算调用较大的总容量;最长支持 100 万 Token 上下文。官方称,模型可部署在单张 H100 或单台 DGX Spark 上,并提供 NVFP4 量化版本——用更低精度表示参数,以减少运行所需资源。
这次发布值得注意的不只是又多了一个模型。NVIDIA 正把竞争从销售 GPU 延伸到模型、量化、解码和部署组成的推理软件栈,并用软硬件协同争夺企业的每个 Token。至于实际成本能降多少,现有材料没有披露独立测算,仍要看具体任务和硬件配置。