Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.039 — 2026-08-12
NEWS 约 1 分钟

英伟达推出Nemotron 3.5 Lightning

英伟达开放新模型,以更少激活参数和本地部署压低企业 AI 推理成本。

IMAGE — WSJ Technology

企业让 AI 长时间处理客服、代码或文档时,账单会随着 Token——模型处理文字的基本计费和计算单位——不断累积。NVIDIA 于 8 月 11 日发布开放权重模型 Nemotron 3.5 Lightning,主打的正是这笔推理成本。开放权重意味着企业可以取得模型参数,自行部署或定制,不必只能按次调用厂商 API。

据 NVIDIA 官方模型卡,Lightning 共有 300 亿参数,但每次仅激活约 30 亿。它采用混合专家模型(MoE),像一家公司接到任务后只派相关专家出场,以较少计算调用较大的总容量;最长支持 100 万 Token 上下文。官方称,模型可部署在单张 H100 或单台 DGX Spark 上,并提供 NVFP4 量化版本——用更低精度表示参数,以减少运行所需资源。

这次发布值得注意的不只是又多了一个模型。NVIDIA 正把竞争从销售 GPU 延伸到模型、量化、解码和部署组成的推理软件栈,并用软硬件协同争夺企业的每个 Token。至于实际成本能降多少,现有材料没有披露独立测算,仍要看具体任务和硬件配置。


供稿材料 SOURCES — 1

← 返回 2026-08-12 · 科技板块