Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.041 — 2026-08-14
REPO 约 1 分钟

Nemotron 30B主打NVFP4闪电推理

30B 总容量、单次仅激活 3B,再用 NVFP4 压低推理成本,适合本地部署玩家关注。

IMAGE — HF Trending Models(模型榜单)

大模型放到本地,常见难题是显存和算力吃不消。NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 的思路,是保留 300 亿参数的总容量,但每次生成只调用约 30 亿参数。它采用 MoE(Mixture of Experts,专家混合)架构,像把任务分给一组专家,每次只请其中几位出场,从而减少实际计算量。

模型还使用 NVFP4——NVIDIA 面向 AI 计算的 4-bit 浮点格式,用更少位数保存和计算数值,进一步压低内存与算力需求。模型页已给出 Transformers、vLLM、SGLang 和 Docker 的启动方式,并明确面向 RTX 5090、DGX Spark、RTX 6000 Pro 等本地部署环境。近 4.5 万次下载说明它已获得相当关注。不过,“闪电”指的是部署后的生成效率;材料没有提供实测速度、显存占用或效果对比,而且 NVFP4 的优势仍依赖相应软硬件支持。


供稿材料 SOURCES — 1
01
nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 HF Trending Models(模型榜单) · REPO
原文 ↗

← 返回 2026-08-14 · 开源板块