Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.048 — 2026-08-21
NEWS 约 1 分钟

八年前的V100吃上NVFP4

专用内核让四张2017年V100跑起NVFP4,单请求解码追平RTX 5090

IMAGE — r/LocalLLaMA 日榜

旧显卡通常吃不下为新芯片准备的模型格式,就像老播放器打不开新编码。开发者 Simple_Library_2700 却用专用推理内核——直接在 GPU 上处理运算和数据转换的底层程序——让四张 2017 年的 V100 无需改动权重,运行面向 Blackwell 的 NVFP4。NVFP4 用 4 位浮点数压缩模型,可减少存储和内存带宽需求,而 V100 本身没有对应的硬件单元。

据作者在同一实验环境下测试,运行 Qwen 3.8、解答 AIME 2026 第 1 题时,四张 V100 的单请求解码速度为 219.1±5.9 tok/s,RTX 5090 配合专用引擎 NInfer 为 214.7±9.2 tok/s,区间重叠。关键不在于 V100 每轮更快:它每轮耗时 26.9 毫秒,比 5090 的 19.9 毫秒更慢;但每轮确认的 token 更多,分别为 5.89 和 4.27,两者恰好抵消。这里的“追平”仅指一次服务一个生成任务的特定测试,且对比的是四张 V100 与一张 RTX 5090,不能理解为老卡整体性能已经持平新卡。


供稿材料 SOURCES — 1

← 返回 2026-08-21 · 开源板块