Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
NEWS 约 1 分钟

366 tok/s:V100仍能跑新模型

新推理内核为老款 V100 补上 NVFP4 路径,最佳场景达 366 tok/s

新模型常像只配新插头的电器:机器还能用,接口却跟不上。开发者 Simple_Library_2700 发布“v100-skinny”,为老款 NVIDIA V100 编写专用推理内核——也就是替 GPU 执行关键计算的底层程序——让它能更快处理 Qwen3.6 27B 的 NVFP4 权重。NVFP4 是一种用 4 位浮点数压缩模型数据的格式,原本面向更新的 Blackwell GPU;V100 属于更早的 SM70 架构,没有原生支持。

作者自述,单路测试在最有利的“extraction”场景达到 366 tok/s,即每秒处理或生成 366 个 token(模型切分文字后的基本单位);结构化 JSON 生成约为 240 tok/s,对多 token 预测较友好的模板代码、HTML 等约为 200 tok/s。366 并非普遍速度,作者也提醒仓库中列有多项限制;实际表现仍会随任务和测试方式变化。但它说明,针对新量化格式补一条专用软件路径,可能让存量 V100 重新获得运行新模型的性价比。


供稿材料 SOURCES — 1

← 返回 2026-08-13 · 开源板块