一张原本用来挖矿、并不擅长桌面图形的旧卡,还能不能拿来跑本地 AI?开发者 ubrtnk 将 NInfer——负责把模型运算交给 GPU 执行的推理后端——移植到 NVIDIA CMP170HX,并称运行 Qwen3.6-35B 时,速度达到 llama.cpp 的两倍。llama.cpp 是常见的本地大模型运行工具,这里充当通用方案的比较基线。
这次工作不是简单改个编译选项。作者从面向 RTX 3090 的 NInfer Fork——由原仓库派生、可独立修改的项目副本——继续适配。原实现假定 GPU 有 82 个 SM,而 CMP170HX 暴露的是 70 个 SM;SM 可以粗略理解为 GPU 内部成组工作的计算单元,因此部分计算任务的安排也要随硬件调整。这个案例的看点不只是一次跑分:它说明,为特定硬件重做软件适配,可能让冷门旧卡重新获得实用价值。不过,翻倍结论来自作者自述,供稿未提供完整测试设置与可复现实验数据。