老显卡跑本地 AI,慢往往不只慢在“写答案”,还慢在动笔前先读完你的问题。这次 gfx906-llama-cpp 更新继续照顾 Radeon VII、Instinct MI50 和 MI60:它是 llama.cpp 的一个维护分支,专门优化主线未重点照顾的旧款 AMD GPU。
作者公布的测试显示,处理 16,384 个 token 的预填充(模型回答前读完输入的阶段)速度从主线的每秒 332.5 token 提至约 410,增幅 23%;处理 12 万 token 时则从 231.4 提至约 264,增幅 14%。进入逐字生成阶段后,速度也从每秒 13.6 token 升至约 15.1,增幅 11%。这些改进主要来自梳理 llama.cpp 现有的代码改动,并把适合 gfx906 的部分移植过来。
这不是让老卡突然追上新硬件,而是一次实在的维护更新:长提示的等待更短,回答生成也更快。作者还称输出通过哈希与逐 token 比对保持完全一致;不过上述性能数字目前来自项目作者自测,供稿未披露具体模型及完整测试环境。