Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.019 — 2026-07-23
NEWS 约 1 分钟

ROCm预填充或再快15%

llama.cpp新补丁瞄准ROCm提示处理提速,但15%数据仍待核实

IMAGE — r/LocalLLaMA 日榜

把一篇长文交给本地 AI 后,最先等的不是“写答案”,而是它把全文读完。这个阶段叫预填充(prefill)——模型先处理整段提示、建立内部状态,之后才逐个生成 token。llama.cpp 的一项新补丁瞄准 AMD 显卡所用的 ROCm 计算平台,社区帖称提示处理有望加快约 15%。对经常输入长文档或长指令的人,这意味着答案可能更早开始出现。

补丁主要调整 RDNA 4 上的矩阵乘法,并修复 Q6_K、Q2_K 两种量化格式的问题。量化就是用低精度数字压缩模型,以节省显存并加快计算;作者称,ROCm 的编译环节此前没有妥善处理相关代码,其中 Q2_K 会因循环展开而占用临时存储。社区帖还称修复可让 Q2_K 快 28 倍。不过,这个 PR 目前仍未合并,讨论中也有人指出基准表的列值可能写反,甚至显示主分支更快。因此,15% 提升和 28 倍数字都应先视为待复核的作者及社区说法。


供稿材料 SOURCES — 1

← 返回 2026-07-23 · 开源板块