Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.060 — 2026-09-02
NEWS 约 1 分钟

RDNA4有了定制推理内核

R9V为RDNA4重写Qwen推理内核,双R9700生成速度接近原来的3倍

同样两张显卡,换一套更懂硬件的“计算动作”,本地 AI 就可能跑快不少。开发者 Public_Umpire_1099 发布 R9V:一组专为 AMD RDNA4 架构、尤其双 R9700 调校的推理内核。推理内核是 GPU 执行矩阵计算等任务的小段高性能程序,作用有点像为特定机器重新编排流水线,而非只在上层软件里调参数。

作者把 R9V 接入 vLLM-Radiance,运行 Qwen3.8 Flash Next 的 IQ4_XS 量化版本,并用张量并行把同一层计算拆给两张 R9700。其自测中,生成 256 个 Token(Token 是模型处理文字的基本单位)达到 78.11 tok/s,对照版本为 26.22 tok/s,约为原来的 3 倍。处理 8192 Token 输入的预填充则达到 1512.01 tok/s;预填充就是模型先读完整段输入、建立内部状态的阶段。

不过作者明确提醒,约 30 倍的预填充差距并非公平比较:对照版 vLLM-Radiance 在 SSD 支撑的 n-gram 设置下表现很差,也缺少更合适的独立基线。因此目前更值得关注的,是 RDNA4 已出现面向具体模型重写底层内核的优化路线,而不是把最高数字直接当成通用结论。


供稿材料 SOURCES — 1

← 返回 2026-09-02 · 开源板块