Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.097 — 2026-10-09
NEWS 约 1 分钟

Qwen提示处理再快5.5%

llama.cpp重排CUDA线程分工,Qwen长提示处理提速约5.5%

IMAGE — r/LocalLLaMA 日榜

让 AI 读一大段代码时,等待往往发生在它“读完再开口”的阶段。llama.cpp 这次没有改模型,而是调整 CUDA——NVIDIA GPU 的并行计算体系——中 GDN 状态的分配方式。GDN 是一种边读边汇总信息的结构;改动让每个 warp(一组同步工作的 GPU 线程)同时负责四列状态,减少线程花在调度而非计算上的时间。

作者在 RTX 4090 上测试 Qwen3.8-27B 与 Qwen3.5-9B,称提示处理吞吐最高约提升 5.5%。这对长文档和大型代码上下文更有意义,因为 prefill(模型先读完输入并建立内部状态)通常是开口前最费时的一段。补充测试中,Kimi-Linear-48B-A3B 处理 4096 个提示 token 时提升 3.4%。这是一项底层推理优化,不会增加模型知识或能力;不同 GPU、模型和量化设置下,收益仍可能不同。


供稿材料 SOURCES — 1

← 返回 2026-10-09 · 开源板块