Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.092 — 2026-10-04
NEWS 约 1 分钟

llama.cpp融合共享专家加速MoE

llama.cpp合并共享专家计算,减少消费级GPU上的重复调度开销

IMAGE — r/LocalLLaMA 日榜

跑 MoE 大模型,像是每道题只请几位合适的专家作答;但“共享专家”每道题都要参与,反而会带来固定开销。llama.cpp 的这项 PR 针对 CUDA——NVIDIA 的 GPU 编程平台——调整底层计算路径,把共享专家原本分开的步骤合并执行,目标是减少数据搬运和任务启动成本。

具体来说,它把共享专家的两次矩阵乘法及 GLU 计算融合进同一个 GPU 内核。算子融合就像把多趟加工并成一条流水线,中间结果不必反复搬进搬出。不过,最后与其他专家结果相加的步骤并未纳入这次融合。PR 给出的测试对象是 RTX Pro 6000 上的 Qwen3.5-35B-A3B-Q8_0;材料没有披露速度、显存占用或其他量化结果,因此目前更值得关注的是优化路径本身,而非尚未公布的性能增幅。


供稿材料 SOURCES — 1

← 返回 2026-10-04 · 开源板块