Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.058 — 2026-08-31
NEWS 约 1 分钟

MoE只搬热专家,生成快五成

只让高频专家常驻显存,作者称未装下的 MoE 模型生成速度从 20 提至 30 tok/s。

IMAGE — r/LocalLLaMA 日榜

显存装不下完整模型时,电脑只能在 GPU 显存和系统内存之间来回搬权重,像做饭时反复去储藏室取常用调料,生成速度也会被拖慢。开发者 nbvehrfr 的做法是:不再把整层模型搬进显存,而只留下“热专家”——在某类任务中被频繁调用的专家模块。

这里的 MoE(Mixture of Experts,混合专家)会把模型拆成许多专家,每个 token 只调用少数几个;但全部权重仍要有地方存放。作者观察到,在编程、重构和代码审查任务中,部分专家的调用较稳定,因此让它们常驻显存,减少从系统内存反复取数。在其 llama.cpp 分支和 Qwen 3.8 Flash Next 测试中,作者自述生成速度由 20 提至 30 tok/s,约快 50%;tok/s 只表示每秒生成多少 token,不代表答案质量。

这项尝试目前只测过编程负载,也只适用于完整模型放不进显存的情况;作者还表示,该改动大概不会被上游项目接纳。


供稿材料 SOURCES — 1

← 返回 2026-08-31 · 开源板块