Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.078 — 2026-09-20
NEWS 约 6 分钟

Flyweight:显存装不下,内存来接力

Flyweight 让单张消费级显卡借系统内存运行超显存 MoE,还能直接接入常见聊天与 Agent 工具。

显存不够,先向内存借地方

你想在自己的电脑上运行一个大模型,文件明明能存进硬盘,启动时却被一句“显存不足”挡在门外。Flyweight 想解决的就是这道坎:让单张消费级 NVIDIA 显卡和系统内存搭档,把显存装不下的模型跑起来。

它瞄准的是 MoE(Mixture of Experts,混合专家)模型。这类模型像一支人数庞大的顾问团,每次回答只请其中一部分“专家”工作,因此单次计算量可以低于同等总参数规模的普通模型。但所有专家的权重——模型学到的大量数值——仍然需要地方存放。显存有限,系统内存便成了候场区。

需要先说明:目前全部信息和性能数据都来自项目作者在 Reddit 发布的一篇自述,没有论文、代码仓库材料或第三方测试相互验证。以下数字应当视为作者报告,而不是已经复现的结论。

让常用专家坐到前排

Flyweight 是一套开源的原生 C++/CUDA GGUF 推理引擎。GGUF 是本地大模型生态常用的文件格式,可以装入模型权重、量化信息和运行所需的元数据。

它有两种主要安排。第一种把 MoE 专家放在 CPU 一侧,由系统内存承载并让 CPU 计算。第二种把经常使用的专家缓存在 GPU 上,其余仍留在内存。可以把它理解成小柜台配大仓库:常用货摆在手边,其他货需要时再从后面取。引擎启动时会自动判断显存能装下什么,用户不必自己猜该卸载多少层。

这正是 CPU offload——把部分模型权重移到系统内存,需要时由 CPU 计算或传给 GPU。它用更大的可用容量换取运行机会,代价则是内存带宽和数据搬运可能拖慢速度。

作者称,Flyweight 支持 Qwen 3.x 的 dense(每次都使用整套网络)与 MoE 模型,以及 Qwen3.8-Flash-Next、DeepSeek-V4-Flash、Ling 3.0、K2-Horizon、Gemma 4、Laguna 和 Muse Glimmer。不过这些名称及实际兼容范围尚未得到独立核对。

跑得动以后,还要接得上

Flyweight 不只提供底层推理。它还带聊天界面,并提供号称兼容 OpenAI 和 Anthropic 的 API。API 是软件之间约定好的调用接口;兼容常见接口,意味着已有聊天前端或 Agent 工具通常可以通过更换地址和密钥接入本地引擎。但“兼容”不等于覆盖两家的全部接口,目前材料没有给出完整清单。

在工具调用上,它用 sampler grammar——生成时必须遵守的格式规则——约束模型输出,并在调用期间限制 temperature 和 penalties 等采样设置。作者称,这能让小型量化模型使用编辑工具时更稳定地复现文件文本。它还支持 thinking budget 硬上限,并提供 stop_thinking endpoint,让程序可以中止流式“思考”,转入最终答案。

引擎的 CUDA kernel——GPU 上执行计算的小程序——通过 NVRTC 在运行时编译,因此发布的 wheel 安装包无需捆绑 CUDA toolkit,也不要求用户安装 nvcc。作者还称,同一份 kernel 源码可以作为普通 C++ 编译到纯 CPU 后端。

一台笔记本能跑到什么程度

作者在一台配有 RTX 5070 Ti 12 GB 显存和 60 GB 系统内存的笔记本上报告:Qwen3.8-Flash-Next IQ1_S 的生成速度约为每秒 35 个 token,预填充约为每秒 475 个 token。token 是模型处理文字的基本单位,不完全等同于一个汉字或单词;预填充是先读入问题,decode 则是逐步生成回答。

同一设备上,作者测得 Qwen3.8-27B IQ2_XXS 约为每秒 40 个 token,DeepSeek-V4-Flash 为每秒 6至7个 token。作者判断后者已基本触及 DRAM 内存带宽上限,但材料不足以独立验证这一解释。

Flyweight 的 KV cache——模型处理长上下文时保存中间结果的“草稿纸”——支持 f16、q8_0 和 TurboQuant 4-bit。作者称,一款 dense 27B 模型在 32K 上下文下,相关配置可让速度从每秒 10.8 个 token 升至 22.9 个。不过原帖没有说明具体采用哪种缓存格式、基线设置和其他变量,因此不能把增幅明确归因于某一项改动。

它还支持通过 mmproj 为 Qwen 模型输入图像,并可让 Z-Image-Turbo 与聊天模型共用一张显卡。作者称,在已经加载一个 35B 模型时,生成一张 1024×1024 图像约需15秒。

为什么值得关注

Flyweight 的意义不在于宣称系统内存可以取代显存。恰恰相反,它接受了两者速度不同这一现实,再把模型权重按用途分配到两边。对显存有限、但可以扩充内存的本地用户来说,这可能把问题从“完全跑不了”改成“能跑,只是速度有所取舍”。

它也试图把部署最后一公里一并补上:自动判断显存容量、提供主流风格 API、聊天界面、图像输入和工具调用约束。项目已经完成首次 PyPI 正式发布。作者同时披露,大量代码由 Claude Code 等 AI 工具协助编写,并称每个 kernel 都与参考实现做过一致性测试。

局限与未知

  • 所有效果论断都来自作者单一信源,尚无第三方 benchmark 或可复现报告。
  • 性能数据缺少 CPU 型号、内存带宽、上下文长度、batch size、量化文件、采样参数、功耗和测试版本等关键信息,不适合直接与其他引擎横向比较。
  • 模型兼容范围、API 覆盖程度,以及 AI 辅助生成代码的长期可靠性,仍需代码审查和实际使用验证。

供稿材料 SOURCES — 1

← 返回 2026-09-20 · 开源板块