Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.094 — 2026-10-06
NEWS 约 1 分钟

一份GGUF混跑AMD与英伟达

Infermeld让AMD与NVIDIA显卡合并显存,共同运行一份GGUF模型。

手头一张AMD卡、一张NVIDIA卡,显存各自不够装下大模型,能不能像拼桌一样合起来用?Infermeld给出了一套实验性方案:在Linux上把一份GGUF——供本地推理使用的量化模型文件——分配给两家显卡共同运行。底层仍由llama.cpp负责推理,Infermeld没有另造“后端”,而是把设备选择、运行前检查、编译说明和启动参数组织起来。

据维护者在Reddit介绍,v0.1.0目前只验证了一个组合:16GB的RX 6900 XT加10GB的RTX 3080,通过Vulkan与CUDA两套计算接口,以“按层切分”方式运行Qwen3.6-35B-A3B的UD-Q4_K_M版本,并完成预留8192 tokens上下文后的加载与短文本生成。模型分片能汇总显存,但显卡之间传输数据也可能拖慢速度。作者明确提醒,这还不是广泛兼容性或持续性能测试;完整8K输入、长时间吞吐和更多混搭显卡仍待验证。它更像一套供熟悉Linux的用户复现、排错的工具包,而非一键安装软件。


供稿材料 SOURCES — 1

← 返回 2026-10-06 · 开源板块