Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.071 — 2026-09-13
NEWS 约 1 分钟

旧显卡可专门承包视觉编码器

让旧显卡专管“看图”,低成本腾出主卡显存,加快本地多模态响应。

本地跑多模态模型时,主显卡既要负责“想和写”,又要腾空间“看图”,显存很容易吃紧。一个简单思路是:让闲置的低显存旧卡专门处理视觉部分,像给主力请一位只负责看材料的助手。这样尤其适合多模态 Agent——能看图并连续执行任务的 AI 程序,视觉处理太慢会拖累每轮响应。

据 llama.cpp 官方文档,多模态推理通常需要主体语言模型和 mmproj——负责把图片编码、转换成语言模型可理解表示的独立组件。Reddit r/LocalLLaMA 的一则社区实测建议,用 --mmdev CUDA1 把 mmproj 指定给第二张 GPU,而不是通过 --no-mmproj-offload 留在 CPU。发帖者称,前者比 CPU 方案快一个数量级,同时不影响主体模型的生成速度;它也能把视觉组件占用的 VRAM——显卡上的高速内存——从主卡挪走。

这更像一条值得试验的配置技巧,而非完整基准结论:帖子没有披露硬件配置或测试表。官方也提醒,llama.cpp 的多模态支持仍在快速开发,相关接口可能发生不兼容变化。


供稿材料 SOURCES — 1

← 返回 2026-09-13 · 开源板块