想让本地 AI 看一张图片、读一段视频,再回答文字问题,模型和部署工具都得支持视觉输入。llama.cpp 的一项拉取请求正为 Ling-3.0-flash-VL 增加支持,把这款原生理解图像与视频的模型纳入轻量部署工具链。本地多模态——让同一模型处理文字和视觉信息——因此又多了一个选择。
这款模型共有 124B 参数,但采用 MoE(混合专家)架构,每生成一个词只调用其中 5.5B 参数。它还支持最长 256K 上下文。处理视觉时,ViT 视觉编码器先把图片或视频切成小块并提取特征,再由两层 MLP 将这些特征对齐到文字表示;VideoRoPE 则同时记录画面位置和时间顺序,用于理解视频中的变化。值得留意的是,少量激活参数能降低单次计算量,却不等于完整的 124B 权重不占内存和存储;目前材料也只是该支持请求的模型说明,未披露本地运行所需硬件或实测速度。