Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.082 — 2026-09-24
NEWS 2 信源 约 4 分钟

Ming-Image:6B模型盯上可编辑设计

6B 图像模型开始把生成接进 UI、分层素材和可编辑 PPT 工作流。

IMAGE — r/LocalLLaMA 日榜

你让 AI 做一页产品发布会幻灯片,它很快能交出一张漂亮图片。问题是,标题写错了怎么办?图标要挪一点怎么办?如果文字、图形和背景已经“焊”成一张图,修改往往等于重做。Ming-Image-0.1-Design 想把图像生成往设计生产推进一步:不只交付画面,还提供透明素材、分层处理以及可编辑 PPT 的配套流程。

这套开放权重模型面向 UI、信息图、海报等文字密集型视觉设计。所谓开放权重,是指模型参数可供下载和部署。现有信息主要来自 inclusionAI 的模型页面及一则转述帖,第三方实测仍然有限。

不只画图,还要留下修改余地

Ming-Image-0.1-Design 是一个 6B 参数的文本生成图像模型——用户写下文字要求,模型据此合成图片。普通图像生成更看重画面是否好看;设计任务还要处理版式、文字和可复用素材。

它支持输出 RGBA 图像。RGBA 在红、绿、蓝之外增加透明度通道,意味着模型可以生成没有底色的图形素材,再把它放进网页、海报或幻灯片,而不必手工抠图。官方模型页还显示,该基础模型采用 MIT License 发布。

更值得注意的是配套工作流。相关发布信息称,Ming-Image-0.1-Design family 包含基础模型和同为 6B 的 Ming-Image-0.1-Design-Layer,并同时开放 Ling UI Design Skill 与 Image-to-Editable-PPT Skill。Agent Skill 可以理解为给 AI Agent 准备的一套任务说明、脚本或工具封装,它负责把单次生成接成长流程。

先拆画,再复刻

据上海纽约大学研究与教学创新中心和 inclusionAI 的介绍,可编辑 PPT 流程像一场接力:输入可以是一张已经压平的幻灯片截图;Design-Layer 先按照规划,把画面拆成多个带透明度的视觉层;PPT 技能随后把文字、简单形状和视觉素材重建成可以移动、修改的 PowerPoint 对象。

这正是“分层设计”的价值。背景、文字和图形分别保存,编辑者才能单独调整。短提示词还可以先交给视觉语言模型扩写成结构化 JSON——一种便于程序读取的数据格式——再由图像模型生成。说白了,它先写一份施工图,再照着施工图作画。

这里需要划清边界:现有材料没有证明基础模型本身能直接输出一整套逐元素可编辑的设计稿。“可编辑”主要来自 Design-Layer 与 PPT 技能组成的流程,基础模型明确披露的能力则是完整画面与透明背景输出。

为什么现在值得看

过去,图像模型的交付物通常是一张成品图。Ming-Image 的方向则是把生成嵌入后续制作:透明素材能继续排版,分层内容便于修改,Agent Skill 再把这些能力接进 UI 和演示文稿任务。它瞄准的不是单纯“画得更像”,而是让生成结果更接近可继续加工的工作文件。

一则发布帖称,Ming-Image-0.1-Design 在 Artificial Analysis 的 UI/UX Design leaderboard 中位列开放权重模型第一。不过这项说法目前只有单一来源,榜单名次也会随时间、指标和参评模型变化,应视为发布时的参考,而不是稳定结论。

局限与未知

  • 官方推荐以 2048×2048 分辨率、12 个采样步骤、CFG scale 1.0 和 BF16 精度运行,并称验证过单张 80 GiB 显存的 CUDA GPU。它是已验证配置,不代表最低门槛,也不等于每次生成都会占满 80 GiB。
  • 公开推理代码只把分辨率请求映射到 1024 或 2048 两档,尺寸选择仍有限。
  • 材料没有披露 Design-Layer 的具体分层方法、编辑准确率或完整第三方对比;两个 Agent Skills 的实际稳定性,也还缺少独立验证。

供稿材料 SOURCES — 2

← 返回 2026-09-24 · 开源板块