Ming-Image-0.1-Design是蚂蚁集团于2026年9月推出的开源视觉设计生成与图层解耦模型,主要用于从文字需求生成 UI、信息图与海报等完整设计,并把成品设计图拆分为可独立编辑的透明图层,支持原生 RGBA 透明背景输出与 2 至 9 层语义化分层,适用于前端页面生成、演示文稿制作与电商视觉再创作场景。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 视觉设计生成与可编辑图层拆解模型 |
| 出品方 | 蚂蚁集团 inclusionAI |
| 发布时间 | 2026年9月23日 |
| 模型组成 | Design 与 Layer 两个模型 |
| 参数规模 | 均为 6B |
| 开源协议 | MIT 许可,权重已开放 |
| 榜单表现 | Artificial Analysis 设计评测开源第一 |
| 分层粒度 | 2 至 9 个语义独立 RGBA 图层 |
| 推理配置 | 单卡 80GB 显存,BF16 精度 |

Ming-Image-0.1-Design 的核心能力
该系列由两个参数量均为 6B 的模型组成:Design 负责把文字需求渲染为完整设计,Layer 负责把成品设计图还原为可继续编辑的图层结构。对 AI 模型 选型而言,设计类生成的评价标准已从观感转向文字准确与结构可复用。
面向文字密集型设计的生成
UI、仪表盘与信息图需要同时处理文字、功能模块、视觉层级、配色与布局。Design 重点增强了四项能力:支持 8K 长结构化提示词增强,把自然语言需求组织为文案、模块、布局与视觉风格;优化标题、按钮、卡片与多区域信息的文字渲染和版式稳定性;端到端一次性完成整体设计,统一配色、构图与素材风格;创建原生 RGBA VAE,直接生成人物、商品与图标等透明背景素材。
设计图的语义化图层拆解
模型可将设计图拆分为 2 至 9 个语义独立的 RGBA 图层,按文字、卡片、主体与背景等设计角色组织图层,保留透明边缘、补全被遮挡区域,并保证所有图层重新组合后的结果一致性。实现方式上,模型通过 Type Token 告知每个图层承担的设计角色,以 Alpha-Aware Layer Optimization 优化透明区域与边缘,再通过 Composite-Layer Stack Consistency 重新合成,检验各图层能否还原原图。
榜单表现与实测案例
在 Artificial Analysis 于 2026 年 9 月 18 日更新的 UI/UX Design 专项评测中,Design 位列开源模型第一,Elo 得分为 1082,版式胜率 67.4%、复杂构图胜率 67.0%、文字渲染胜率 66.7%。在包含地图、图表与操作按钮的桌面仪表盘上,Design 对照 Nano Banana 2 Lite、FLUX.2 [max] 与 Krea 2 Medium 获得 12 次全胜;在由三个连续步骤页组成的食谱应用上,对照 Nano Banana 2、Nano Banana Pro 与 MAI-Image-2.5-Flash 获得 10 次全胜。
推理效率与量化结果
Layer 在 Crello-Test 图层解耦评测中于 RGB L1、Alpha soft IoU 两项指标以及 MLM-0 至 MLM-5 六档设置下全部取得最优,即 12 项结果均排名第一。在与未开源、并使用 Crello 训练集微调的 Qwen-Image-Layered-I2L 对照时,6B 的 Layer 把单次推理时间从 795 秒降至 183 秒,速度提升约 4.3 倍;经工程优化后,1024 分辨率的端到端服务通常约 20 秒返回结果。
Ming-Image-0.1-Design 与同类图像生成模型的对比
| 对比维度 | Ming-Image-0.1-Design-Layer | Qwen-Image-Layered-I2L |
|---|---|---|
| 开发方 | 蚂蚁集团 | 阿里通义千问 |
| 参数量 | 6B | 20B |
| 开源情况 | 以 MIT 许可开放权重 | 未开源 |
| Crello-Test 图层解耦 | 12 项指标全部第一 | 官方称在其评测条件下落后 |
| 单次推理时间 | 183 秒 | 795 秒 |
| 处理效率 | 较对照快约 4.3 倍 | 基准值 |
| 训练数据 | 未使用 Crello 训练集微调 | 使用 Crello 训练集微调 |
| 分层粒度 | 2 至 9 个语义独立 RGBA 图层 | 官方材料未给出层数区间 |
上表 Ming-Image-0.1-Design-Layer 一列取自蚂蚁官方发布材料,Qwen-Image-Layered-I2L 一列取自同批官方材料中的对照口径。两者的差别集中在参数效率上:6B 的 Layer 在官方评测中 12 项全部第一,并以 183 秒的单次推理时间对照 20B 版本的 795 秒,效率差约 4.3 倍。授权方式同样拉开距离,Layer 以 MIT 许可开放权重,可自行部署与二次开发;I2L 版本未开源,只能按官方途径调用。表中的对照数据来自发布方组织评测,实测时间随分辨率与批量变化。
若关注通用图像生成与编辑的完整链路,可参考 Nano Banana 2 Lite(谷歌 DeepMind 推出的轻量级图像生成模型,也是官方设计案例中列出的参照对象之一,适合作为通用生图能力的对照基线)。
Ming-Image-0.1-Design 的应用场景与适用人群
两个模型分别对应生成与编辑两端,在 AIGC 内容生产流程中的常见场景包括:
- 前端页面与界面设计:把需求描述直接生成可预览的页面设计稿,用于早期方案评审与视觉对齐。
- 信息图与海报制作:文字密集型版式一次成型,避免多次拼接素材带来的色系冲突。
- 透明白底素材生产:原生 RGBA 输出可直接用于电商主图、图标与装饰素材的合成。
- 设计稿图层还原:把扁平化的成品图拆成 2 至 9 个可编辑图层,供设计师继续调整。
- 演示文稿再创作:配合官方开源的 PPT Skill,把生成页面转为可编辑的演示文稿元素。
适用人群:需要快速产出界面与视觉稿的设计团队、承接电商主图与素材制作的运营人员、把设计能力接入自有工作流的前端与算法工程师,以及希望本地部署以控制素材外发的企业。由于两个模型的最低部署配置为单张 80GB 显存 GPU,显存受限时建议先用官方演示空间验证效果。
Ming-Image-0.1-Design 的使用方法
两个模型的调用方式相近,差异只在任务类型与采样参数,可按以下步骤开始:
- 获取权重:在 Ming-Image 官方仓库 了解模型结构,再从 Hugging Face 或 ModelScope 下载权重。
- 准备运行环境:安装依赖后确认
CUDA_VISIBLE_DEVICES指向单张 80GB 显存 GPU,并以 BF16 精度加载;需要更快推理时可启用flash_attention_2。 - 生成设计图:以
--task text-to-image指定文生图任务,提示词可传入结构化说明文件,默认采样 12 步、分辨率 2048;需要透明背景时,须在提示词开头加入官方约定的固定短语。 - 拆解图层:以
--task layer-decompose指定分层任务并传入设计图,在提示词中写明目标层数,默认分辨率 1024、采样 12 步;工具会跳过首张合成图,单独输出各图层的 PNG 文件。 - 部署与压测:按业务并发选择自建推理或 vLLM-Omni 服务化方案,先以单批任务验证显存占用与端到端耗时。
工程实践上,建议把生成与拆分分开压测,并在提示词模板固定后再进入批量生产。
Ming-Image-0.1-Design 的价格与开源情况
Ming-Image-0.1-Design 以 MIT 许可开放权重,两个 6B 模型均可免费下载、商用与二次开发,官方不设调用收费,成本主要来自自建推理的算力支出。官方公布的最低验证配置为单张 80GB 显存 GPU 并以 BF16 精度运行。
授权条件上,MIT 许可允许修改与再分发,对商业使用未作额外限制,适合嵌入企业内部的设计生产流水线。需要留意推理侧的资源门槛:文生图默认输出 2048 分辨率、图层拆解默认输出 1024 分辨率,两者均按 12 步采样,分辨率与批量大小会直接改变显存占用与单张耗时,容量规划应按实际参数组合实测后再确定。
Ming-Image-0.1-Design 的常见问题
Ming-Image-0.1-Design 包含哪两个模型?
包含 Design 与 Ming-Image-0.1-Design-Layer,参数量均为 6B。前者从文字需求生成 UI、信息图与海报等完整设计,后者把设计图拆成可独立编辑的透明图层。
Ming-Image-0.1-Design 开源吗?可以商用吗?
两个模型均以 MIT 许可开放权重,可免费下载、修改与商用,官方未设调用收费,成本主要是自建推理所需的算力。
Ming-Image-0.1-Design 的分层能力怎么样?
Layer 可将设计图拆分为 2 至 9 个语义独立的 RGBA 图层,在 Crello-Test 评测中 12 项指标全部第一。
浙公网安备33010202004812号