不止一个模型蚂蚁 Ming-Image 系列一口气开源两个 6BDesign 版只是开始【免费下载链接】Ming-Image-0.1-Design项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ming-Image-0.1-Design当大多数开源团队还在为一个拿得出手的旗舰模型反复打磨时蚂蚁百灵选择了另一条路9 月 23 日Ming-Image-0.1-Design 系列一次性发布两个参数量均为 6B 的模型——Ming-Image-0.1-Design 与 Ming-Image-0.1-Design-Layer。前者负责从文字需求直接生成 UI、信息图、海报等完整视觉设计后者负责把设计图/创意图拆解为可独立编辑的透明图层。一个负责生产、一个负责二次加工二者天然互补构成了一个面向设计交付场景的最小闭环。对开发者来说这一系列真正值得关注的不是又开源了一个 6B 文生图模型而是蚂蚁把设计生成这件事拆成了可组合的多个模型并配齐了从部署到下游工作流的整套生态。本文基于仓库源码与公开情报拆解这两个 6B 的分工差异、Design 版在工程上的关键取舍以及这套矩阵式开源背后的策略逻辑。两个 6B 的分工Design 负责生成Layer 负责拆解先厘清一个容易混淆的点同一系列的两个模型干的并不是同一件事。Ming-Image-0.1-Design文生图模型输入提示词输出完整的 UI 界面、信息图、海报等文字密集型设计稿支持原生 RGBA 透明背景Ming-Image-0.1-Design-Layer图层拆分模型把已有的设计图/创意稿分解为可独立编辑的透明图层相当于为AI 出图 → 设计师接手改稿提供了一条可落地的中间路径。两者拼在一起正好覆盖了设计工作流里最耗时、最割裂的两端从零生成素材以及把生成结果打回成可编辑资产。单独的生成模型再强产出的也只是一张死图而有了 Layer 模型生成结果可以进入 Figma、PPT 等可编辑场景继续加工——这也解释了为什么社区教程里反复出现Ming-Image 搭配 Layer 拆分模型与 Design Skill 自动化工作流的组合玩法。Design 版为设计而生的四个工程证据打开仓库目录README.md 对该模型的定位写得很直接面向 UI、信息图、海报及其他文字密集型视觉设计的 6B 文生图模型。所谓文字密集型意味着模型必须同时解决三件事文字渲染不崩、排版布局稳定、输出可交付透明背景。我们从仓库配置逐一验证这三个能力是怎么落地的。第一多模态语义理解用 MoE而不是堆一个大稠密模型。文本/视觉理解由 mllm/config.json 定义的多模态模型承担LLM 主干为bailing_moe_v2256 个专家、每 token 激活 8 个配合 32 层 Qwen2.5 ViT 视觉编码器。官方口径的6B正是 MoE 的激活参数量权重索引元数据中的 170 亿参数为含全部专家的总量mllm/model.safetensors.index.json。理解侧能力越强提示词里的版式描述、字号层级、左上角放标题这类布局信息才越能忠实传递到生成侧。第二语义注入走轻桥接不过度引入新模块。文本侧先经 connector/config.json 定义的 Qwen2 因果语言模型28 层、hidden size 1536约 15 亿参数编码再通过 mlp/config.json 的恒等 MLPuse_identity_mlp: true直接注入扩散 Transformer。连接层选最轻的实现目的是保留语义、减少条件注入链路中的信息损耗——这也是语义保真的工程化表达。第三生成侧是标准的 MMDiT 风格扩散 Transformer但为透明通道留了位。transformer/config.json 显示dim 3840、30 个主层 2 个 refiner 层、16 通道输入in_channels: 16、支持 2048 级高分辨率axes_lens中 20480 对应大图 token 长度。注意这里的 16 通道潜变量不是巧合——它要为下面 VAE 的 RGBA 四通道各分配独立的潜空间表达。第四透明背景是原生能力不是后处理。与多数模型生成 RGB 后再抠图不同vae/config.json 定义了AutoencoderKLQwenImageinput_channels: 4即 RGBA 四通道直接进 VAE、z_dim: 16、scaling_factor: 8.0064。也就是说透明度在潜空间里就被联合建模了采样一步到位的输出天然带 Alpha 通道。配合 scheduler/scheduler_config.json 的 Flow Match 欧拉调度器shift 6.0、1000 步训练时间表实际推理仅需 12 步即可出图——README 给出的推荐参数是 2048×2048、12 步、CFG 1.0、BF16、单卡 80 GiB。这套组合的实际效果得到了第三方盲测的背书在 Artificial Analysis 的 UI/UX 文生图盲测中该模型以Elo 1082分登顶开源模型第一把文字渲染、版式稳定这类设计生图专属指标作为核心竞争力摆到了台面上。透明背景为什么值得专门做一个 VAE先澄清一个常见的误解RGBA 输出并非多加一个通道这么简单。常规 3 通道 VAE 的潜空间分布是在 RGB 数据上学出来的强行把 Alpha 塞进去会导致透明度与内容解耦失败——生成结果要么边缘发虚要么透明变成了灰色。Ming-Image 的做法是让 VAE 从输入端就吃 4 通道input_channels: 4把透明度当成与颜色平行的第一公民参与重建训练16 维潜变量z_dim: 16也给了四通道足够的表达能力。从工程成本看这一选择让 VAE 解码端到端产出带 Alpha 的 PNG跳过了生成 → 抠图 → 合成的传统链路对电商商品图、App 图标、贴纸表情包这类高频需求收益是实打实的一次推理、直接交付。README 中的透明背景示例assets/transparency_showcase.webp也专门用棋盘格预览透明度并注明棋盘格仅用于预览、不属于生成结果。为什么铺矩阵而不是押单点回到一次开源两个 6B这个动作本身。单看 Design 版它已经是一个完整的 6B 文生图模型但蚂蚁显然不满足于押一个爆款而是围绕设计交付场景铺了一张网模型层Design生成 Layer拆层覆盖出图—改稿链路工作流层官方配套了 Design Skill 自动化工作流与图转可编辑 PPT的 Skill把单模型能力组装成端到端的生产管线部署层明确推荐 vLLM-Omni 服务化框架并给出 80 GiB 单卡验证配置降低自部署门槛合规层MIT 协议开源LICENSE商用无附加条件。这套打法的逻辑很清晰场景比单点模型更难复制。单一 6B 模型再强竞品追几个月也能追平但生成 拆层 工作流 服务化 开源许可构成的完整矩阵才是真正沉淀下来的生态壁垒。这也与蚂蚁在通识多模态上的家族化路线一脉相承——从 Ming-Omni 的统一多模态感知生成到 Ming-UniVision 的连续视觉表征统一理解与生成再到如今 Ming-Image 系列垂直场景化落地开源动作始终是系列化、成体系地推进而不是零散地丢模型。下一个成员会是谁既然系列是策略Design 只是开始就不仅是标题修辞。从已公开的线索可以合理推演其一Layer 模型本身就有独立迭代空间。当前它能拆透明图层下一步向拆出可编辑的矢量结构还原布局树/组件属性演进是技术路线上顺理成章的方向——那将真正打通AI 出图 → 设计稿结构化的最后一公里。其二与 Ling 系多模态生态的整合。README 中提示词增强PE可挂载 Ling-3.0-flash-VL 或 qwen3.8-27B说明官方在设计的是理解模型增强提示词 → 生成模型出图的协同链路。随着理解侧模型升级生成质量与指令跟随能力会同步水涨船高。其三从静态设计稿走向动态内容。Ming 家族在统一多模态上已有积累图像生成之后视频、多页文档排版、甚至设计稿 交互逻辑的一体化生成都是同一套文字密集型内容生成能力的自然延伸。回到当下两个 6B、一个 MIT 协议、一套成体系的工具链——Ming-Image-0.1-Design 系列给开源文生图社区带来的不是又一个可下载的权重而是一个按场景拆解、按矩阵交付的范本。对想快速落地的团队Design 版 Layer 版 vLLM-Omni 的黄金组合已经可以直接开工对想研究架构的人从 mllm/config.json 到 vae/config.json 的每一份配置都在告诉你设计生图的难点从来不在画得像而在排得对、拆得开、交付得了。【免费下载链接】Ming-Image-0.1-Design项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ming-Image-0.1-Design创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考