ARTICLE · 1088816
“下载PNG”的时代结束了!蚂蚁开源6B设计大杀器:一键生成UI,还能反向拆出可编辑PPT!
你一定经历过这种令人抓狂的时刻:
在 Midjourney 或者各类生图大模型里输入一段精心调校的提示词,几秒钟后,屏幕上蹦出一张惊艳绝伦的网页设计图。渐变色高级,排版充满未来感
但狂喜只持续了三秒
当你想要把上面的英文标题改成客户的名字,或者想把右侧的按钮往左挪 10 个像素时,你才猛然发现:这是一张被焊死的 PNG 图片。
文字改不了,图标抠不出来,图层全被压平。想要微调?要么打开 Photoshop 戴着痛苦面具一点点擦除重画,要么硬着头皮重新抽卡几十次,然后看着 AI 把原本完美的排版再次抽得稀烂。
过去三年,各类文生图模型的热度虽高,生成的作品往往只能停在“点击下载 PNG”这一步。导出的静态位图图层全无,很难直接送进实际开发流水线。
这个僵局,在今天被彻底打破了
蚂蚁集团旗下的 Ant Ling 团队正式开源了 Ming-Image-0.1-Design 系列模型与配套工具链。
这套组合不仅在权威评测榜单上拿下开源权重 UI/UX 设计第一,还带来了一项关键突破:生图不再是一锤子买卖,模型能把整张设计图反向拆解成 2 到 9 个独立的透明图层,甚至直接逆向导出带原生文本框的 PPT 与网页代码!

▲ Ant Ling 官方发布开源推文,登顶 Artificial Analysis UI/UX 开源榜
01别再拿“画画的模型”糊弄设计师了
为什么以前的文生图模型,做不好设计?
因为画画和做设计,根本是两码事
画一张赛博朋克风的风景照,AI 多画一条光斑、少一棵树,没人会挑刺;但做一张 UI 界面或者宣传海报,对齐就是生命,可读性就是底线。过去的大模型一遇到文字就变成“外星文鬼画符”,按钮文字边缘扭曲,多栏卡片永远对不齐。
蚂蚁开源的 Ming-Image-0.1-Design(参数量约 6B)专为视觉设计与版式构图打造,目标十分明确。

▲ 社区创作者展示 Ming-Image 的 UI、信息图与海报生成能力
它的底层逻辑有三大杀手锏:
- 原生 4 通道 RGBA 支持
:以往生图模型输出的背景都是死白或死黑,想用里面的元素必须二次抠图。而 Ming-Image 原生支持透明通道,一键直接出透明底素材。 - 8K 结构化提示词理解
:直接把设计需求转译为接近 Figma 设计稿的结构化 JSON,坐标、色值、图层从属以及必须原样保留的字词都能精准锚定。 - 2048×2048 工业级高分辨率
:采样默认只需 12 步(steps),就能端到端生成文字清晰、栅格规整的完整视觉稿。
在知名 AI 评测机构 Artificial Analysis 的“UI/UX Design”竞技场盲测中,Ming-Image-0.1-Design 拿下约 1082 的 Elo 高分,直接在开源权重模型中登顶。

▲ Ming-Image-0.1-Design 在 UI/UX 专用切片榜单中位列开源权重第一
02图层逆向:把像素重新拆成“千层饼”
如果只是“出图好看、文字清楚”,那它还只是一款更懂排版的生图模型。
更受设计界与开发者关注的,是它的另一项核心发布:Ming-Image-0.1-Design-Layer。
它能把一张已经拍平的平面图,逆向剥离成 2 到 9 个可编辑的独立图层!

▲ 开发者 Joey 演示:从生图到拆层,再直接提取素材嵌入落地页
海外开发者 Joey 在本地机器上做了一场震撼的实机演示:
他先用 6B 的 Design 模型输入提示词,生成一张 2048px 的工作台落地页设计图。随后,他把这张图扔给 6B 的 Layer 模型。
几秒钟后,整张扁平图片被精准解构成若干层透明 PNG:
第一层:纯文字排版; 第二层:浮动在表面的显示器与电脑组件; 第三层:桌子与前景装饰; 最底层:渐变背景与氛围光。
Joey 顺手把提取出来的素材直接拖进前端代码,页面大标题立刻成了可以直接选中的 HTML 文本。
后续修改文案只需直接编辑代码,无需重新跑生图。 想要换掉背景,也只需替换最底层的背景层,前景的电脑和按钮不受任何影响。
在专业测试集 Crello 的 12 项评测中,这个仅 6B 大小的分层模型,不仅效果全面领先,推理速度甚至比 20B 参数的基线模型快了整整 4.3 倍!
03办公族的狂喜:截图一秒变原生可编辑 PPT
除了前端 UI,蚂蚁这次还放出了一套极其接地气的 Agent 技能,Image-to-Editable-PPT。
以前大家把设计图放进幻灯片,叫“贴图”。汇报时领导说“这行字改一下”,你只能当场卡壳。
而这套 PPT Skill,能够审视整张幻灯片截图,指挥 Layer 模型进行空间解构:
- 普通文字
:直接识别并还原成 PowerPoint 原生文本框; - 几何容器
:还原为原生矢量形状,颜色、边框随意调; - 复杂插画
:自动裁切为分层的透明位图,自由缩放移动。

▲ Image-to-Editable-PPT 技能架构:将扁平图像逆向编译为原生 .pptx
最终导出的产物是一份完整的 .pptx 演示文稿文件。里面的文字能敲键盘修改,色块也能随意拉伸。
配合另一套 Ling UI Design Skill,甚至可以在 Claude Code、Cursor 等编程智能体里,直接实现“提示词 → 视觉图 → 拆解素材 → 自动写代码 → 浏览器截图校验”的视觉优先编程闭环。

▲ 将模型无缝嵌入 Coding Agent 的 UI 设计工作流
04社区光速接盘:今晚就能跑进工作流
开源协议诚意十足:全套模型与代码全部采用 MIT 协议开源。
权重刚在 Hugging Face 和 ModelScope 上线,全球开源社区几乎在 24 小时内全线动员:
- ComfyUI 节点秒级适配
:知名开发者 Kijai 迅速完成打包,日文圈与欧美开发者纷纷放出工作流节点; - GGUF 量化版出炉
:社区开发者 @realrebelai 紧接着推出了量化版本,大幅降低显存门槛; - 云端 API Day-0 接入
:Novita 迅速在 OpenRouter 上架了 Design 与 Layer 双模型接口,让手头没有 80GB 大显存算力的普通开发者也能调 API 尝鲜。

▲ 社区迅速响应,推出 GGUF 格式让更多本地设备能够运行
有日本设计师在 RTX 5090 上实测,生成一张 1536×2736 分辨率的高清手机站界面设计,仅耗时 20 秒左右。社区反馈虽然指出日文复杂文字偶有不稳、实拍照片分层弱于设计矢量图,但对于“生成即可交付、分层即能使用”的工作流闭环,几乎给出了一致的高评价。
05深度观察:参数膨胀的尽头,是“工作流闭环”
看懂了 Ming-Image 的走红,你才能看清当前 AI 行业正在发生的剧烈质变。
过去两年,大模型厂商陷入了一种“全能参数军备竞赛”:大家都在拼谁的模型能画出更逼真的睫毛、更逼真的阳光折射。
但结果呢?在严肃的工业生产中,这些庞然大物往往“好看却不可用”。
如果你去翻看 Artificial Analysis 的公开总榜,你会发现一个有趣的现象:Ming-Image-0.1-Design 在包含各类人像、风景的通用文生图总榜上大约排在第 45 名;但在 UI/UX 设计垂直切片上,它却一跃拿下开源第一。

▲ 专项切片第一 vs 通用总榜中游,印证了垂类小模型的精准打击策略
这种反差背后是极为清晰的工程取舍。
在软件工程与设计体系里,没有人需要一个样样都通却无法二次编辑的庞然大物。实际生产中更需要的,是任务边界清晰、体量轻便(约 6B)、能无缝嵌入 Figma、PowerPoint 与开发工具工作流的专业模块。
提示词工程,正在从过去虚无缥缈的“赛博念咒”,演变成严谨的“版式工程说明书”;而 AI 生成物,也终于从一张张孤立死板的“终局 PNG”,蜕变为了能被代码调用的“动态资产”。
AI 生成设计的上半场是“画得像”;下半场,拼的是“改得动”
这一次,中国开源团队踩在了时代的最前沿。
资料与开源链接索引:
- 模型权重(HF)
: inclusionAI/Ming-Image-0.1-Design&Ming-Image-0.1-Design-Layer - 代码仓库
: github.com/inclusionAI/Ming-Image - Agent Skills 库
: github.com/inclusionAI/ling-cookbook