乐于分享
好东西不私藏

AI 配图改造实录:让文章里的"我"长得一样

AI 配图改造实录:让文章里的"我"长得一样

 三个模型、两个 Skill、一次关键认知转变。 

· · ·

一、一个“好玩”的需求

公众号文章需要配图——不是随便找张网图凑数那种,而是能解释这段文字在说什么的配图。

网上很火的小黑配图skill就很有意思:小黑是一个黑色小豆子形象,白底、手绘、极简、有点怪诞。它会把文章里的概念"演"出来:搬运素材、拉线、卡在流程断点里、分拣信息、连接路径。亭志这段时间玩得不亦乐乎,我心痒好几天了,可不可以把小黑变成我呢?

 · ·

二、第一次尝试:WorkBuddy 内置生图

WorkBuddy 自带 ImageGen,我先拿自己的照片试了一张。

结果一言难尽。画出来的人大概 25 岁,太年轻了。更根本的问题是——我不知道下一张图她会长什么样

ImageGen 是纯文生图,每次调用都是独立的,无法传递"上一张图的人"这个信息。

这条路不通。

· · ·

三、第二次尝试:Qwen Image 2.0 Pro

我有一把 Qwen Image 2.0 Pro 的 API Key,直接调它。

3.1 再次图生图:生成 IP 形象

第一版:太年轻(25 岁)。 第二版:太老了(55 岁)。 第三版:太胖、太锋利、不够亲和。 第四版:终于可以了。

▲ Qwen Image 2.0 Pro 第四版:深蓝连衣裙、黑框眼镜、短发、银项链,终于像我这年龄段的培训师了

我顺手生成了一整套 IP 资产:

  • 角色设定板(正面 + 配色 + 道具)
  • 三视图(正 / 侧 / 背)
  • 动作姿势库(讲课、指白板、思考、点赞等 6 个场景)
  • 细节与表情拆解(发型、眼镜、服装、表情变化)

我把它沉淀为了技能版本1:lily-illustrations,以后就可以调用了。

3.2 问题来了:6 张图,6 个不同的人

我拿这套提示词去生成文章配图。同一篇文章 6 张图:

第一张像设定板里的人,第二张发型变了,第三张眼镜没了,第四张年龄又回去了……

文生图每次独立调用,没有"记忆"。 同一套文字描述,每次 Qwen 都会自由发挥,结果自然跑偏。

3.3 解决方案:head-only 锚点

问题本质是:Qwen 看了整张设定板做参考,会连"版式"一起学过去——或者干脆忽略参考图,自由发挥。

我试了几个方法,最终找到的是:

只传一张"头部特写"做参考图,同时用文字强锁定人身特征,禁止复制参考图。

从角色设定板上裁了一张干净的头部特写(脸 + 短发 + 眼镜),每张新图都用它做图生图。提示词里加了一组反污染指令:

REFERENCE: Only the face. DO NOT copy layout. Exactly ONE Lily. NO duplicates. Prompt extend: FALSE. 

人物一致性终于稳住了。

· · ·

四、关键认知转变:配图不是装饰品

这个时候我还犯了一个更大的错误。

4.1 第一次做的是"信息图"

我让 AI 生成了一张"SVG→DrawingML 编译器"的说明图。思路是:把文字信息"压缩"成一张流程图,人物嵌进去讲解。

结果:人物站在画面角落,指着箭头和标签——她就是装饰。

这不是配图。这是把 PPT 做成了图片。

4.2 参考了一个思路

我让 WorkBuddy 再好好学习一下小黑配图模式:

不是信息图,不是装饰插画。IP 角色亲手执行画面里的信息逻辑——搬运、拆解、推拉、连接。

配图里的角色,应该"演"这段文字,而不是"站"在旁边解释它。

4.3 从信息图到分镜图

我把"SVG 编译器"这张图重做成了三格叙事分镜:

  • 格 1
    :Trainer 把"用户主题"卡片塞进机器(输入阶段)
  • 格 2
    :Trainer 操作编译器,左边 SVG 碎片进、右边 PPT 形状出(转换阶段)
  • 格 3
    :Trainer 举起干净的 .pptx 文件(输出阶段)

底部一行大字:「不是贴图,是每个形状都能改」

这张图的效果完全不同。人物是画面逻辑的操作者,不是导游。

从此以后,分镜模式成了默认配图方式。

· · ·

五、第三次尝试:腾讯 Miora

Qwen 生成的 Lily 形象虽然有了一致性方案,但整体风格还是偏"AI 生成感"——不是不好,是我想试试更专业的 IP 设计工具。

我用腾讯 Miora 生成了一套自己的 IP 形象照。

▲ Miora 生成的第一组 IP:米白针织开衫 + 白衬衫 + 卡其裤,细框眼镜,更贴近真实的培训师质感

▲ 三视图:正面、3/4 侧面、背面。蓝色西装、米色长裤、丝巾、平板电脑、斜挎包

▲ 六个常用动作:讲课、指板、拿平板、整理笔记、点赞、思考

▲ 表情库:五种情绪 + 发型/眼镜/服饰细节拆解

这就是 trainer-illustrations 技能包的 IP 资产。和 lily-illustrations 的区别在于:

lily-illustrations
trainer-illustrations
IP 形象
深蓝连衣裙 Lily
米白开衫 Trainer
生图工具
Qwen Image 2.0 Pro
Qwen Image 2.0 Pro
IP 设计
Qwen 文生图迭代
腾讯 Miora 专业生成
配图模式
从信息图进化到分镜图
默认分镜图
人物一致性
head-only 锚点
head-only 锚点

两次迭代下来,核心方法沉淀成了 Skill 文件——IP 资产、风格 DNA、构图模式、提示词模板、QA 检查表。

· · ·

六、值不值得?

坦率地说,目前workbuddy生成的配图还是不够理想,不如亭志用codex+gpt生成的效果。一方面可能 workbuddy 还是无法写出codex那样的提示词,另一方面qwen-image-2能力还是不如gpt-image-2 。两者都是大模型的能力问题。

但我初步得到了三样东西:

第一,一致性资产。 以后每篇文章配图,不需要从零描述人物外貌。一个 head-only 锚点 + 一套锁定指令,就能让每张图里的人长得一样。

第二,分镜配图方法论。 从"把信息压进图"到"让 IP 角色演出来",这个转变会直接影响我以后所有配图的质量。

第三,两个可复用的 Skill。 下次再做配图,不是从零开始,而是像打开一个配置好的工具箱。

最后一个问题:IP 配图到底是为了什么?

不是为了刷脸。如果你做公众号只是为了让人记住你的样子,放照片就行了。

IP 配图的价值,是让内容更容易被记住。 一个固定的角色穿梭在同一篇文章的不同段落里,帮读者在脑子里建立视觉锚点——"看到这个人,我就知道这一节在说什么。"

把经验写成 Skill,把 Skill 交给 AI。以后每篇配图,AI 都能调出一致的"脸"来。

· · ·

本文所有配图均由 Qwen Image 2.0 Pro(图生图)和腾讯 Miora(IP 资产)生成。