人物已经像月野兔,为什么画面仍然一眼像AI?问题往往不在脸,而在场景。
角色一致性解决的是“她是谁”,场景一致性解决的是“她为什么会出现在这里”。桌上的杯子与手没有关系,地铁站同时出现东京和纽约标识,室内阳光照亮人物却没有落到家具上,这些细节单独看不严重,放在一起就会让画面失去可信度。
文件夹里的十张图覆盖居家、咖啡店、运动、雨夜、双人街拍和东京夜景。它们的完成度很高,也保留了几个典型穿帮点,正适合做一套场景检查方法。目标不是把画面修得毫无想象力,而是先让现实逻辑成立,再决定保留多少梦幻元素。

居家学习与咖啡店用餐:同样是坐姿,可信度取决于手、视线和桌面物件能否对应。
居家学习画面里,平板在人物正前方,手托着脸,视线落向屏幕,露娜停在桌边。电脑、笔记本、杯子和抱枕虽然不少,至少都处在可以使用的位置。生成类似画面时,与其写“温馨客厅、很多书、电脑、猫咪、鲜花”,不如先写人物正在做什么,再安排她够得到的物件。
模型喜欢用小物件填满空白,结果常常是杯子没有杯口、笔记本朝向错误、电脑悬在沙发边缘。限制物件数量会更稳。主体附近保留三到五件真正需要的东西,其余空间交给光影、墙面和家具纹理。
咖啡店画面容易出现多套餐具、重复杯子和互相穿过的手指。提示词要写清左右手分工,例如右手拿杯子,左手自然抬起,手机平放在餐盘右侧。饮料吸管必须进入杯口,餐具放在盘子旁边,不要让模型自己拼接一桌“看起来像早餐”的物品。

耳机、拉伸与低机位运动:手臂经过脸部或头发时,遮挡关系比姿势本身更重要。
双手同时扶耳机很容易生成镜像手势,看起来整齐,却不像自然动作。可以让一只手按住耳罩,另一只手只触碰耳机边缘,肩膀高度也略有差别。耳机头梁要从头顶连续经过,不能在丸子头附近突然消失。
双臂举过头顶时,肩、肘、腕和手指会连成很长的结构。只写“伸懒腰”容易得到过长手臂或粘连手掌。更稳的写法是说明双臂向上、手腕在头顶交叠、肘部轻微弯曲,同时要求肩线保持自然。袖口宽松时,还要让布料顺着重力下落。
黑色运动造型用了较低视角,腰线与腿部会被自然拉长。提示词里要限制镜头距离和透视强度,避免腰腹突然变细、手臂长度失控。可以写“轻微低机位,接近50毫米人像透视,不使用超广角,不夸张拉长四肢”。
晨光拉伸的亮部来自右侧窗户,脸、袖子和金发都接受同一方向的光,画面因此容易理解。咖啡店则是室内暖灯加窗边阳光,背景冰柜与桌面也出现相近色温。光线的作用不是把人物照亮,而是告诉读者她站在什么时间、什么空间里。
雨夜画面中,人物正面偏暗,街灯与招牌在地面留下反光,伞面有清楚水滴。这里最容易翻车的是人物像棚拍,背景却在下雨。生成时要写“人物受到道路霓虹的侧向反光,衣料与头发边缘带冷色湿润反射”,让环境真的影响人物。
如果想保留星光或月牙光点,数量要少,并且把它们当装饰粒子,而不是新的光源。人物脸上同时出现暖阳、蓝色霓虹和金色星光,通常不是层次丰富,而是光线互相打架。

雨夜单人与双人同行:加入天气或第二个人后,人物身份、手部和空间关系都需要重新检查。
伞面应该遮住一部分顶部光线,伞柄从手中连续向上,雨水集中出现在伞外与边缘。画面里的帽檐、丸子头和伞面靠得很近,生成时要明确谁在前、谁在后。否则常见结果是丸子头穿过帽子,伞柄断在手掌里,或者伞下仍然像直接淋雨。
双人同行时,模型容易交换发色、首饰和服装。提示词可以把月野兔写成角色A,把同行者写成角色B,再分别说明发型、衣服、站位与视线。两人的手臂如果重叠,最好要求一前一后自然行走,不牵手,也不做复杂交叉动作。
背景的景深也要服务主次。角色A清晰,角色B可以略微虚化,但不能只把脸糊掉而衣服仍然锐利。更自然的写法是“焦点落在角色A眼睛,角色B整体处于轻微景深虚化中”。

地铁与东京夜景:氛围很完整,但地点信息混杂,适合用来做场景纠错示范。
地铁画面乍看很有夜东京气氛,细看却同时出现新宿、涩谷、银座方向、美国国旗和Coney Island。前四项属于东京语境,Coney Island来自纽约。画面还把不同线路、地标与城市符号压在同一站台上。这类错误不会影响人物好看,却会让熟悉城市的人立刻出戏。
准确地点只保留一个。生成涩谷站,就上传真实涩谷站参考图,只允许出现对应线路颜色、出口结构与站名。并不需要精确地点时,反而可以要求“无可读文字的普通东京地铁站,使用模糊日文导视形状,不出现其他国家国旗与英文地名”。
两张夜景图把东京塔、涩谷109、新宿与樱花集中在同一视野中,像一张城市关键词拼贴。做氛围图可以保留,但如果文案写的是“真实东京窗景”,地理关系就需要收紧。选择东京塔时,让背景只保留合理距离的城市天际线;选择涩谷时,就不要再把东京塔放到窗户正中央。
霓虹文字同样要克制。模型最擅长生成“像字的纹理”,不擅长一次写对多块招牌。需要准确文字时,先生成干净空牌,再在排版软件中补字;不需要准确文字时,直接要求远景虚化与不可读标识。
月牙、兔子、露娜和粉紫配色能帮助识别月野兔,但它们不必同时出现在耳环、项链、杯子、抱枕、墙画、招牌和夜空里。符号太密会让真实住宅变成主题展厅,也会削弱人物本身的辨识度。
减少符号以后,场景反而更容易变化。居家图靠露娜与月牙笔记本提示身份,雨夜图只靠发型和首饰,东京夜景则让额前月牙成为唯一明确标记。系列感来自稳定的人物,不需要靠重复摆设维持。
地点混杂、手穿过物件、伞柄中断和双人身份交换优先级最高。它们会直接破坏画面含义。小面积文字、首饰形状与装饰光点放在后面处理,避免为了修一块招牌反复重画人物。
局部修改指令需要同时包含修改对象与固定对象。例如:“只修正右手与杯子的接触关系,保留人物面部、左手、服装、桌面物件、镜头和光线。”只写“把手修好”范围太大,模型可能顺便换掉杯子和表情。
背景招牌不是主体时,虚化、留白或后期排字通常比重新生成整张更稳。反复抽卡可能得到正确文字,却丢掉已经满意的脸与动作。先判断错误是否影响阅读,再选择修图、遮挡或重新生成。
缩略图阶段先看人物与构图,放大后再看手、文字和地标。生活照不需要把所有背景细节都讲清,但不能出现互相冲突的信息。场景越普通,逻辑越重要;画面越梦幻,越需要确定哪些部分属于现实,哪些部分只是装饰。
完成角色一致性以后,下一步不是继续增加服装数量,而是让人物真正进入环境。她坐下时会碰到桌子,撑伞时会遮住灯光,走进地铁时会遇到正确的线路与站名。做到这些,AI生成的角色才不只是被贴在漂亮背景前。
END
夜雨聆风