咆哮式表演怎么来的?
你一定见过不少提示词在教给你,如何做人物的九宫格表情包吧?把悲伤,快乐,兴奋统统提取出来,然后基于同样的人物去演绎。
像这样:
(图来自海外论坛)
你是否觉得还不错?
脸很漂亮,很真,光影不错,表情自然。 但你多看几秒,会发现一个问题: 她不像一个角色,更像一个在拍硬照的模特。
表情是有,但情绪是空的。 眼睛看着你,但不像真的在想什么。
这就是很多AI人物最大的问题,你做了表情,但没有表演。
表情不是表演
情景喜剧里,演员经常会有一种非常管用的“招牌表情”。
比如《老友记》里,角色常常会在某个尴尬、吐槽、惊讶、无语的瞬间,给出一个非常清晰、非常好认的表情。
你很难说那个表情到底是悲伤、快乐、愤怒,还是震惊。
我们看几个钱德勒的例子:
(《老友记》“钱德勒”剧照)
左上:外放式大笑
没有对着镜头咧嘴,瞪大眼睛,而是眼睛下压,头部微低,身体跟着放松。
这个表演在传递什么?
我知道这件事很好笑,且我已经绷不住了。
左下:低头憋笑
这里演员的嘴角上扬,但眼神是下垂的,头依然低下。
光看描述是否跟上面的很像?
然而它传递了另外一层意思。
我知道我刚才的梗很赞,但我不能笑的太明显。
有点得意,又有点装谦虚。
真正的演技不止有一个表情,而是整个肢体动作都在支撑着这个表情,共同传递那些复杂而微妙的情绪。
再比如,电影《周处除三害》中的尊者。
(《周处除三害》剧照)
似笑非笑,似怕非怕的表情。
面对陈佳林的手枪,尊者肯定是害怕的,然而,在信徒面前,他又不能自曝。所以他的状态,既有恐惧,又有邪教式的陶醉,还存在想维持权威的姿态。
这也是从“表情”进入“表演”的关键,一个表情里同时存在几种互相矛盾的情绪。
当然,我们也要承认一个现实。
现在的AI视频模型,还很难真正做到像优秀演员那样,把人物角色与复杂情绪、细微表情、身体姿态和连续动作完全统一起来。
因为,角色本身的性格,习惯,经历,角色当下所处的境遇,心理变化都决定了他如何表达情绪。
同样是难过,有的人笑着哭,有的人眼神空洞而麻木。
同样的一个人,之前他笑的没心没肺,在经历大起大落后,开心也变得波澜不惊,不易察觉。
同一个人物,三种不同的微笑
那么AI能将表情做到什么程度呢?我做了一个测试。
用同一个人物,生成三种不同的笑: 分别是:
托腮憋笑:我懂但我暂时不想拆穿你。
2. 疯癫的笑:想不到吧,是我干的。
3. 爱意的笑:喜欢你,此刻好幸福。
怎么做到的?
首先,我们要先解决“表情素材”的问题,任何复杂的表情都是由基本表情组合,变化而成的。
所以我先做了一张人物22宫格表情图。

它的作用是解决"同一个人物,在不同情绪下,五官可以如何变化"的问题。
例如:
这个人物的中性表情是什么样? 她开心时嘴角怎么动? 她愤怒时眉眼怎么变化? 她厌恶时脸颊和嘴角有什么痕迹? 她惊讶时眼睛、嘴巴、下巴会怎么打开?
真正让表情变成表演的是这套结构

夜雨聆风