ARTICLE · 1037901
46 条被看见的 AI 视频,把"真人感"写成了9 个具体动作
REALNESS FILES / 真人感观察
46 条被看见的 AI 视频,把"真人感"写成了9 个具体动作
一条 AI 视频被划走,往往不是因为画质差,恰恰是因为它太干净了——皮肤没有毛孔,说话没有停顿,镜头稳得像三脚架,屋子里安静得没有一丝环境声。这些在传统广告里叫"精致",在短视频里叫"假"。我们把 NOVAI 发现页上 46 条有曝光、提示词完整的 AI 视频逐条读了一遍:那些被看见的作品,几乎都在提示词里明确写了"怎么让人看起来像活的"。这一期不讲玄学,只把这 9 种写法拆开、配上原句。
NOVAI 是什么 新星数科旗下的 AI 视频智能生产平台:发现页开放全站作品与提示词、画布工作流整张可复制、视频生成与「爆款复刻」「爆款裂变」「电商混剪」等技能负责出片——找对标、抄结构、出成片,一条链路不换工具。
REALNESS BOARD / 数据口径
46 条
有曝光 · 提示词完整
9 种
真人感写法
2.00x
微表情写法的均浏览倍数

PRELUDE / 先说一个误会
不是提示词越长越好
很多人以为让 AI 视频变真实的方法是"多写一点"。但数据里有反例:一条 1,487 字的家居广告(茂隆掌柜出品)浏览 3,524,一种真人感技法都没用——靠的是"美工刀划开劣质海绵、碎屑四溅"这种暴力视觉。反过来,也有不少上千字的提示词,浏览停在个位数。
真正的分界不在长度,而在有没有写到"动作颗粒度"。看这两句的差别:
× 无效写法 一位漂亮女生坐在车里,展示了防晒衣的材质,表情开心。
√ 有效写法 双手捏住防晒衣双肩位向外拉伸,衣服在空气中轻微晃动;音效是面料被撑开时紧绷的"呲"声,加上轻微的环境自然风声。
这一期要拆的事
第二句为什么有效?因为它写了三件可执行的事:手怎么动、衣服怎么晃、听见什么声音。AI 不需要"开心"这种结论,它需要动作指令。下面 9 种写法,本质都是把形容词翻译成动作。
TECHNIQUE / 九种写法逐条拆
N°01 · 覆盖率 46%
手持晃动:把"呼吸"和"抖动"分清楚
出现频率最高的一种写法 · 均浏览 1,476(1.73x)
"加一点晃动"是很多人的第一反应,但真正有效的写法会额外补一句限定——幅度小、频率慢。因为在 AI 的理解里,"抖动"是手持摄影,"晃动"更像地震。
PROMPT 原文
"镜头:全程手持微晃,幅度小频率慢,是'呼吸式'晃动不是抖动。"——《真人感教程》
"手机竖屏拍摄。主视角固定机位,带有轻微的手持呼吸感(微晃,不要上稳定器),配合粗暴直接的急推镜头,就像朋友在旁边随手录下的 Vlog。"——《世界杯带货》
注意第二句里的"不要上稳定器"——这是一句否定式的排除指令。写提示词时,把不想要的东西明确排除,往往比多写十个形容词更管用。
N°02 · 覆盖率 22%
微表情:把"情绪"写成秒表和肌肉
均浏览倍数最高的一种写法 · 1,698(2.00x)
这一种在数据上表现最好,但写法也最"费字"。有效做法是把情绪拆到时间 + 具体肌肉动作两个维度上:不说"很失落",说"第 7 秒极慢地闭一次眼"。
PROMPT 原文(时间轴写成表格)
"7–9s:慢闭眼(约 1 秒),睫毛完全压下,再缓睁,视线垂落/9–11.5s:抬眼,视线斜向上 10–11 点,下眼白微露,唇张开——情绪峰值'走神/心事感'。"
"呼吸感:唇微张配合鼻翼微动,2–4.5s 段最明显。"
"下眼白微露""鼻翼微动"这类词,看起来过于琐碎,但它们恰好是真人脸上才会出现的不完美细节。AI 生成的脸之所以"假",多数时候不是五官不对,而是缺少这些连自己都没注意到的肌肉动作。
N°03 · 覆盖率 28%
真实场景:背景里要有"不该出现的人"
均浏览 1,606(1.89x)· 榜首那条 4,152 浏览的作品就用了这一种
影棚是无限干净的,生活不是。有效写法会主动给背景"加噪音"——不是加特效,是加会移动的路人和不会被清理掉的光影。
PROMPT 原文
"拍摄场景:人流适中的地铁站进出站口、自动扶梯旁(确保背景有移动的人物,增加生活气息)。"
"拒绝精美的室内直播间布景,主打一个'野生感'和'零滤镜生活化'。背景偶尔有微风吹动树叶,或者极度模糊的路人走过的动态。"
"侧前方 45 度自然光(模拟车窗光),营造出'都市丽人日常出行'的真实环境质感。"
"确保背景有移动的人物"这七个字,是这一种写法的核心。它给画面引入了一个AI 无法完全控制、但恰好因此显得真实的变量。
N°04 · 覆盖率 15%
环境音:把"安静"当成一个 bug 来修
均浏览 1,228(1.44x)· 也是最容易被忽略的一栏
大部分人写提示词时只写画面,音效栏留空。但真实世界的每一秒钟都有底噪——安静本身就是一个"AI 感"的强信号。有效写法会把音效当成画面的一部分来设计。
PROMPT 原文(都是具体到能听见的拟音)
"音效:面料被撑开时紧绷的'呲'声,轻微的环境自然风声。"
"音效:轻微的机箱风扇声。"(一条电竞主题片,把电脑主机当底噪)
"音效/BGM 节点:杯盏碰撞声和餐厅内嘈杂热闹的人声背景音。"(同城探店)
"音效:清爽的呼吸声拟音,强化'透气'视觉。"
最后一条特别值得学:用声音去解释画面里看不见的属性。"透气"是视觉描述不出来的,但呼吸声可以。
N°05 · 覆盖率 9%
口语化:允许人物"说错""停顿""有口音"
均浏览 1,198(1.41x)· 覆盖率低,但商家最容易上手
广告腔是最典型的 AI 味。有效写法会直接在提示词里给口播"降咖"——允许停顿、允许小表情,甚至把"不要像背书"写进去。
PROMPT 原文
"拍摄设备:智能手机(建议手机直出,保持真实感,避免过度滤镜)。"
"拍摄时一定要保留手机自拍感,不要太像广告片。镜头可以轻微晃动,人物说话可以有停顿和小表情,越像真实博主分享越自然。"
"口播采用标准普通话,语气自然口语化。"
REMAINING / 剩下四种,一句话说完
意外随机性 · 1.48x
主动安排一次"不该发生的事":一只戴黑手套的手拿美工刀狠狠划开沙发,劣质海绵瞬间崩裂、碎屑四溅;或者让手从画面右上方伸进来,捏住模特肩部边缘。真实感来自"这个瞬间无法被彩排"。
一镜到底配长镜头运镜 · 1.41x
"15 秒一镜到底千川调度时间轴"——把 4 个卖点段用推、摇、拉洋片式后退串成一条不断的镜头。切镜头少,破绽就少,这也是新手最快见效的一招。
手机直出 / 竖屏自拍 · 1.11x
覆盖率不低(24%),表现倍数却接近基准。原因可能是它太常见了——只写"手机拍摄"已经不够,得配上晃动、底噪、口语化才有区别度。
画质瑕疵 · 0.62x(唯一低于基准)
"过曝""噪点""跑焦"这一类写法,均浏览反而只有全样本的 0.62 倍。真实感 ≠ 画质差——用户想要的是"真人在拍",不是"拍得不好"。这一条是本文唯一建议放弃的写法。
它把"真人感"直接写成了提示词的一级标题
浏览 4,152 / 复制 232 / 全站浏览第一 · 无台词 · 纯 BGM
这条只有 887 字,是榜单里最短的头部作品之一。它第一行就把结论写死了:
"类型:氛围感人像近景|无台词|纯 BGM|真人感全靠微表情 + 手持呼吸感"
更狠的是它自带一份"真人感细节清单(复刻必保)",六条全部是可执行的:
① 碎发 3–4 缕垂在右脸颊前,随头部倾斜轻微摆动
② 皮肤 颧骨/鼻梁油光高光,脸颊散布浅色雀斑和小痣(非磨皮假脸)
③ 唇部 水光感明显,下唇反光随唇张开变化
④ 眼睛 catchlight 为蓝/紫色点光,位置随视线移动
⑤ 呼吸感 唇微张配合鼻翼微动,2–4.5s 段最明显
⑥ 镜头 全程手持微晃,幅度小频率慢,是"呼吸式"晃动不是抖动
这条案例说明的事
这条片子的作者没在"描述一个美女",而是在给渲染器写验收清单——每一项都能在成片里对照检查。把"真人感"从形容词变成 checklist,是这个主题下最值钱的一次改写。
一镜到底 + 拟音:15 秒里塞进四种声音
浏览 2,161 / 复制 211 / 防晒衣带货 · 提示词按"千川调度时间轴"排成 4 段
00–03s 痛点前置 拉伸面料 → 音效:"面料被撑开时紧绷的'呲'声,轻微的环境自然风声。"
03–07s 卖点可视化 拨动帽檐 → 音效:"手指划过帽檐面料的细碎摩擦音。"
07–11s 细节背书 指尖顶起面料透光 → 音效:"清爽的呼吸声拟音,强化'透气'视觉。"
11–15s 情绪闭环 手掌顺滑抚过 → 音效:"手掌摩擦丝滑面料的'沙沙'声,结尾卡点重音 BGM。"
同时它还规定了环境:"高端新能源汽车主驾驶舱内,红色皮革座椅纹理清晰……营造出'都市丽人日常出行'的真实环境质感。"——注意,它选的不是影棚,是一个观众自己每天都会待在里面的场景。
这条案例说明的事
拟音的价值在于替画面解释看不见的属性:透气看不见,但呼吸声听得见;丝滑摸不到,但"沙沙"声听得见。当你没法用画面证明一个卖点,就先想它的声音是什么。
每段分镜都专设一栏,叫"真人感细节"
浏览 1,756 / 复制 174 / 30 秒反转剧情 · 2,004 字 · Seedance 2.5
这条的提示词结构和其他片子最大的差别是:每一段分镜除了景别、运镜、对白以外,都单独列了一行"真人感细节"。挑三段看:
00–09s 被骂的瞬间真人感细节:嘴唇微张悬停,咽下食物时喉头轻微蠕动,拿着烤串的手在空中顿住
09–16s 气极反笑真人感细节:说话前深吸一口气胸口起伏,左手紧握把手;男主说最后一句时眉毛微挑
16–20s 无台词的 4 秒真人感细节:极慢地眨眼一次,下巴微抖,双手手指收紧抓握,随后一口长气缓缓呼出
"喉头轻微蠕动""下巴微抖""手指收紧"——这三条都不是情绪,是情绪的生理表现。而且它把最长的 4 秒给了一个没有任何台词的镜头,只靠呼吸和眨眼撑住——这恰好是最考验"像不像人"的地方。
这条案例说明的事
把"真人感细节"设成一个固定栏目,比偶尔想起来加一句更有效——它会强迫你在每个分镜上都问一次:"这个瞬间,人的身体在做什么?"答案往往就是那句让画面活过来的提示词。
TEMPLATE / 可直接粘贴
一段可以直接粘贴的"真人感附加块"
不需要重写整条提示词。把你原本的内容留着,末尾贴上下面这一段,就同时补上了最容易缺的几件事:
真实感附加块
· 拍摄:手机竖屏直出,全程手持微晃,幅度小频率慢,是"呼吸式"晃动不是抖动,不上稳定器· 皮肤:保留毛孔、雀斑、细微泛红与鼻梁油光,不要磨皮,不要塑料皮· 细节:3–4 缕碎发随头部动作摆动;下唇有水光;说话前有一次呼吸起伏· 微表情:第 3 句时极慢地眨一次眼;说到情绪峰值时下眼白微露· 声音:保留街头环境底噪与人声背景;产品动作配具体拟音(拉扯声、摩擦声、拉链声)· 背景:真实生活场景,背景有移动的路人或自然光影,不要影棚布景· 口播:自然口语,可以有停顿和小表情,不要像背广告词· 禁止:磨皮感、假面感、广告腔、影棚感、过度滤镜
用法提醒:附加块解决的是"像不像人",不解决"值不值得看"。钩子、卖点、节奏这些还是得自己写——真人感只是让人愿意多看两秒,不是让人愿意买。
真人感观察 · 给商家的三句话
① "假"多半不是因为不够美,是因为太完美。没有毛孔、没有停顿、没有环境声——这三样缺一样,观众就出戏。修 bug 的优先级,比调画质高得多。② 写动作,不写形容词。"很失落"AI 读不懂,"极慢地眨一次眼、视线垂落"它读得懂。所有有效的真人感写法,本质上都是把感受翻译成身体动作。③ 声音是最省钱的真实感。只写画面的提示词,等于主动放弃了三分之一的信息量。加一行环境音,成本为零,效果立现。
NOVAI PLATFORM / 关于平台
NOVAI Studio 新星数科 · AI视频智能生产平台
本文的 9 种写法,全都能在平台上直接落地——三个能力正好对应这条链路的三段:
01 发现页 · 把好提示词当教材读 全站作品的提示词完整可见,本文所有原句都来自这里。想学"真人感怎么写",最快的办法是找一条你喜欢的片,逐字读它的提示词。
02 视频生成 · 把附加块接在末尾 文末那段"真实感附加块"可以直接粘到你的生成提示词后面,不需要改结构,也不需要额外配置。
03 爆款复刻 · 复刻时保住真实感 拆解原片分镜再重生成时,把"真人感细节"作为必保项写进改写要求——换人物、换产品,但别把那份"不完美"一起换掉。
04 电商混剪 · 让每一条都像不同的人拍的 同一批素材混出多版时,差异模式负责结构变化,真人感写法负责"每条都像另一个博主"。
NOVAI 新星数科 · AI视频智能生产平台 | 🔗 联系我们 官网:https://xinxingshuke.com 商务合作:xinghezhiyun@163.com 关注公众号,获取更多 AI 电商前沿洞察