乐于分享
好东西不私藏

AI视频创作最新新闻|Google Omni 模型实用ai工作流分享不同模型对比

AI视频创作最新新闻|Google Omni 模型实用ai工作流分享不同模型对比

https://www.youtube.com/watch?v=l8_0cyTaPY4

一、详细总结

本期《AI Film News》主要围绕以下几大主题展开:

  1. Google 疑似新模型泄露传闻 Google 将在 I/O 大会上发布一款名为 Gemini Omni 的视频模型。它支持上传视频、图像、音频,并在对话式界面中生成内容,不同于传统的“首帧+提示词”模式。泄露视频显示一位教授在黑板上写字,效果有亮点(如连贯动作),但也有明显问题(如一笔画出一个 X)。作者将其与 Seed Dance 2.0 对比,认为 Google Omni 略胜一筹,但并非完美。

  2. Krea 2 图像模型 vs GPT-2 vs Nano Banana 2Krea 推出新平台 Krea 2,主打 Mood Board(情绪板) 风格控制。作者测试了“废弃商场”“1950年代跳舞人群”“银翼杀手风格”等提示词。结果显示:

    • GPT-2
       在真实感和细节上表现最好。
    • Nano Banana 2
       风格偏“塑料感”,且频繁生成已知演员(如瑞恩·高斯林),不适合原创项目。
    • Krea 2
       生成速度快,但细节处理不佳(如手指变形、人物表情呆滞)。
  3. 实用 AI 工作流分享

    • 故事板 → Seed Dance 2.0
      :通过上传分镜图并定义时间区间(0-3秒、3-6秒等),可快速生成动态预览(previs)。
    • 情绪控制提示词
      :引入心理学概念 valance(愉悦度) 和 arousal(唤醒度) 来调节角色情感。测试后发现,自然语言提示 效果与该方法相当甚至更好,建议优先使用自然语言。
    • 视频连续生成
      :利用 Omni 模型将上一段视频的最后一帧作为下一段的起始帧,再通过 Seed Stitch 工具自动消除曝光、色彩跳变,实现平滑拼接。
  4. AI 代理(Agentic Workflow)挑战Runway 和 Dradia 都推出了 AI 代理功能。作者认为目前大多数 AI 代理反而增加操作负担,因此发起挑战:第一个在评论区提供真正省时省钱的 AI 代理用例的用户,将获得 100 美元

  5. 行业动态与活动

    • 作者所在团队 Promise 将出席戛纳电影节(5月14-15日),Dave Clark 将与达伦·阿伦诺夫斯基同台。
    • Distinguished Network of Artists(DNA)
       申请截止日期为 5月20日,面向 Curious Refuge 社区成员。
    • 多个线下活动:洛杉矶(5月27-28日)、丹佛(6月6日)、旧金山(6月第一周)。
  6. 本周推荐 AI 影片

    • 《Pigeons》:3D 动画,幽默可爱,鸽子有纽约口音。
    • 《Chapter 3》:情感表达强烈,运动迁移技术出色。

二、重点提取

类别
重点内容
Google Omni
预计5月19日发布(Poly Market 预测概率92%);支持多模态输入;目前泄露版有逻辑瑕疵。
Krea 2
核心卖点是 Mood Board;速度快但细节差;不适合需要高真实感的项目。
GPT-2
目前最佳图像生成工具,真实感强,但近期出现轻微伪影。
Nano Banana 2
风格化明显,易生成已知演员,不适合原创IP。
Seed Stitch
可自动对齐两段 AI 生成视频的曝光/色彩,解决拼接跳变问题。
情绪控制
Valance(愉悦度)+ Arousal(唤醒度)可调角色情绪,但自然语言更实用。
AI 代理
目前大多不实用,作者悬赏100美元寻找真实有效用例。
DNA 申请截止
5月20日,仅限 Curious Refuge 会员/学生。

三、细节提取

1. Google Omni 模型

  • 泄露视频内容
    :教授在黑板上写字,画出 X 只用一笔。
  • 对比 Seed Dance 2.0
    :Omni 在理解复杂动作(如书写公式)上更好。
  • 发布时间预测
    :Poly Market 显示 5月19日 发布概率 92%。

2. Krea 2 测试细节

  • 提示词1
    “an eerie mall” → 背景像“matte painting”,不够真实。
  • 提示词2
    “cinematic wide shot of people dancing in the 1950s” → 面部细节混乱。
  • Mood Board 测试
    :上传《银翼杀手》风格参考 → 颜色分级正确,但人物“无灵魂”,手指变形。
  • 结论
    :不如 MidJourney 适合生成电影感风格参考图。

3. GPT-2 与 Nano Banana 2 对比

  • GPT-2
    :细节丰富(背景人物也很清晰),但偶尔出现奇怪伪影。
  • Nano Banana 2
    :高对比度、塑料感、文字过于完美(像字体贴上去)。多次生成瑞恩·高斯林、艾米·亚当斯等演员面孔,不适合原创项目。

4. 故事板工作流(Previs)

  • 工具
    :Drainia 平台(CapCut + Seed Dance 2.0 集成)。
  • 步骤
    1. 上传包含多格分镜图的图片。
    2. 提示词中定义时间区间:from 0 to 3 seconds: shot A, from 3 to 6 seconds: shot B...
    3. 生成动态视频预览。
  • 效果
    :逻辑偶有断裂,但作为 previs 工具极具价值。

5. 情绪控制提示词(Valance & Arousal)

  • 高 Valance = 愉悦
    ,低 Valance = 不悦高 Arousal = 激动/紧张,低 Arousal = 平静/无聊
  • 测试用例
    :角色说 “I’ve been waiting for this for a long time.”
  • 结果
    :方法有效,但自然语言提示(如“声音颤抖、情绪沉重”)效果相近甚至更好。推荐默认使用自然语言 + 迭代调整。

6. 视频拼接与 Seed Stitch

  • 问题
    :两段连续生成的视频在拼接点会出现曝光/色彩跳变。
  • 旧方法
    :After Effects、Crossfade、DaVinci Resolve 插件。
  • Seed Stitch
    • 上传两段视频 → 自动分析 → 输出平滑过渡。
    • 示例中几乎看不出拼接点(人物举枪→开枪连续)。

7. 行业活动与截止日期

  • 戛纳 AI 峰会
    :5月14-15日,Dave Clark 与 Darren Aronofsky 同台。
  • DNA 申请截止
    :5月20日(第一轮)。
  • AI on the Lot
    (洛杉矶):5月27-28日,优惠码 curious 享 20% off。
  • 丹佛 meetup
    :6月6日。
  • Upscale 大会
    (旧金山):6月第一周, instructor Caven 演讲。

8. 作者推荐

  • AI 影片
    • 《Pigeons》:时间机器、鸽子、纽约口音 → 幽默有效。
    • 《Chapter 3》:情感强烈,运动迁移技术优秀。
  • 学习资源
    :Curious Refuge 网站每周四 office hours、周二专家工作流分享。