生成视频的最佳实践

本指南提供了最佳实践,可帮助您生成高质量的 Gemini Omni 和 Veo 视频。

如需详细了解如何编写有效的提示,请参阅视频生成 提示指南

使用清晰具体的提示

清晰明了的提示有助于消除歧义,从而生成更好的视频输出。

  • 不建议:“我脑子里有个画面:主角是个男的,有点丧,环境黑漆漆的,镜头大概是从下往上拍,你懂我意思吧?”

  • 建议:“低角度特写镜头 ,画面中是一位神情凝重的男子。场景光线昏暗,营造出忧郁的氛围”

避免使用引号

为防止模型在视频中呈现文本,请在说话人的动作后使用英文冒号 (:) 来表示说话内容,并避免使用引号 (")。

  • 不建议:A woman says: "My name is Clara."

  • 建议:A woman says: My name is Clara.

使用多种宽高比

使用宽高比可以提升视频在多个平台上的效果。 不同的平台针对不同的宽高比进行了优化。了解平台的宽高比对于营销和广告至关重要。

以下是关键宽高比及其主要用途:

  • 16:9:也称为“横屏”或“宽屏”,被认为是电视、显示器、大多数视频显示器、YouTube、演示文稿和 处于横屏模式的手机的标准宽高比。16:9 的宽高比还有助于拍摄更多背景,例如风景。

  • 9:16:也称为纵向、竖屏或旋转宽屏。9:16 对于 TikTok、Instagram Reels 和 YouTube Shorts 等移动优先平台至关重要。9:16 的宽高比还有助于拍摄具有强烈垂直方向的肖像或较高对象,例如建筑物、树或瀑布。

短视频应专注于单个场景

对于短视频,每个提示都应专注于一个时刻。尝试在一个短视频提示中串联多个不同的事件(先 A,然后 B,然后 C)通常会导致视频混乱或不完整。

  • 不建议:“一位侦探在图书馆里找到一条 线索,然后晚上开车穿过城市,然后在仓库里与 嫌疑人对峙”

  • 建议:将每个部分生成为 单独的片段:

    • 片段 1:“特写镜头,一位侦探戴着手套的手在黑暗的图书馆里拂去一本 旧书上的灰尘,露出了一个隐藏的符号”

    • 片段 2:“一辆汽车在霓虹灯闪烁的城市中夜间行驶,雨水 划过挡风玻璃,风格为黑色电影”

    • 片段 3:“在阴暗的仓库里,一位侦探站在一个 轮廓分明的人影对面,营造出紧张的气氛”

使用 Gemini Omni 优化工作流

Gemini Omni 可以成为您整个视频创作过程(从构思到评估)中的强大合作伙伴。

视频创作前:将 Gemini Omni 用作专家提示器

您可以让 Gemini Omni 充当专家提示器,而不是从头开始。让它将您的基本想法细化为详细的提示。例如,您可以向其提供以下指令:

"Act as an expert prompter for a generative AI video generation model. Look at
this image, and write a prompt that INSTRUCTION. Ensure your
prompt is comprehensive and detailed."

INSTRUCTION 替换为向模型提供的更多说明。

视频创作后:将 Gemini Omni 用作“第二双眼睛”

视频生成后,Gemini Omni 可以评估最终输出,对照公司或品牌准则进行检查,并标记任何可能存在问题、可能需要人工审核的区域。

确保角色和声音一致

创建详细的角色设定:角色设定是 确保角色一致的基础。为确保可重复使用性和声音一致性,请为角色命名并指定特定的声音风格。然后,使用一系列不可更改的特征来完善角色设定:体型和年龄、发色和发型、面部轮廓、眼睛颜色和形状,以及任何标志性特征。您可以使用 Gemini Omni 生成对角色面部特征的详尽口头描述。

始终如一地应用角色设定:每次换新场景或动作时,都将整段 角色设定一字不落、原封不动地复制粘贴到提示词中。只需修改描述新动作或设置的部分。为了改进工作流,您还可以使用 Gemini Omni 作为场景生成器。向 Gemini Omni 提供最终的角色设定,并让它为您生成多个场景提示。

使用相同的种子参数:为确保多个场景中的视觉效果、风格和 声音输出一致,请使用相同的种子参数。

示例:以下视频是使用相同的seed参数和以下提示生成的。在以下每个提示中,重复的角色和声音描述都以粗体显示:

场景 1 的提示

"A medium shot, with the camera slowly dollying forward in a dimly lit, grand
Parisian archive. Dust motes dance in a single beam of light from a high window.
Clara, a historian in her early 30s, with observant, dark brown
eyes that hold a quiet intensity. She has chin-length, black hair styled in a
classic bob. She is dressed in a sophisticated, dark navy-blue
wool coat, with a silk scarf patterned with subtle gold and cream designs tied
around her neck. She stands before a large, ancient wooden table, carefully
turning the fragile, yellowed page of a massive, leather-bound book. Her
expression is one of deep concentration. In a voice that is crisp
and clear, with a thoughtful, analytical tone and a standard American
accent, Clara says: It has to be here"

场景 2 的提示

"A wide shot of the Pont des Arts in Paris at twilight, the sky a mix of deep
blue and soft orange. The lights of the city are beginning to twinkle on along
the Seine. Clara, a historian in her early 30s, with observant,
dark brown eyes that hold a quiet intensity. She has chin-length, black hair
styled in a classic bob. She is dressed in a sophisticated, dark
navy-blue wool coat, with a silk scarf patterned with subtle gold and cream
designs tied around her neck. She leans against the railing, looking out at the
water, a small, triumphant smile on her face. She pulls a folded, old map from
her coat pocket and looks down at it. In a voice that is crisp and
clear, with a thoughtful, analytical tone and a standard American
accent, Clara says: I knew it. The path starts from here"

场景 3 的提示

"An eye-level shot in a small, hidden Parisian courtyard, overgrown with ivy and
lit by a single, warm gas lamp. Clara, a historian in her early
30s, with observant, dark brown eyes that hold a quiet intensity. She has
chin-length, black hair styled in a classic bob. She is dressed
in a sophisticated, dark navy-blue wool coat, with a silk scarf patterned with
subtle gold and cream designs tied around her neck. She kneels down and runs her
fingers over an ancient, carved symbol on a stone paver, almost completely
obscured by moss. Her eyes light up with discovery. In a voice
that is crisp and clear, with a thoughtful, analytical tone and a standard
American accent, Clara says: After all these years, I've found
it"

图片转视频

以下部分介绍了使用图片转视频功能时需要注意的重要最佳实践。

使用高画质的来源图片

使用图片转视频功能时,来源图片的质量非常重要。Gemini Omni 和 Veo 会以来源图片为基础,生成后续所有内容,包括角色细节、光照和整体艺术风格。

清晰锐利、构图精美的照片可以生成更连贯、更高质量的视频。您可以将来源图片视为影片的第一帧:开头越精彩,结尾就越完美。

仅提示动态效果

来源图片中已经设定了正文、场景和风格,因此,提示应专注于您想要看到的动态效果。

  • **不建议**:重新描述图片中描绘的 角色、背景或光照。冗余的提示会使模型感到困惑,并导致效果不佳。

  • 建议:提示镜头 移动、正文动画和环境变化。

对来源图片中的角色使用通用术语

在动态效果提示中,请使用“正文”“女子”“他”“她”或“他们”等通用术语来指代角色。

指导镜头的移动

您可以单独或组合指导三种类型的移动。

  • 镜头移动:镜头移动,但场景是静态的。这是添加动态效果的最简单、最可靠的方法。

    • 示例:“镜头缓慢推近正文。”
  • 主体动画:主要角色或对象移动。最适合细腻传神的动作。

    • 示例:“角色的头发和衣服在风中轻轻飘动。”
  • 环境动画:背景或氛围变得生动起来。

    • 示例:“雾气缓缓地在风景中弥漫开来。”

示例:以下视频和提示展示了如何使用 以下图片来制作正文动画:

一辆旧的、有些破旧的蓝色皮卡车停在向日葵田前

"A sweeping drone-like aerial view starting from ground level and rising to
reveal the entire landscape in epic proportions"

最佳做法摘要

下表总结了本文档中建议的最佳做法。

主题 任务
提示
视频生成
图片转视频

后续步骤