本指南提供了最佳实践,可帮助您生成高质量的 Gemini Omni 和 Veo 视频。
如需详细了解如何编写有效的提示,请参阅视频生成 提示指南。
使用清晰具体的提示
清晰明了的提示有助于消除歧义,从而生成更好的视频输出。
不建议:“我脑子里有个画面:主角是个男的,有点丧,环境黑漆漆的,镜头大概是从下往上拍,你懂我意思吧?”
建议:“低角度特写镜头 ,画面中是一位神情凝重的男子。场景光线昏暗,营造出忧郁的氛围”
避免使用引号
为防止模型在视频中呈现文本,请在说话人的动作后使用英文冒号 (:) 来表示说话内容,并避免使用引号 (")。
不建议:A woman says: "My name is Clara."
建议:A woman says: My name is Clara.
使用多种宽高比
使用宽高比可以提升视频在多个平台上的效果。 不同的平台针对不同的宽高比进行了优化。了解平台的宽高比对于营销和广告至关重要。
以下是关键宽高比及其主要用途:
16:9:也称为“横屏”或“宽屏”,被认为是电视、显示器、大多数视频显示器、YouTube、演示文稿和 处于横屏模式的手机的标准宽高比。16:9 的宽高比还有助于拍摄更多背景,例如风景。
9:16:也称为纵向、竖屏或旋转宽屏。9:16 对于 TikTok、Instagram Reels 和 YouTube Shorts 等移动优先平台至关重要。9:16 的宽高比还有助于拍摄具有强烈垂直方向的肖像或较高对象,例如建筑物、树或瀑布。
短视频应专注于单个场景
对于短视频,每个提示都应专注于一个时刻。尝试在一个短视频提示中串联多个不同的事件(先 A,然后 B,然后 C)通常会导致视频混乱或不完整。
不建议:“一位侦探在图书馆里找到一条 线索,然后晚上开车穿过城市,然后在仓库里与 嫌疑人对峙”
建议:将每个部分生成为 单独的片段:
片段 1:“特写镜头,一位侦探戴着手套的手在黑暗的图书馆里拂去一本 旧书上的灰尘,露出了一个隐藏的符号”
片段 2:“一辆汽车在霓虹灯闪烁的城市中夜间行驶,雨水 划过挡风玻璃,风格为黑色电影”
片段 3:“在阴暗的仓库里,一位侦探站在一个 轮廓分明的人影对面,营造出紧张的气氛”
使用 Gemini Omni 优化工作流
Gemini Omni 可以成为您整个视频创作过程(从构思到评估)中的强大合作伙伴。
视频创作前:将 Gemini Omni 用作专家提示器
您可以让 Gemini Omni 充当专家提示器,而不是从头开始。让它将您的基本想法细化为详细的提示。例如,您可以向其提供以下指令:
"Act as an expert prompter for a generative AI video generation model. Look at
this image, and write a prompt that INSTRUCTION. Ensure your
prompt is comprehensive and detailed."
将 INSTRUCTION 替换为向模型提供的更多说明。
视频创作后:将 Gemini Omni 用作“第二双眼睛”
视频生成后,Gemini Omni 可以评估最终输出,对照公司或品牌准则进行检查,并标记任何可能存在问题、可能需要人工审核的区域。
确保角色和声音一致
创建详细的角色设定:角色设定是 确保角色一致的基础。为确保可重复使用性和声音一致性,请为角色命名并指定特定的声音风格。然后,使用一系列不可更改的特征来完善角色设定:体型和年龄、发色和发型、面部轮廓、眼睛颜色和形状,以及任何标志性特征。您可以使用 Gemini Omni 生成对角色面部特征的详尽口头描述。
始终如一地应用角色设定:每次换新场景或动作时,都将整段 角色设定一字不落、原封不动地复制粘贴到提示词中。只需修改描述新动作或设置的部分。为了改进工作流,您还可以使用 Gemini Omni 作为场景生成器。向 Gemini Omni 提供最终的角色设定,并让它为您生成多个场景提示。
使用相同的种子参数:为确保多个场景中的视觉效果、风格和 声音输出一致,请使用相同的种子参数。
示例:以下视频是使用相同的seed参数和以下提示生成的。在以下每个提示中,重复的角色和声音描述都以粗体显示:
场景 1 的提示:
"A medium shot, with the camera slowly dollying forward in a dimly lit, grand
Parisian archive. Dust motes dance in a single beam of light from a high window.
Clara, a historian in her early 30s, with observant, dark brown
eyes that hold a quiet intensity. She has chin-length, black hair styled in a
classic bob. She is dressed in a sophisticated, dark navy-blue
wool coat, with a silk scarf patterned with subtle gold and cream designs tied
around her neck. She stands before a large, ancient wooden table, carefully
turning the fragile, yellowed page of a massive, leather-bound book. Her
expression is one of deep concentration. In a voice that is crisp
and clear, with a thoughtful, analytical tone and a standard American
accent, Clara says: It has to be here"
场景 2 的提示:
"A wide shot of the Pont des Arts in Paris at twilight, the sky a mix of deep
blue and soft orange. The lights of the city are beginning to twinkle on along
the Seine. Clara, a historian in her early 30s, with observant,
dark brown eyes that hold a quiet intensity. She has chin-length, black hair
styled in a classic bob. She is dressed in a sophisticated, dark
navy-blue wool coat, with a silk scarf patterned with subtle gold and cream
designs tied around her neck. She leans against the railing, looking out at the
water, a small, triumphant smile on her face. She pulls a folded, old map from
her coat pocket and looks down at it. In a voice that is crisp and
clear, with a thoughtful, analytical tone and a standard American
accent, Clara says: I knew it. The path starts from here"
场景 3 的提示:
"An eye-level shot in a small, hidden Parisian courtyard, overgrown with ivy and
lit by a single, warm gas lamp. Clara, a historian in her early
30s, with observant, dark brown eyes that hold a quiet intensity. She has
chin-length, black hair styled in a classic bob. She is dressed
in a sophisticated, dark navy-blue wool coat, with a silk scarf patterned with
subtle gold and cream designs tied around her neck. She kneels down and runs her
fingers over an ancient, carved symbol on a stone paver, almost completely
obscured by moss. Her eyes light up with discovery. In a voice
that is crisp and clear, with a thoughtful, analytical tone and a standard
American accent, Clara says: After all these years, I've found
it"
图片转视频
以下部分介绍了使用图片转视频功能时需要注意的重要最佳实践。
使用高画质的来源图片
使用图片转视频功能时,来源图片的质量非常重要。Gemini Omni 和 Veo 会以来源图片为基础,生成后续所有内容,包括角色细节、光照和整体艺术风格。
清晰锐利、构图精美的照片可以生成更连贯、更高质量的视频。您可以将来源图片视为影片的第一帧:开头越精彩,结尾就越完美。
仅提示动态效果
来源图片中已经设定了正文、场景和风格,因此,提示应专注于您想要看到的动态效果。
**不建议**:重新描述图片中描绘的 角色、背景或光照。冗余的提示会使模型感到困惑,并导致效果不佳。
建议:提示镜头 移动、正文动画和环境变化。
对来源图片中的角色使用通用术语
在动态效果提示中,请使用“正文”“女子”“他”“她”或“他们”等通用术语来指代角色。
指导镜头的移动
您可以单独或组合指导三种类型的移动。
镜头移动:镜头移动,但场景是静态的。这是添加动态效果的最简单、最可靠的方法。
- 示例:“镜头缓慢推近正文。”
主体动画:主要角色或对象移动。最适合细腻传神的动作。
- 示例:“角色的头发和衣服在风中轻轻飘动。”
环境动画:背景或氛围变得生动起来。
- 示例:“雾气缓缓地在风景中弥漫开来。”
示例:以下视频和提示展示了如何使用 以下图片来制作正文动画:

"A sweeping drone-like aerial view starting from ground level and rising to
reveal the entire landscape in epic proportions"
最佳做法摘要
下表总结了本文档中建议的最佳做法。
| 主题 | 任务 |
|---|---|
| 提示 | |
| 视频生成 | |
| 图片转视频 |