视频能力指南

Gemini Omni 视频输入工作流

围绕每个参考素材需要控制的创意决定,规划文本、图片、音频和源视频输入。

场景与动作
文本
外观与构图
图片
声音与节奏
音频
运动与编辑源
视频

按输入类型探索工作流

只用语言构建完整镜头

需要模型从空白起点创造主体、场景、运动和镜头时,使用文本输入。

适合使用的输入
主体与动作
环境与光线
镜头运动
画幅与节奏

让每种输入只负责一件事

参考越多不一定越好,明确职责可以避免指令冲突。

文本定义意图

用语言说明动作、故事节点、镜头指令、排除项和最终格式。

图片定义外观

用高信息量画面固定身份、商品细节、服装、构图或视觉风格。

音频定义节奏

所选工作流支持时,用音频参考控制声音、音乐、时间或情绪节奏。

视频定义运动

用源视频表达运动、时序、编辑、续写和难以仅靠文本说明的动作。

规划多模态请求

在请求进入生成队列前先解决冲突。

先说明结果

用一句话写清最终视频需要表达的内容。

分配参考职责

说明每个文件控制什么,以及不能改变什么。

添加保留规则

明确身份、商品几何、Logo、镜头轴线或时间中必须保持稳定的部分。

先审查最短草稿

请求更大批量前,用短视频验证方向。

输入质量检查

干净的输入集合通常比更长的提示词更有价值。

使用清晰且光线良好的参考图
把源视频裁剪到相关动作
避免风格冲突的参考素材
写明每种输入的职责
只保留一个主要镜头指令
确认所有上传素材的使用权

Gemini Omni 视频常见问题

应该先使用哪种输入?

自由探索用文本,强调视觉一致性用图片,控制声音或节奏用音频,已有运动或时序时用源视频。

应该组合所有可用输入吗?

不应该。只有当某种输入控制明确部分时才添加,过多参考可能产生冲突。

如何提高角色一致性?

使用清晰身份参考,避免冲突的人脸或服装,写明不得改变的部分,并且每次只调整一个视觉变量。

可以移除 AI 来源标记吗?

本站不提供 SynthID、C2PA 或水印移除工作流。请在生成媒体中保留适用的披露和来源信息。