AB
AiBoss
project

Gemini Omni 1.1 Flash - 谷歌推出的 AI 视频生成模型

Gemini Omni 1.1 Flash 是谷歌推出的 AI 视频生成模型,面向开发者和专业创作者,支持从 360p 快速预览到 4K 超高清的多档位输出。

Gemini Omni 1.1 Flash是什么

Gemini Omni 1.1 Flash 是谷歌推出的 AI 视频生成模型,面向开发者和专业创作者,支持从 360p 快速预览到 4K 超高清的多档位输出。模型具备场景续写、首尾帧指定、视频参考等精细控制能力,可基于已有画面无缝扩展至 40 秒,通过引入最长 3 秒的参考片段保持角色与场景一致性。模型采用按秒计费模式,360p 约 0.2 元/秒,4K 约 2 元/秒。

Gemini Omni 1.1 Flash的主要功能

  • 场景扩展:基于已有视频从结尾无缝续写,每次 10 秒,单条累计最长可达 40 秒。
  • 指定首尾帧:给定起始帧与结束帧,自动生成平滑转场与镜头运动。
  • 360p 快速预览:生成速度比 720p 提升 60%,成本仅为三分之一,适合快速迭代。
  • 4K 高分辨率输出:支持直接输出 1080p 或 4K 画质,满足专业制作需求。
  • 视频参考:可引入最长 3 秒参考视频,精准保持场景背景与角色一致性。

Gemini Omni 1.1 Flash的技术原理

  • 长上下文视频理解:模型将可分析的前置视频上下文从 1 秒扩展至 10 秒,通过更长的时序记忆捕捉画面中的动态细节与叙事逻辑,在续写时维持角色外观、光影环境和摄像机运动的一致性,避免片段衔接处的跳变。
  • 多模态输入融合:系统同时处理文本提示、静态图像与视频片段三种模态,将文本语义映射为视觉指令,以图像定义关键帧构图,以参考视频锁定角色与场景风格,最终在统一的潜空间中生成连贯的时序内容。
  • 分辨率自适应生成:采用同一套模型架构支持 360p 到 4K 的多档位输出,低分辨率模式下通过减少潜空间采样步数实现快速草稿,高分辨率模式下则启用增强的上采样与细节重建,让创作者先用低成本验证创意,再输出成片。
  • 时序一致性保持:通过引入外部参考视频作为条件输入,模型在生成过程中将参考帧的特征嵌入与当前生成帧进行对齐,结合对前序 10 秒上下文的自注意力计算,抑制角色形变、背景漂移等时序不一致问题。

如何使用Gemini Omni 1.1 Flash

  • 获取访问权限:访问 Google AI Studio 或接入 Gemini API,确保账号具备调用权限。
  • 选择目标模型:在模型列表中选择 gemini-omni-1.1-flash 作为目标模型。
  • 准备输入素材:根据需求准备输入素材:纯文本提示、起始/结束图像、参考视频(最长 3 秒)或已有视频片段。
  • 选择生成模式:直接生成新视频、基于已有视频续写(需传入 previous_interaction_id)、或指定首尾帧生成过渡。
  • 设置输出分辨率:先用 360p 快速预览验证创意,满意后再切换至 720p、1080p 或 4K 输出成片。
  • 执行生成:调用 API 或点击生成按钮,等待模型返回视频结果。
  • 导出与后续编辑:下载最终视频文件,或直接在 Adobe Firefly、Runway 等已集成平台中继续编辑。

Gemini Omni 1.1 Flash的核心优势

  • 4K 超高清输出:支持直接生成 1080p 乃至 4K 分辨率视频,满足专业影视制作标准。
  • 场景无缝续写:基于已有视频从结尾继续生成,每次 10 秒步进,单条叙事最长可延伸至 40 秒。
  • 首尾帧精准控制:只需提供起始帧与结束帧,即可自动生成平滑转场与复杂镜头运动。
  • 360p 极速草稿:预览模式生成速度提升 60%,成本仅为 720p 的三分之一,大幅降低迭代试错开销。
  • 视频参考一致性:引入最长 3 秒的参考视频,即可精准锁定角色形象与场景风格,避免生成漂移。
  • 10 秒长上下文理解:模型可回溯分析多达 10 秒的前置画面(此前仅 1 秒),续写时叙事与视觉连贯性显著增强。
  • 多模态灵活输入:同时融合文本提示、静态图像与视频片段,让创意指令的表达维度更丰富。

Gemini Omni 1.1 Flash的项目地址

  • 项目官网:https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/

Gemini Omni 1.1 Flash的同类竞品对比

对比维度 Gemini Omni 1.1 Flash Runway (Gen-3/Gen-4 系列)
开发商 Google DeepMind Runway ML
最高分辨率 4K 1080p(主流版本)
累计生成时长 最长 40 秒(原生支持扩展) 单次通常 10–16 秒
场景续写 原生支持,10 秒步进无缝扩展 需借助外部工具拼接
首尾帧控制 原生支持,自动生成平滑过渡与运镜 支持 Image to Video
参考视频一致性 最长 3 秒参考视频,精准锁定角色与场景 支持 Video to Video
低成本预览 360p 模式,速度快 60%,成本低至 1/3 无专门低分辨率预览模式
上下文理解 可分析前 10 秒画面保持连贯 通常仅参考末端帧
计费方式 按秒计费($0.03–$0.30/秒) 按信用点或订阅制

Gemini Omni 1.1 Flash的应用场景

  • 影视广告与预告片制作:用 4K 输出和首尾帧控制,快速生成高质感商业短片、品牌广告与电影预告。
  • 社交媒体内容创作:借助 360p 快速预览低成本迭代,批量产出短视频、动态封面与 viral 内容。
  • 游戏与动画预演(Previz):通过场景扩展和参考视频保持角色一致性,快速生成分镜脚本与动作预览。
  • 电商产品动态展示:基于产品图指定首尾帧,生成 360° 旋转、细节特写等动态展示视频。
  • 教育与培训视频:用视频参考保持讲师或动画角色形象统一,批量生成解释性视频与课件动画。