project
Gemini Omni 1.1 Flash - GoogleのAI動画生成モデル
Gemini Omni 1.1 Flashは、Googleが発表したAIビデオ生成モデルで、開発者やプロのクリエイターを対象としており、360pのクイックプレビューから4Kの超高解像度まで、マルチレベルの出力に対応しています。
Gemini Omni 1.1 Flashとは何ですか?
Gemini Omni 1.1 Flashは、Googleが開発者やプロのクリエイター向けに開発したAIビデオ生成モデルです。360pのクイックプレビューから4Kの超高精細まで、複数の出力レベルに対応しています。シーンの連続性、最初と最後のフレーム指定、ビデオ参照など、きめ細かな制御機能を備えています。既存の映像を最大40秒までシームレスに延長し、最大3秒の参照クリップを導入することで、キャラクターとシーン間の一貫性を維持できます。課金モデルは秒単位で、360pの場合は約0.2元/秒、4Kの場合は約2元/秒です。
Gemini Omni 1.1フラッシュの主な機能
-
シーン展開既存の動画の最後からシームレスに続きを表示でき、各セグメントは10秒間、1セグメントあたりの最大合計長は40秒です。
-
最初と最後のフレームを指定します。開始フレームと終了フレームが与えられた場合、滑らかな遷移とカメラの動きを自動的に生成します。
-
360p クイックプレビュー生成速度は720pよりも60%速く、コストはわずか3分の1なので、迅速な反復開発に適している。
-
4K高解像度出力プロフェッショナルな制作ニーズに対応するため、1080pまたは4K解像度の直接出力に対応しています。
-
動画参照シーンの背景とキャラクター間の整合性を正確に維持するために、最大3秒間の参照動画を取り込むことができます。
Gemini Omni 1.1 フラッシュ技術の原理
- 長尺動画の理解このモデルは、分析可能な先行動画のコンテキストを1秒から10秒に拡張し、より長い時間的記憶を通してシーン内の動的な詳細と物語の論理を捉えます。また、物語の続きを書く際に、登場人物の外見、照明環境、カメラワークの一貫性を維持し、セグメント間の移行における急激な変化を回避します。
- マルチモーダル入力融合このシステムは、テキストプロンプト、静止画像、ビデオクリップという3つのモダリティを同時に処理します。テキストの意味を視覚的な指示にマッピングし、画像を用いて構図のキーフレームを定義し、参照ビデオを用いてキャラクターとシーンのスタイルを確定します。最後に、統一された潜在空間において、一貫性のある時間的コンテンツを生成します。
- 解像度適応型生成360pから4Kまでの複数の出力レベルに対応するため、同一のモデルアーキテクチャを採用しています。低解像度モードでは、潜在空間サンプリングステップ数を削減することで迅速な設計を可能にし、高解像度モードでは、アップサンプリングとディテール再構築を強化することで、クリエイターが最終製品を出力する前に低コストでアイデアを検証できるようにします。
- タイミングの一貫性を維持する外部参照動画を条件付き入力として導入することで、モデルは生成プロセス中に参照フレームの特徴埋め込みを現在の生成フレームに整合させます。さらに、直前の10秒間のコンテキストに対する自己注意計算と組み合わせることで、文字の変形や背景のずれといった時間的な不整合を抑制します。
Gemini Omni 1.1フラッシュの使い方
- アクセスを取得するGoogle AI StudioまたはGemini APIにアクセスするには、アカウントに必要な権限が付与されていることを確認してください。
- 対象モデルを選択モデルリストから選択してください
gemini-omni-1.1-flashターゲットモデルとして。 - 材料入力の準備必要に応じて入力素材を準備してください。プレーンテキストのプロンプト、開始/終了画像、参考動画(最大3秒)、または既存の動画クリップなどです。
- 生成モードを選択してください: 新しい動画を直接生成するか、既存の動画に基づいて文章を書き続ける(入力が必要)
previous_interaction_idまたは、遷移を生成する最初と最後のフレームを指定することもできます。 - 出力解像度を設定するまず、360pのクイックプレビューを使用して、クリエイティブなアイデアを確認してください。満足したら、720p、1080p、または4Kに切り替えて最終製品を出力します。
- 実行生成APIを呼び出すか、生成ボタンをクリックして、モデルが動画の結果を返すまでお待ちください。
- エクスポートとその後の編集完成したビデオファイルをダウンロードするか、Adobe FireflyやRunwayなどの統合プラットフォームで直接編集を続けることができます。
Gemini Omni 1.1 Flashの主な利点
-
4KウルトラHD出力1080pはもちろん、4K解像度の動画を直接生成することができ、プロの映画・テレビ制作基準を満たしています。
-
シームレスなシーンの継続既存の動画の最後からコンテンツを生成し、毎回10秒ずつ追加していくことで、1つのストーリーが最大40秒まで続く可能性がある。
-
最初と最後のフレームを正確に制御開始フレームと終了フレームを指定するだけで、滑らかなトランジションと複雑なカメラワークが自動的に生成されます。
-
360p ラピッドドラフトプレビューモードの生成速度は60%向上し、コストは720pのわずか3分の1に抑えられているため、試行錯誤を繰り返す際のオーバーヘッドが大幅に削減されます。
-
動画参照の一貫性最大3秒間の参照動画をインポートすることで、キャラクターの外見やシーンのスタイルを正確に固定し、ドリフトの発生を防ぐことができます。
-
10秒で文脈を理解するこのモデルは、最大10秒間の過去の映像を遡って分析することができ(従来は1秒間のみ)、物語の展開と映像の一貫性を大幅に向上させる。
-
マルチモーダルな柔軟な入力また、テキストによる指示、静止画像、ビデオクリップを統合することで、クリエイティブな指示をより表現豊かにします。
Gemini Omni 1.1 Flash のプロジェクトアドレス
- プロジェクト公式サイト:https://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/
Gemini Omni 1.1 Flashと類似の競合製品との比較
| 比較対象寸法 | Gemini Omni 1.1 Flash | ランウェイ(第3世代/第4世代シリーズ) |
|---|---|---|
| 開発者 | Google DeepMind | Runway ML |
| 最大解像度 | 4K | 1080p(通常版) |
| 累積世代時間 | 最大40秒(拡張機能のネイティブサポート) | 1回のセッションは通常10~16秒続く。 |
| シーンの続き | ネイティブサポート10秒でシームレスにスケーリング | 組み立てには外部工具が必要です。 |
| 最初と最後のフレームの制御 | ネイティブサポートスムーズなトランジションとカメラワークを自動生成します | 画像から動画への変換をサポート |
| 参考動画の一貫性 | 最大3秒登場人物と場面を正確に特定するには、動画を参照してください。 | ビデオからビデオへの変換に対応 |
| 低価格プレビュー | 360pモード処理速度は60%向上し、価格は元の価格のわずか3分の1にまで抑えられています。 | 専用の低解像度プレビューモードはありません |
| 文脈理解 | 最初の10秒間を分析することができる。映像表現は一貫している。 | 通常、参照されるのは最後のフレームのみです。 |
| 請求方法 | 秒単位で課金(0.03ドル~0.30ドル/秒) | クレジットポイントまたはサブスクリプションで |
Gemini Omni 1.1 Flashのアプリケーションシナリオ
-
映画やテレビの広告および予告編の制作4K出力とフレーム制御を活用することで、高品質な商用短編映画、ブランド広告、映画予告編を迅速に制作できます。
-
ソーシャルメディアコンテンツの作成360pの解像度を活用することで、迅速なプレビューと低コストでの反復作業が可能になり、ショートビデオ、アニメーションカバー、バイラルコンテンツの大量生産が可能になります。
-
ゲームやアニメーションのプレビュー(プレビズ)シーンの拡張や参考動画を通してキャラクターの一貫性を維持し、ストーリーボードやアクションプレビューを迅速に作成します。
-
Eコマース商品の動的表示指定された製品画像の最初と最後のフレームに基づいて、360°回転、クローズアップなどのディテールを含む動的な表示ビデオを生成します。
-
教育およびトレーニングビデオ講師やアニメーションキャラクターのイメージの一貫性を保つために動画資料を活用し、解説動画や教材アニメーションをまとめて生成する。