AB
AiBoss
project

Seedance 1.0 - ByteDanceが発表した動画生成モデル

Seedance 1.0は、ByteDanceのSeedチームが開発した基本的な動画生成モデルです。このモデルはテキストと画像の入力をサポートし、シームレスなマルチカメラ切り替えによる1080pの高画質動画を生成でき、ネイティブのマルチカメラストーリーテリング機能を備え、さらに…

Seedance 1.0とは何ですか?

Seedance 1.0は、ByteDanceのSeedチームが開発した基盤となる動画生成モデルです。テキストと画像入力に対応し、シームレスなマルチカメラ切り替えで1080pの高画質動画を生成できます。ネイティブなマルチカメラによるストーリーテリング機能を備え、被写体の動きを安定させ、自然な映像でロングショット、ミディアムショット、クローズアップショットを切り替えることができます。Seedance 1.0は、写実的、アニメーション、映画など、様々なクリエイティブスタイルに対応し、高速な生成速度と低コストを実現しています。第三者ベンチマークであるArtificial Analysisでは、テキストベースと画像ベースの両方の動画生成タスクで1位を獲得し、動画生成分野におけるその強力な性能と優位性を証明しました。

Seedance 1.0の主な機能

  • マルチカメラによるストーリーテリング能力複数の連続ショットを含む物語性のある動画の生成をサポートし、ロングショット、ミディアムショット、クローズアップショットを切り替えることで、中心となる被写体、ビジュアルスタイル、全体的な雰囲気の一貫性を高く保つことができます。
  • 滑らかで安定した動作性能このモデルは、大きな動きのある動画を生成することができ、微妙な表情からダイナミックなシーンまで、高いレベルの安定性と物理的なリアリズムを維持します。
  • 複数のスタイルでの制作写実的なものからアニメーション、映画やテレビ、広告まで、様々なスタイルのビデオ生成に対応しています。
  • 正確な意味理解と指示への準拠このモデルは、複雑な自然言語コマンドを正確に解析し、複数対象間の相互作用や複数の動作の組み合わせを安定的に制御し、幅広いカメラ動作オプションをサポートすることができます。
  • 高速推論と低コストSeedance 1.0は、モデル構造の最適化と推論の高速化により、短時間での動画作成をサポートします。5秒間の1080p解像度動画生成タスクにおいて、測定された推論時間はわずか41.4秒(NVIDIA L20テストに基づく)であり、他の類似モデルと比較して大幅に短縮されています。

Seedance 1.0の技術的原理

  • マルチソースデータ処理と精密記述モデル多段階のスクリーニングとバランス調整に基づき、さまざまなテーマ、シーン、スタイル、カメラワークを網羅した大規模かつ多様なビデオデータセットが構築されました。動的特徴と静的特徴を融合した高密度記述モデルが訓練され、訓練データとして使用され、正確なビデオキャプションの生成に用いられました。このモデルは、ビデオ内の動作変化とカメラワークに焦点を当て、フレーム内の主要要素の特性と特徴、およびシーン情報を強調します。
  • 非常に効率的な事前学習フレームワーク本プロジェクトでは、空間層と時間層を分離した拡散トランスフォーマーモデルを構築します。空間層は単一フレーム内でアテンション集約を行い、時間層はフレームをまたいだアテンション計算に注力することで、学習と推論の効率を向上させます。視覚トークンとテキストトークンのインターリーブシーケンスをサポートし、マルチカメラビデオでの学習に対応し、モデルのマルチカメラ生成機能とマルチモーダル理解を強化します。生成制御条件に従うべきフレームを示すバイナリマスクに基づいて、テキストから画像、テキストからビデオ、画像からビデオなどのタスクのための統一フレームワークを実現します。
  • トレーニング後の最適化と複合報酬システム微調整段階では、生成される動画の美観と動きのダイナミクスを向上させるため、高品質のビデオテキストを用いてデータセットを学習させます。基本報酬モデル、動き報酬モデル、美観報酬モデルを含む複合報酬システムを構築します。この多次元報酬モデルに基づき、テキストと画像の整合、動きの品質、視覚的な魅力といったモデルのパフォーマンスを向上させます。複数の報酬モデルの報酬値を最大化し、RLHF(Reinforcement Learning from Human Feedback)アルゴリズムと組み合わせることで、テキスト生成動画と画像生成動画のタスクにおけるモデルの全体的なパフォーマンスを向上させます。
  • 究極の推論加速セグメント化された軌跡の一貫性、スコアマッチング、および人間の好みに基づいて誘導される敵対的蒸留メカニズムにより、極めて少ない推論ステップで生成品質と速度の優れた相乗効果が実現されます。チャネル構造を改良した軽量VAEデコーダにより、ビデオ生成時の知覚品質ロスレスが2倍に向上します。融合演算子の最適化、異種量子化スパース性戦略、適応型ハイブリッド並列処理、非同期オフロード、VAE並列分解などのシステムレベルの変更により、長尺シーケンスビデオ生成のための効率的な推論パスが構築され、エンドツーエンドのスループットとメモリ効率の優れた相乗効果が実現されます。

Seedance 1.0のパフォーマンス

  • 第三者評価プラットフォームであるArtificial Analysisにおいて、Seedance 1.0はテキストからビデオへの変換(T2V)タスクと画像からビデオへの変換(I2V)タスクの両方で1位を獲得した。
  • 社内ベンチマークテストにおいて、Seedance 1.0は、業界の他のモデルと比較して、指示への準拠性、モーション品質、美的パフォーマンスなど、複数の主要な指標で優れた性能を発揮しました。T2Vタスクでは、指示への準拠性、モーション品質、美的パフォーマンスなどの指標で高いスコアを獲得しました。

Seedance 1.0の公式サンプル

  • ネイティブなマルチカメラによるストーリーテリング機能
    • Promptピアノを弾く少女、複数のカメラアングル、映画のようなクオリティ(I2V)。
  • 強化されたモーション生成効果
    • Promptスキーヤーはスキーをしながら、ターンするたびに大量の雪を巻き上げ、徐々に加速して斜面を下っていく。カメラは滑らかに動く。
  • サポート高い美的魅力複数のスタイルでの制作

Seedance 1.0プロジェクトのアドレス

Seedance 1.0の応用シナリオ

  • 映画およびテレビ制作複数のカメラカットを用いた物語性のある動画を生成し、複雑な物語構造をサポートし、動画の物語性や視覚効果を高めます。
  • 広告とマーケティング高品質な広告動画を迅速に生成でき、多様なスタイルやシナリオに対応することで、様々なブランドや製品の広告ニーズを満たすことができます。
  • ゲーム開発ゲーム内にカットシーンやダイナミックシーンを生成し、物語性や没入感を高める。
  • 教育と訓練学生や従業員が知識をより深く理解し、習得できるよう、教育ビデオや研修資料を作成する。
  • ニュースとメディアニュース報道やドキュメンタリー向けに、視覚的な魅力を高める動的なコンテンツを生成しましょう。