AB
AiBoss
project

Diffutoon - アリババのAI搭載型動画変換フレームワーク

Diffutoonは、アリババと華東師範大学の研究者によって開発されたAIフレームワークで、動画を漫画やアニメ風に変換します。拡散モデルに基づいた編集可能な漫画調色技術により、リアルな動画をアニメ風アニメーションに変換できます。

Diffutoonとは何ですか?

アリババと華東師範大学の研究者によって開発されたDiffutoonは、動画を漫画/アニメ風に変換するAIフレームワークです。拡散モデルと編集可能な漫画着色技術に基づき、リアルな動画をアニメ風アニメーションに変換できます。この技術は、タスクを様式化、一貫性強化、構造誘導、着色に分解することで、高解像度かつ長時間の動画レンダリングを実現します。Diffutoonはコンテンツ編集機能も備えており、テキストプロンプトに基づいて動画の詳細を調整できます。動画処理中も高い視覚品質と一貫性を維持し、効率的かつ高品質なアニメーション処理を実現します。

ディフュートゥーンの特徴

  • アニメーション動画レンダリングDiffutoonは拡散モデルを用いて、リアルな動画を漫画やアニメ風の動画に変換し、視覚的に平坦で様式化された効果を実現します。この変換には、色や質感の変化だけでなく、光と影、輪郭線といった要素の芸術的な操作も含まれており、手描きアニメーションの視覚効果を模倣しています。
  • 高解像度対応Diffutoonは高解像度ビデオの処理に対応しており、最低でも1536×1536ピクセルの解像度をサポートしているため、拡大表示や高解像度表示デバイスでも鮮明さとディテールを確保でき、高品質なビデオ制作やプレゼンテーションのニーズに適しています。
  • 動画編集ユーザーはテキストプロンプトを使用してビデオコンテンツを編集でき、Diffutoonはこれらのプロンプトに基づいてビデオの特定の部分を認識して調整できます。編集機能では、服の色を変更したり、キャラクターの表情を調整したりするなど、キャラクターやシーン要素の外観や属性の変更が可能です。
  • フレーム間の一貫性Diffutoonは、独自のアルゴリズムと技術を用いることで、ビデオシーケンス内の各フレームがスタイルとコンテンツの一貫性を維持するようにし、ビデオ再生中に発生する可能性のあるちらつき、色の急激な変化、コンテンツの不整合といった問題を回避し、視聴体験を向上させます。
  • 構造保持Diffutoonは、動画のスタイル変換処理において、キャラクターの輪郭や物体のエッジなど、動画の重要な構造情報を識別して保持することで、スタイル変換後も動画の主要なコンテンツと形状が明確に識別できる状態を維持します。
  • 自動着色Diffutoonには、動画コンテンツとスタイルの要件に基づいて適切な色を自動的に選択する自動着色機能が搭載されています。自動着色は、制作効率を向上させるだけでなく、色の調和と視覚的な魅力を確保し、より美しい最終動画を実現します。

Diffutoonの公式サイトへの入り口

ディフトゥーンの技術原則

  1. 拡散モデルの応用Diffutoonは、画像合成の中核技術として拡散モデルを採用しています。データセット内の画像や動画の分布特性を学習することで、高次元の潜在空間から画像データへの変換を実現します。
  2. マルチモジュールノイズ低減Diffutoonは、ControlNetやAnimateDiffなどの技術を組み合わせたマルチモジュール型のノイズ除去モデルを構築し、ビデオにおける制御性や一貫性の問題を解決することを目指しています。
  3. 様式化、一貫性の向上、構造的な指針、および色彩Diffutoonは、漫画の着色問題を4つのサブ問題に分解し、それぞれを特定のモデルで解決します。
    • 様式化アニメ風のスタイルは、独自の安定拡散モデルを用いて実現されています。
    • 一貫性の向上UNetにAnimateDiffベースのモーションモジュールを挿入することで、ビデオフレーム間のコンテンツの一貫性を維持します。
    • 構造ガイダンスControlNetモデルを使用して、ビデオから輪郭などの構造情報を抽出し、保持します。
    • 着色別のControlNetモデルは、入力ビデオの解像度が低い場合でもビデオの品質を向上させるために、カラー化に使用されます。
  4. スライディングウィンドウ方式スライディングウィンドウ法は、各フレームの潜在的な埋め込みを反復的に更新するために使用され、これにより長いビデオを処理し、フレーム間の一貫性を維持するのに役立ちます。
  5. ブランチを編集Diffutoonには、主要なアニメーション着色パイプラインに加えて、テキストプロンプトに基づいて編集信号を生成し、それをカラービデオとしてメインパイプラインに提供する編集ブランチも含まれています。
  6. 効率的な注意メカニズムFlash Attentionを導入することで、GPUメモリの使用量を削減し、高解像度ビデオの処理効率を向上させます。
  7. 分類器不要のガイダンステキストプロンプトを通して視覚品質を最適化するために、分類器誘導メカニズムを使用する。
  8. DDIMスケジューラDDIM(Denoising Diffusion Implicit Models)スケジューラは、ビデオ生成プロセスを制御し、生成品質と速度のバランスを取るために使用されます。
  9. 後処理方法FastBlendなどの後処理技術を用いることで、動画の長期的な一貫性と視覚効果をさらに向上させることができます。