AB
AiBoss
project

InstantCharacter - テンセントのオープンソースプラットフォーム「Hunyuan」が提供する、カスタマイズ可能な画像生成プラグイン。

InstantCharacterは、TencentのHunyuanプラットフォームがオープンソース化した、カスタマイズ可能な画像生成プラグインです。Diffusion Transformer(DiT)フレームワークをベースに、スケーラブルなアダプタ(複数のTransformerエンコーダを含む)を導入し、数千万サンプルをサポートします。

InstantCharacterとは何ですか?

InstantCharacterは、Tencent Hunyuanがオープンソース化したカスタム画像生成プラグインです。Diffusion Transformer(DiT)フレームワークをベースに、スケーラブルなアダプタ(複数のTransformerエンコーダを含む)と数千万サンプルの大規模なキャラクターデータセットを導入することで、高忠実度でテキスト制御による、キャラクターに一貫性のある画像生成を実現しています。InstantCharacterでは、キャラクター画像と簡単なテキスト説明を入力するだけで、様々なシーンで任意のポーズのキャラクターを生成できます。InstantCharacterは、漫画や映画制作などの分野で幅広い応用が期待され、キャラクター主導型画像生成の新たな基準を打ち立てています。

InstantCharacterの主な機能

  • 役割の一貫性を維持する様々な場面やポーズにおいて、キャラクターの外見、スタイル、アイデンティティの一貫性を維持する。
  • 高忠実度画像生成高品質で高解像度、かつディテール豊かでリアルな画像を生成します。
  • 柔軟なテキスト編集機能ユーザーは、簡単なテキストによる説明に基づいて、キャラクターの行動、シーン、スタイルを制御する。
  • オープンドメインロールのカスタマイズ様々なキャラクターの外見、ポーズ、スタイルに対応しています。
  • 迅速な生成文字ごとに複雑な微調整を行う必要はありません。要件を満たす画像を迅速に生成できます。

InstantCharacterの技術原則

  • 拡散トランス (DiT) アーキテクチャDiTは、最新の拡散トランスフォーマーを基盤モデルとして、従来のU-Netアーキテクチャに比べて優れた生成能力と柔軟性を提供します。DiTのトランスフォーマーベースの構造により、複雑な画像特徴や長距離依存関係をより適切に処理できます。
  • スケーラブルアダプターTransformerベースの拡張可能なアダプタモジュールを導入することで、文字特徴とDiTの潜在空間との相互作用を容易にします。このアダプタは、複数のTransformerエンコーダを積み重ねた構成となっており、文字特徴を段階的に洗練することで、ベースモデルとのシームレスな統合を実現します。SigLIPやDINOv2などの事前学習済みビジュアルエンコーダを用いて詳細な文字特徴を抽出し、特徴の損失を回避します。
  • 大規模な文字データセット我々は、数千万のサンプルを含む大規模な文字データセットを構築した。このデータセットは、ペアデータ(複数視点の文字)と非ペアデータ(テキストと画像の組み合わせ)のサブセットに分割された。ペアデータは文字の一貫性を最適化するために使用され、非ペアデータはテキストの制御性を最適化するために使用された。
  • 3段階のトレーニング戦略
    • フェーズ1役割の一貫性を維持するために、ペアになっていない低解像度データを使用して事前学習を行う。
    • フェーズ2テキストの制御性を向上させるために、ペアになった低解像度データを使用してトレーニングを行います。
    • フェーズ3高解像度データを用いた共同学習は、画像忠実度を向上させる。

InstantCharacterプロジェクトのアドレス

InstantCharacterの応用シナリオ

  • 漫画ストリップと漫画本の制作さまざまなシーンにおけるキャラクターの動作や表情を素早く生成し、キャラクターの一貫性を維持し、手作業による作画量を削減します。
  • 映画およびアニメーション制作キャラクターのコンセプトアートやアニメーションシーンを生成し、キャラクターデザインを迅速に反復し、さまざまなプロット要件に対応します。
  • ゲームデザインゲームキャラクターの様々なポーズやシーンを生成し、複数のスタイルに対応し、ゲームのスタイルに合った画像を素早く生成します。
  • 広告とマーケティング広告コピーに基づいてテーマに合ったキャラクター画像を迅速に生成し、広告の魅力と創造性を高めます。
  • ソーシャルメディアとコンテンツ制作ユーザーはテキストの説明に基づいてパーソナライズされたキャラクター画像を生成できるため、コンテンツの楽しさとインタラクティブ性が向上します。