AB
AiBoss
project

HOMIE - 香港科技大学が開発したオープンソースのデジタルヒューマン動画生成フレームワーク

HOMIEは、香港科技大学が開発したオープンソースのデジタルヒューマン動画生成フレームワークです。Wan2.1-T2V-14Bバックボーンネットワークをベースとし、Qwen3-VLマルチモーダル大規模モデルを統合しています。このフレームワークは、デジタルヒューマン、製品、ロゴ、テキストの4つの要素を統一的に処理できます。

HOMIEとは何ですか?

HOMIEは、香港科技大学が開発したオープンソースのデジタルヒューマン動画生成フレームワークです。Wan2.1-T2V-14Bバックボーンネットワークをベースとし、Qwen3-VLマルチモーダル大規模モデルを統合することで、デジタルヒューマン、製品、ロゴ、テキストの4つの要素を統一的に処理できます。人間とオブジェクトのインタラクション、ブランドラベル付け、OCRテキストの忠実度、マルチビューの一貫性という4つの主要な課題を正確に解決します。モデルのトレーニングにはわずか5.5Kステップ/約10,000 A100時間しかかからず、OCR精度は最も強力なオープンソースモデルよりも38.7%高くなっています。480Pシングルカードから720Pマルチカードまでの推論をサポートし、eコマース、バーチャルアンカーなどのシナリオにおける動画制作の参入障壁を大幅に低減します。

HOMIEの主な機能

  • パーソナライズされた人間と物体のインタラクティブビデオ同一映像内に複数の人物や物体が同時に映り込むことに対応し、各被写体の外見の一貫性を維持しながら、自然で合理的なインタラクティブな動作(商品の保持、展示、受け渡しなど)を実現します。
  • ロゴ/抽象的なコンセプトを的確に適用マルチモーダル大規模モデル(MLLM)のセマンティック推論機能を使用することで、ブランドロゴなどの抽象的な概念は、プロンプト内で位置関係を明示的に記述することなく、最も意味的に関連性の高いオブジェクトに自動的に関連付けられます。
  • OCRによる高精度テキスト生成OCR参照画像と組み合わせることで、製品パッケージやラベルのテキストが生成されたビデオ内で鮮明で読みやすく、ぼやけていないことを保証し、AIビデオ生成における「テキストがぼやけてぐちゃぐちゃになる」という問題点を解決します。
  • マルチビュー一貫性生成同一物体の複数視点からの参照画像があれば、映像内で物体が回転したり移動したりしても、一貫した外観とディテールを維持できます。フィギュア、3Dモデル、人形などの展示シーンに適しています。

HOMIEの技術原則

  • 全体的なアーキテクチャ: Alibaba Wan2.1-T2V-14Bは、DiTを基盤とし、視覚理解モジュールとしてQwen3-VL-2B-Thinkingを導入しています。UmT5テキストエンコーダーおよびVAEビジュアルエンコーダーと組み合わせることで、「テキスト+マルチモーダルセマンティクス+ビジョン」の3方向並列生成アーキテクチャを構築します。
  • MLLM統合戦略: 元のテキストベースのビデオアライメント関係を損なったり、高額な再アライメント費用を発生させたりすることなく、マルチモーダル大規模モデルの意味推論機能をDiTに組み込むことで、モデルが参照画像間の潜在的な関係を自動的に理解できるようになります。
  • グローバルマルチモーダル自己注意誘導(GMG): DiTの自己注意層では、MLLMによって抽出された意味特徴がVAEの視覚トークンとグローバルに整合されます。射影、プーリング、アフィン変換を通して、生成プロセスにおける各ビデオトークンは、参照グラフのグローバルな意味情報を「見る」ことができます。
  • 様相参照埋め込み(MRE): モーダル埋め込みは、それぞれMLLM特徴トークンとVAE視覚トークンに割り当てられ、独立した参照埋め込みは異なる参照画像に割り当てられ、同じ被写体のマルチビュー/OCR参照画像トークンは、情報の混乱を避けるために相互にリンクされます。
  • 3段階の段階的トレーニング: 単一被験者の480Pから複数被験者の480P、そして高解像度の720Pへと進むトレーニングプロセスは、わずか5,500ステップで完了し、同様の手法で必要とされる数万ステップよりもはるかに少ないステップ数で済んだ。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

HOMIEの使い方

  • 環境準備GitHubからHOMIEのコードリポジトリをローカルマシンにクローンし、必要な環境依存関係をインストールしてください。
  • 重量ダウンロードHuggingFaceが公開している事前学習済み重みを、指定されたモデルディレクトリにダウンロードしてください。
  • 材料の準備人物写真、製品画像、ロゴ画像、OCRテキスト画像など、複数の主要素材を含む参考画像を準備してください。
  • プロンプトワードライティング対象となる動画に登場する人物や物体間の相互作用や場面を正確に描写するテキストプロンプトを作成してください。
  • 推論を実行中推論スクリプトを実行することで、HOMIEはマルチモーダルな参照情報を自動的に融合し、パーソナライズされた動画を生成します。
  • 解像度の選択単一のGPUでは832×480ピクセルの解像度のビデオを直接生成できますが、FSDPを搭載した複数のGPUを使用すれば、720Pの高解像度出力まで拡張できます。

HOMIEの主な利点

  • 統一フレームワーク単一のフレームワークが、人間と物体のインタラクション、ロゴのラベル付け、OCRテキストの精度、マルチビューの一貫性という4つの主要なタスクを同時に処理するため、さまざまなシナリオに応じて異なるモデルを切り替える必要がなくなります。
  • 高効率トレーニングトレーニングはわずか5,500歩/約10,000A100時間で完了でき、同様の方法で通常必要とされる30,000~40,000歩よりもはるかに低いコストで済みます。
  • MLLMロスレス積分マルチモーダル大規模モデルの意味論的推論機能を、テキストエンコーダーの制御性を損なったり、高額な再調整コストを発生させたりすることなく、ビデオ生成パイプラインに組み込む。
  • 品質をリードするOCRの精度は38.7%向上し、複数ビューの一貫性は8.2%向上しました。また、40人のユーザーを対象とした調査では、64.7%が総合的な品質において最高だと評価しました。
  • 柔軟な推論480Pシングルカードから720Pマルチカードまでの推論をサポートし、1280×720の縦画面ビデオを出力できるため、ライブストリーミングeコマースやショートビデオ制作に直接対応できます。

HOMIEのプロジェクトアドレス

  • プロジェクト公式サイト:https://yiyangcai.github.io/homie-page.github.io
  • GitHubリポジトリ:https://github.com/YIYANGCAI/HOMIE
  • ハギングフェイスモデルライブラリ:https://huggingface.co/yychai/homie-r2v-wan2.1
  • arXiv技術論文:https://arxiv.org/pdf/2607.18217

HOMIEの類似製品の比較

比較対象寸法 HOMIE SkyReels-V3
出版社 香港科技大学 崑崙技術
バックボーンネットワーク Wan2.1-T2V-14B 自社開発のビデオモデル
MLLM統合 Qwen3-VL-2B,保存テキストエンコーダー非破壊注入 MLLMを統合するが、テキストエンコーダーを置き換える
OCRの精度 0.452(オープンソースが最高だ) 0.326
マルチビュー一貫性(DINOrec) 0.685 0.654
顔シミュレーション(被験者の一貫性) 0.786 0.751
ロゴの詳細が本物であることを保証します ロゴの細部まで忠実に再現できます ロゴの位置は正しいが、細部がぼやけやすい。
研修費用 5,500歩 / 約10,000時間 詳細は明らかにされていないが、HOMIEよりもはるかに高いと推測されている。
オープンソースライセンス Apache 2.0(商用利用可能) オープンソースで商用利用可能

HOMIEのアプリケーションシナリオ

  • Eコマースのライブストリーミング販売指定された製品を持ち、特定の動作を行うデジタルヒューマンが登場するプロモーションビデオを生成します。1280×720の縦型画面出力に対応し、ショートビデオプラットフォームに直接適応します。
  • ブランド広告制作プロンプトで位置関係を明示的に指定する必要なく、意味的に関連性の高い製品にブランドロゴを自動的に添付します。
  • バーチャルアンカー/デジタルヒューマン多様な製品と自然にやり取りしながら、一貫したデジタルアイデンティティを維持する。
  • 製品の多視点表示フィギュア、3Dモデル、または人形の複数視点からの参照画像が与えられた場合、あらゆる角度から見て一貫した外観を維持する回転表示ビデオを生成する。
  • パッケージのテキストの真正性を保証しますOCR参照画像と併用することで、製品パッケージやラベルのテキストが動画内で明確に読み取れるようにします。食品、化粧品、健康製品など、成分や使用方法を表示する必要があるシナリオに適しています。