project
SoulX-LiveAct - Soul Appのオープンソースリアルタイムデジタル人間生成フレームワーク
SoulX-LiveActは、Soul App AIチームが開発したオープンソースのリアルタイムデジタル人間生成フレームワークで、ストリーミングAR拡散モデルの安定性の課題を解決します。主なイノベーションには、隣接するフレーム間の拡散ステップを整列させるネイバーフォーシング技術などがあります。
SoulX-LiveActとは何ですか?
SoulX-LiveActは、Soul App AIチームが開発したオープンソースのリアルタイムデジタルヒューマン生成フレームワークで、ストリーミングAR拡散モデルの安定性に関する課題を解決します。コアとなるイノベーションには、隣接するフレーム間の拡散ステップを整列させて画像の一貫性を確保するNeighbor Forcingテクノロジーと、GPUメモリ使用量を一定に保ち、数時間、あるいは無制限の期間にわたる生成をサポートするConvKV Memoryメカニズムが含まれます。わずか0.94秒のレイテンシで20 FPSのリアルタイム推論を実現するには、デュアルH100/H200 GPUのみが必要です。SoulX-LiveActは、ライブストリーミング、バーチャルカスタマーサービス、ポッドキャストなどのシナリオに適しており、オープンソースのデジタルヒューマンテクノロジー開発における新たな段階を切り開き、本番環境にも適しています。
SoulX-LiveActの主な機能
- リアルタイムポートレートアニメーション生成音声とテキストの情報に基づいて、高精細なデジタル人体動画をリアルタイムで生成し、正確な口の動きの同期、自然な表情、そして協調的な身体の動きを実現します。
- 時間制/動画の長さ無制限定常ビデオメモリ機構を用いることで、従来モデルの持続時間制限を打破し、数時間、あるいは無限の長さの連続ビデオストリームを安定的に生成することが可能になる。
- 感情や行動を自在に編集できるテキストコマンドを介して、ハートマーク、顔を覆う、笑うなどの頭の姿勢、ジェスチャー、表情を柔軟に制御できると同時に、アイデンティティの一貫性と正確なリップシンクを維持します。
- 低遅延ストリーミング推論H100/H200カードを2枚搭載するだけで、エンドツーエンドの遅延がわずか0.94秒で20FPSのリアルタイム出力を実現でき、ライブストリーミングやバーチャルカスタマーサービスといったリアルタイムのインタラクティブなシナリオのニーズを満たします。
SoulX-LiveActの技術的原理
- Neighbor Forcing従来のAR拡散モデルでは、隣接するフレームで拡散ステップ数が異なるため、分布の不整合や画像のブレが生じます。Neighbor Forcingは、隣接するフレームを同じ数の拡散ステップで生成するように強制し、前のフレームの潜在変数を現在のフレームの条件付き入力として使用することで、生成プロセスが一貫したノイズ空間で行われるようにし、ステップのアライメント問題を解消して、安定した時間的整合性を実現します。
- ConvKV Memory長尺動画におけるビデオメモリ生成のボトルネックは、フレーム数に対するKVキャッシュの線形増加に起因します。ConvKVメモリは、「短期精度+長期圧縮」戦略を採用しています。すなわち、最新フレームの高精度KVキャッシュを保持して連続性を確保し、過去のフレームを1次元畳み込み(圧縮率5:1)によって固定長メモリに圧縮し、RoPE位置エンコーディングをリセットします。
- エンドツーエンドのパフォーマンス最適化このシステムは、適応型FP8精度を採用して計算負荷を軽減し、逐次並列処理を組み合わせることでマルチGPUの計算能力を最大限に活用し、演算子融合によってメモリアクセスオーバーヘッドを削減します。これら3つのアプローチを組み合わせることで、1フレームあたりわずか27.2TFLOPSで20FPSのリアルタイム推論を実現し、同様の手法と比較して計算コストを30%~45%削減します。
SoulX-LiveActに関する重要な情報と使用要件
- プロジェクトの位置付けSoul App AI Labのオープンソースのリアルタイムインタラクティブデジタル人間生成フレームワークは、ストリーミング生成におけるAR拡散モデルの安定性と持続時間の制限を解決し、数時間、あるいは無制限の持続時間にわたるビデオ合成をサポートします。
- コアブレークスルー – 近隣強制拡散ステップが同じ隣接するフレームを揃えることで、拡散分布の不均一性によって生じる画像のブレを解消します。
- コア技術の飛躍的進歩 – ConvKVメモリ継続的なビデオメモリ使用により、時間的なボトルネックを解消。
- コアブレークスルー – リアルタイムパフォーマンス20 FPSのストリーミング推論、0.94秒の遅延。
- 実世界でのパフォーマンス – 解像度: 512×512 または 720×416。
- 実世界でのパフォーマンス – フレームレート:20 FPS。
- 実世界でのパフォーマンス – レイテンシー0.94秒。
- 実世界でのパフォーマンス – 計算コスト27.2 TFLOPS/フレーム。
- 推奨構成 – GPU: NVIDIA H100またはH200を2基搭載。
- 推奨構成 – 環境Python 3.10、CUDA対応。
- 推奨構成 – 重要な依存関係:SageAttendant(FP8アテンション)、vLLM(FP8 GEMM)、LightVAE。
- コンシューマー向けグラフィックカード – 対象モデル: RTX 4090/5090 シングルカード。
SoulX-LiveActの主な利点
- 近隣強制技術隣接するフレームを同じ拡散ステップで整列させることにより、従来のAR拡散モデルにおける分布の不均一性によって生じる画像のブレが解消され、安定した一貫性のある生成プロセスが保証されます。
- ConvKVメモリ機構このシステムは、「短期的な精度+長期的な圧縮」戦略を採用し、過去のKVキャッシュを固定長に圧縮することで、ビデオメモリの使用量を一定に保ち、期間のボトルネックを解消し、1時間ごと、あるいは無限の長さの生成をサポートします。
- リアルタイムストリーミング推論このモデルは、H100/H200カードを2枚搭載するだけで、エンドツーエンドの遅延がわずか0.94秒で20FPSのリアルタイム出力を実現でき、ライブストリーミングなどのリアルタイムインタラクティブなシナリオのニーズを満たします。
- 低コストのコンピューティング各フレームに必要な演算能力はわずか27.2TFLOPSであり、同様の手法と比較して計算コストを30%~45%削減しながら、高品質と高効率のバランスを実現している。
- 長期的な一貫性1時間にも及ぶ動画では、登場人物のアイデンティティの安定性を維持し、重要な詳細が失われないようにし、正確なリップシンクを維持することが目標であり、アイデンティティの変遷やアクセサリーの出現・消失といった問題を回避する必要がある。
SoulX-LiveActの使い方
- 環境準備condaを使用して、liveactという名前のPython 3.10環境を作成し、アクティブ化します。
- 基本的な依存関係をインストールしますrequirements.txt に記載されている依存関係を pip でインストールし、sox オーディオ処理ツールを conda でインストールしてください。
- SageAttentionをインストールするSageAttentionリポジトリをクローンし、バージョンv2.2.0に切り替えてから、setup.pyを実行してFP8アテンションアクセラレーションをインストールおよび有効化します。
- QKVオペレーターフュージョンバージョンをインストールします(オプション)。: SageAttentionFusionリポジトリをクローンしてインストールすると、オペレーターのフュージョンパフォーマンスがさらに向上します。
- vLLMをインストールするpip経由でvLLMバージョン0.11.0をインストールしてください。このバージョンはFP8 GEMM行列演算をサポートしています。
- LightVAEをインストールするLightX2Vリポジトリをクローンし、setup_vae.pyを実行してビデオコーデックコンポーネントをインストールします。
- モデルの重量をダウンロードSoulX-LiveActのモデルファイルをHugging FaceまたはModelScopeからローカルディレクトリにダウンロードしてください。
- オーディオエンコーダーをダウンロード: 中国語のwav2vec2ベースの音声特徴抽出モデルを取得します。
- デュアルカードH100/H200リアルタイム推論環境変数を設定し、torchrunを実行してデュアルカード分散推論を開始し、モデルパス、オーディオエンコーダーパス、入力JSONファイルを指定して、20 FPSストリーミングオーディオ生成を有効にします。
- 動作/顔編集をサポートする推論512×512の解像度と24FPSのフレームレートを使用し、編集指示を含むexample_edit.jsonファイルを読み込むことで、制御可能な表情生成を実現します。
- RTX 4090/5090 コンシューマーグレードのグラフィックカードはシングルカードモードでは、FP8 KVキャッシュ、メモリブロックオフロード、およびT5テキストエンコーダーCPUオフロードが有効になり、一般消費者向けグラフィックカードのメモリ使用量を削減します。
- 入力データを準備するJSON設定ファイルを編集して、参照画像パス、駆動音声パス、感情的なアクションテキストプロンプトなどの生成パラメータを指定します。
- リアルタイムストリーミング生成を開始する推論コマンドを実行すると、システムは音声入力に基づいて、口の動きと表情がリアルタイムで同期したデジタル人間のビデオストリームを出力する。
SoulX-LiveActプロジェクトの住所
- プロジェクト公式サイト:https://soul-ailab.github.io/soulx-liveact/
- GitHubリポジトリ:https://github.com/Soul-AILab/SoulX-LiveAct
- ハギングフェイスモデルライブラリ:https://huggingface.co/Soul-AILab/LiveAct
- arXiv技術論文:https://arxiv.org/pdf/2603.11746
SoulXとLiveActの競合比較
| 比較対象寸法 | InfiniteTalk | Live-Avatar | OmniAvatar | SoulX-LiveAct |
|---|---|---|---|---|
| 推論効率 | ||||
| スループット | 25 FPS | 20 FPS | – | 20 FPS |
| 遅れ | 3.20 s | 2.89 s | – | 0.94 s |
| GPUの数 | 8 | 5 | – | 2 |
| 1フレームあたりのTFLOPS | 50.2 | 39.1 | – | 27.2 |
| 長期発電能力 | ||||
| ビデオメモリ使用量 | 線形成長 | 線形成長 | 線形成長 | 絶え間ない |
| 最大持続時間 | ビデオメモリによって制限される | ビデオメモリによって制限される | ビデオメモリによって制限される | 無制限 |
| アイデンティティの一貫性 | 後期のドリフト | 徐々に漂流する | 激しいドリフト | 安定性を維持する |
| リップシンク | 終盤のミスマッチ | 徐々に不一致が進む | 深刻な不一致 | 連続精度 |
| 付属品/質感の一貫性 | 現れたり消えたりする | 詳細の喪失 | 深刻な損失 | 連続安定性 |
SoulX-LiveActの応用事例
- ライブストリーミングのシナリオこのモデルは、リアルタイムでデジタル人間アンカーを生成し、24時間365日途切れることのないライブストリーミングをサポートします。口の動きと音声は正確に同期し、表情は自然で豊かです。eコマース販売、エンターテイメントのライブストリーミング、知識共有など、さまざまなシナリオに適しています。
- バーチャルカスタマーサービスこのモデルは24時間365日のオンラインサービスを提供でき、デジタル人間のイメージは安定していて一貫性があり、長期的な対話と交流をサポートし、企業の労働コストを削減し、サービス体験を向上させます。
- ポッドキャスト/トークショー2人による会話やインタビュー番組の制作に使用され、自然な表情や身振りをリアルタイムで生成し、ゲストの画像を制御・編集できるため、高品質なコンテンツを迅速に制作できます。
- FaceTime/ビデオ通話仮想ソーシャルネットワーキング、オンライン教育、リモート会議などのB2Bシナリオで使用でき、遅延時間は最短0.94秒で、スムーズで自然なインタラクションを実現します。