project
LPM 1.0 - miHoYoの蔡浩宇氏が発表したAI動画生成モデル。
LPM 1.0(Large Performance Model)は、Anuttacon(蔡浩宇AI社)が発表した17Bパラメータのビデオキャラクターパフォーマンス生成モデルで、リアルタイムの全二重音声およびビデオ対話に対応しています。
LPM 1.0とは何ですか?
LPM 1.0(Large Performance Model)は、Anuttacon(蔡浩宇AI社)が発表した17パラメータのビデオキャラクターパフォーマンス生成モデルで、リアルタイムの全二重音声・映像対話に対応しています。このモデルは、一枚の画像から、話したり、聞いたり、反応したり、微妙な微表情を見せたりできるデジタル人間を生成し、無期限に一貫したアイデンティティを維持します。LPM 1.0は、AI対話、バーチャルライブストリーミング、ゲームNPCなどのシナリオにおける汎用ビジュアルエンジンとして適しています。
LPM 1.0の主な機能
- リアルタイム全二重対話このシステムは、両者が同時に話したり聞いたりできるリアルタイムの対話に対応しています。両者はいつでも割り込むことができ、モデルは応答前の間や視線の動きなど、自然な反応を生成できます。
- 無制限の期間、一貫したアイデンティティ画像入力に基づいて、数時間に及ぶ長時間の動画においても、キャラクターの外観、歯、顔の質感、横顔の輪郭といった細部の安定性を維持し、「生成されるにつれてどんどん歪んでいく」という現象を防ぎます。
- 3つのモード制御キャラクターのパフォーマンスは、テキスト(動作や表情を制御するため)、音声(口の動きやリズムを制御するため)、および参照画像(キャラクターのアイデンティティを維持するため)の組み合わせによって制御されます。
- ゼロショット一般化リアルな人間、2Dアニメ、3Dゲームキャラクター、非人間的な生き物など、あらゆるスタイルに対応しており、特定の分野に合わせて微調整する必要はありません。
- 感情表現このモデルは、ためらい、思考、呼吸のリズムといった微妙な微表情を生成でき、歌唱時にはメロディーに合わせた口パクにも対応しています。
LPM 1.0の技術的原則
- データ構築品質を厳密にフィルタリング(保持率10%未満)することで、編集痕跡、美肌フィルター、その他の欠陥を除去します。改良されたLR-ASDモデルを使用して、各フレームの発話/聴取/待機状態をラベル付けし、音声分離を実現します。同時に、全体的な外観、マルチビューの身体、顔の表情について、多粒度識別参照条件を構築し、大規模なマルチモーダルデータセットを形成します。
- Base LPM14Bの画像から動画への事前学習済みモデルをベースに、インターリーブされた音声アテンションブロックに3Bのパラメータを追加することで、17Bの拡散トランスフォーマーを構築します。これにより、音声駆動ダイナミクス、リスニング応答、テキスト制御、およびマルチリファレンスID保持を共同で学習し、17兆を超えるマルチモーダルトークンをトレーニングすることで、高品質なキャラクターパフォーマンス生成を実現します。
- Online LPM4段階の自己回帰蒸留処理により、Base LPMは因果ストリーミングジェネレータへと変換されます。Backbone-Refinerアーキテクチャは、時系列潜在変数軌跡を保持し、高忠実度の詳細を復元することで、低遅延のリアルタイム推論と無限長のアイデンティティ一貫性生成を可能にします。
- システムアーキテクチャA2Aオーディオモデルとプラグアンドプレイで互換性があり、リスニング、スピーキング、アイドル状態の3つの状態を切り替えながら、対応するビデオストリームをリアルタイムで生成します。
LPM 1.0 の使い方
LPM 1.0は現在、学術交流のみを目的としており、一般公開はされていません。
LPM 1.0プロジェクトのアドレス
- プロジェクト公式サイト:https://large-performance-model.github.io/
- arXiv技術論文:https://arxiv.org/pdf/2604.07823
LPM 1.0の主要情報と使用要件
- 意味Anuttacon(蔡浩宇AI社)は、170億パラメータのビデオロールパフォーマンスモデル(大規模パフォーマンスモデル)を発表しました。このモデルは、一人対人の全二重音声・映像対話シナリオに特化しており、一枚の画像を、リアルタイムで話したり、聞いたり、反応したりできるデジタル人間へと変換することができます。
- 中核となる能力リアルタイム全二重対話(中断対応)、無制限のアイデンティティ一貫性(長期にわたる安定した外観/表情)、三モード制御(テキスト+音声+画像)、ゼロサンプル汎化(リアルな/アニメーション/3D/非人間的な生物に対応)、繊細な感情表現(微表情/呼吸リズム)。
- テクニカルルートベースLPM(17B拡散トランスフォーマー)は、厳密にフィルタリングされたマルチモーダルデータセットで学習され、その後、4段階のプロセスを経てオンラインLPM(因果ストリーミングアーキテクチャ)へと変換されます。リアルタイム生成は、バックボーン・リファイナー設計を用いて実現されます。
- アプリケーションシナリオ対話エージェント、仮想ライブストリーミング、ゲームNPC、AI教育チューター、ゲームコンパニオンなどのための汎用ビジュアルエンジン。
- 現在の状況:一般公開されていませんモデルの重み付けデータ、ソースコード、オンラインデモ、API、製品などは一切提供されていません。このプロジェクトページは学術交流のみを目的としています。
LPM 1.0の主な利点
- パフォーマンスにおける3つのジレンマを解決する業界初となる、高い表現力、リアルタイム推論、長期的なアイデンティティの安定性を同時に実現する動画生成モデル。従来モデルではこれらの側面のうち2つしか考慮できなかったという限界を打ち破る。
- 全二重リアルタイム通信リアルタイムでの対話に対応し、話すモードと聞くモードをシームレスに切り替えられます。両者が同時に話すことができ、いつでも割り込むことができます。応答遅延が少なく、自然な間合い、視線の動き、その他の微細な反応も再現します。
- 無制限の期間、一貫したアイデンティティストリーミングアーキテクチャにより、キャラクターの外見、歯、顔の特徴などのディテールが数時間にわたる動画でも安定して維持され、他のモデル(例えば、30秒に制限されたKling-Avatar 2.0/OmniHuman 1.5など)で時間とともに発生するアイデンティティのずれを防ぎます。
- 自然なリスニング行動このモデルは、現実的な聞き取り反応(うなずき、眉の動き、アイコンタクト)を生成することができ、「話すこと」のみに焦点を当て、「聞くこと」を無視する既存のモデルの欠点を補う。
- ゼロショット一般化このモデルは微調整を必要とせず、リアルな人間、2Dアニメ、3Dゲームキャラクター、非人間的な生物など、あらゆるスタイルに対応でき、非常に高いキャラクター適応性を備えている。
- 最先端性能初のインタラクティブキャラクター性能ベンチマークであるLPM-Benchにおいて、あらゆる項目でトップの成績を収めた。人間による評価では、720P版のKling-Avatar-2とOmniHuman-1.5の好感度はそれぞれ64.3%と42.5%だった。
LPM 1.0と類似の競合製品との比較
| 比較対象寸法 | LPM 1.0 | Kling-Avatar 2.0 | OmniHuman-1.5 |
|---|---|---|---|
| 期間制限 | 期間無制限長期的に安定したアイデンティティ | 最大30秒 | 最大30秒 |
| インタラクションモード | 全二重リアルタイム(話す/聞く/割り込むことを同時に行うことができます) | 一方通行の音声生成 | 一方通行の音声生成 |
| リスニングスキル | ネイティブサポート(リアルタイムの反応、うなずき、アイコンタクト) | サポートされていません | サポートされていません |
| アイデンティティの安定性 | 数時間にわたって一貫性を保つ | 時間の経過とともに変化する可能性がある。 | 時間の経過とともに変化する可能性がある。 |
| 手動評価 | ベンチマーク | 64.3%ユーザーはLPMを好む | 42.5%ユーザーはLPMを好む |
LPM 1.0の適用シナリオ
- 対話型AIエージェントこれにより、AIアシスタントに具体的な人間の視覚的存在感を与え、対面でのリアルなやり取りをサポートし、カスタマーサポート、バーチャルアシスタント、デジタルヒューマンなどに活用できる。
- インタラクティブなNPCとゲームキャラクター状況に応じた会話、傾聴行動、感情的に一貫性のあるボディランゲージを備えたオープンワールドNPCを作成することで、別途モーションキャプチャを必要とせずにインタラクティブなストーリーテリングが可能になります。
- ライブストリーミングとバーチャルホスティングリアルタイム仮想ストリーミングメディアは、数時間にわたるライブストリーミングや1秒未満の低遅延でも、アイデンティティの一貫性と映像品質を維持でき、24時間365日の放送をサポートします。
- 教育と個別指導AIチューターは常に視覚的な存在感を持ち、長時間の授業を通して一貫したアイデンティティを維持し、熱心な説明から集中した傾聴へとシームレスに移行する。
- ゲームコンパニオンリアルタイムAIコンパニオンは、ゲームプレイに応じて状況に応じたコメント、感情的な励まし、自然な表情で反応し、シングルプレイヤーゲームにソーシャルな交流体験をもたらします。