project
LTX-2.5 - LTXは、オープンソースのAI動画生成基盤モデルです。
LTX-2.5は、LTXが開発したオープンソースのAIビデオ生成基盤モデルで、リリース時点で22個のパラメータとオープンウェイトを備えています。このモデルは、ネイティブなマルチカメラ生成、4K HDR、RAW/EXRプロフェッショナルワークフローをサポートし、音声の同時生成も可能です。
LTX-2.5とは何ですか?
LTX-2.5は、LTXが開発したオープンソースのAI動画生成基盤モデルで、リリース時点で22個のパラメータとオープンウェイトを備えています。ネイティブマルチカメラ生成、4K HDR、プロフェッショナルなRAW/EXRワークフローに対応し、音声の同時生成や高精度な動画編集機能も搭載しています。クローズドソースモデルの価格が高騰する中、LTX-2.5はオープンエコシステム戦略を通じて、AI動画分野におけるプロフェッショナルグレードのオープンソース代替ソリューションを提供します。
LTX-2.5の主な機能
- ネイティブマルチカメラ生成1回の生成で、異なるカメラアングルと視点を持つ複数の連続ショットを生成でき、ショット間のキャラクターの外見、環境の雰囲気、照明条件、サウンドにおいて高い一貫性を維持できるため、AIによるストーリー制作におけるショットの連続性という根本的な課題を解決します。
- 拡散忠実度レンダリングシーンの複雑さに基づいてレンダリング処理能力を適応的に割り当て、複雑で動的なショットにはより多くの処理リソースを配分する一方、静的または単純なシーンには自動的にリソースを節約することで、画質を維持しながら全体的な効率を向上させます。
- 精密なビデオ編集オリジナルの実写映像の動きの軌跡と空間構造を維持しながら、高精度なスタイル書き換え、シーンの再描画、キャラクターの置き換えを行うことで、「実写の骨格+AIによる様式化オーバーレイ」を制御可能に作成します。
- 自動期間予測内蔵の「Duration Head」モジュールは、プロンプト内のアクションの説明を読み取り、最適なセグメント長を自動的に決定するため、クリエイターが何度も試行錯誤する必要がなくなります。
- プロフェッショナルグレードの出力フォーマットネイティブ4K HDR、RAW、EXRロスレス出力フォーマットに対応し、プロの映画・テレビのカラーグレーディング、特殊効果合成、ポストプロダクション編集パイプラインに直接接続できます。
- 同期音声生成スタンドアロンのオーディオVAEモジュールを使用して、ビデオ同期用の対応するサウンドトラックを生成します。
- IC-LoRA高精度制御キャニーエッジ、深度、ポーズの3つの参照ビデオ制御モードを提供し、生成される結果が参照素材の構図、空間構造、またはキャラクターの動きに厳密に従うことを保証します。
LTX-2.5の技術原理
- Gemma 4 12B テキストエンコーダーLightricksがLTX向けに独自に設計した大規模言語モデルエンコーダーは、複雑で長いキューにおいても、複数の被写体の関係性、動作の詳細、照明描写、カメラの向きなどを完全に保持し、キューが長くなっても句情報が失われることはありません。
- Prompt Enhancerユーザーが入力した短いプロンプトを自動的に詳細で映画のような指示に展開する軽量補助モデル。プロンプト語の技術的なハードルを下げ、計算負荷を極めて低く抑える。
- Diffusion Video Decoder従来のVAEデコーダーに代わる新しいアーキテクチャは、動きの速いシーンに特化して最適化されており、画像のにじみやアーティファクトを大幅に低減し、顔の鮮明化とテキストの読みやすさを向上させます。
- Audio VAE独立した音声潜時空間エンコーダは、ビデオコンテンツを対応する音声表現にマッピングする役割を担い、ビデオと音声の同期生成を可能にする。
- Diffusion Fidelity Renderingこのシステムは、「構造を先に、細部を後から」という2段階のレンダリング戦略を採用しています。第1段階では、8倍の時間圧縮された潜在空間内で動き、構図、ショットのフレーミングを構築し、高精細なキーフレームを適応的に生成します。第2段階では、構造とキーフレームの両方から最終的なビデオを拡散・レンダリングし、テクスチャ、素材、顔の細部をピクセルレベルの精度で表現します。
- Duration Head拡散プロセスの前に展開される予測モジュールは、プロンプト内の動作の意味を理解することで、最適な動画の長さを自動的に推論して出力し、モデルが物語のリズムを事前に認識する能力を持つことを可能にする。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
LTX-2.5の使い方
-
パスを選択APIクラウドサービスを使用するか、ComfyUIのローカル展開を使用するかのいずれかを選択することに決定した。
-
APIアクセスLTX公式サイトでAPIキーを申請し、APIを呼び出すには「Fast」または「Pro」を選択してください。
-
インストールノードローカル環境に展開する場合は、ComfyUIを最新バージョンにアップデートし、Manager経由でインストールする必要があります。
ComfyUI-LTXVideoNodeパッケージ。 -
モデルをダウンロードComfyUIのテンプレートブラウザで「LTX-2.5」を検索し、該当するワークフローを選択して、ワンクリックですべてのモデルファイルをダウンロードしてください。
-
設定パラメータ幅と高さを32の倍数に、フレームレートを1+8の倍数に、フレームレートを24/25/48/50fpsに、基本解像度をターゲットの半分に設定して、2倍スケーリングを有効にします。
-
執筆のヒントショットの構成、シーンの照明、キャラクターの動き、カメラの動き、音声を説明するために、一貫性のある散文を使用してください。タグの積み重ねや、冗長な構文は避けてください。
-
実行生成クリックして実行してください。テキストベースの動画の場合は、最初のフレームを直接アップロードしてください。画像ベースの動画の場合は、最初と最後のフレームの両方をアップロードしてください。
-
精密制御上級ユーザーは、IC-LoRAをCannyモード、深度モード、またはポーズモードでロードし、参照ビデオに接続することで、構図の同期やモーションロックを実現できます。
-
モデル選択迅速な反復には簡略化されたモデルを使用し、より詳細な情報を得るための最終出力には完全な開発モデルを使用してください。
LTX-2.5の主な利点
- 物語の一貫性ネイティブのマルチショットマルチカメラ生成機能により、単一の出力においてキャラクターの外見、環境の雰囲気、照明条件、サウンドの一貫性を高度に維持することができ、AIによるストーリー作成におけるショットの連続性という最大の課題を根本的に解決します。
- 制御性の飛躍的向上精密なビデオ編集により、元の実写映像の動きの軌跡と空間構造が維持されます。Canny/Depth/Poseという3つのIC-LoRA制御モードと組み合わせることで、「手探りでカードを引く」ような作業から、「実写の骨格+AIによるスタイリッシュなオーバーレイ」へと、制御可能な制作変革を実現します。
- 産業グレードのワークフローネイティブRAW/HDR/EXR出力は、圧縮やトランスコーディングを行うことなく、プロフェッショナルなカラーグレーディング、特殊効果合成、ポストプロダクション編集パイプラインに直接接続できるため、映画・テレビ業界が求めるロスレス素材への厳しい要求を満たします。
- 適応効率拡散忠実度レンダリング技術は、シーンの複雑さに応じてレンダリング能力を動的に割り当てることで、複雑な動的ショットの詳細なレンダリングを可能にし、静的でシンプルなシーンではリソースを自動的に節約します。これにより、ピクセルレベルの画像品質を確保しながら、全体的な生成効率が向上します。
LTX-2.5プロジェクトの住所
- プロジェクト公式サイト:https://ltx.io/model/ltx-2-5
- ハギングフェイスモデルライブラリ:https://huggingface.co/Lightricks/LTX-2.5
LTX-2.5と類似の競合製品との比較
| 比較対象寸法 | LTX-2.5 | Minimax H3 |
|---|---|---|
| プロデューサー | ライトリックス(イスラエル) | ミニマックス(中国) |
| リリース時間 | 2026年8月 | 2026年8月 |
| オープンさ | 22Bの重み付けデータは完全にオープンソースであり、ローカル環境で展開および微調整が可能です。 | 重み付けは一部の地域(米国、英国、EU、韓国を除く)で部分的に利用可能であり、ローカルでの微調整はサポートされていません。 |
| パラメータスケール | 22B(一般向け) | 非公開 |
| 最大解像度 | 4K (3840×2160) | 2K(修理済み) |
| 最大持続時間 | 20秒 | 10秒 |
| ネイティブマルチレンズ | サポート | サポートされていません |
| 同期音声 | サポート | 開いていません |
| 入力モード | テキスト/画像/音声 | テキスト/画像 |
| 出力形式 | 4K HDR、RAW、EXRロスレス | 標準圧縮形式 |
| 制御可能性 | 高精度ビデオ編集 + IC-LoRA(Cannyエッジセンサー/深度センサー/姿勢センサー) | 主に運転の指示語に頼る |
LTX-2.5の応用シナリオ
- 映画・テレビ番組のプロフェッショナルなポストプロダクションネイティブ4K HDR、RAW、EXRロスレス出力は、カラーグレーディング、エフェクト合成、編集パイプラインに直接統合できるため、劇場用およびストリーミングメディアのポストプロダクションのニーズを満たし、圧縮されたMP4のカラーグレーディングという悪夢を解消します。
- AIを使った短編ドラマと漫画マルチショットは、複数のショットを使用して単一の出力で一貫性のある物語の絵コンテを生成し、「実写アクションの骨格+AIキャラクター置換と様式化されたオーバーレイ」による精密なビデオ編集をサポートすることで、ショットの連続性とアクションの制御性という2つの大きな弱点を根本的に解決します。
- 広告およびブランドコンテンツPrompt Enhancerを活用してプロンプトワードのエンジニアリングのハードルを下げ、Distilledモデルがクイックプレビューと最終製品向けの完全なモデル出力をサポートすることで、効率と品質のバランスを取りながら、高品質な商用ビデオを迅速に反復開発できます。
- 物理学、人工知能、ロボット工学Physical AI Checkpointは、具現化された知能チームに世界モデルの基盤を提供し、ロボットシステムが物理世界と運動法則を認識できるように支援することで、純粋なコンテンツ作成の領域を超えます。