project
LTX-2.3 - Lightricksの最新オープンソースビデオ生成モデル
LTX-2.3は、イスラエルのAI企業Lightricksがオープンソース化した最新世代のビデオ生成モデルです。拡散トランスフォーマーアーキテクチャを採用し、220億個のパラメータを誇ります。このモデルは、テキスト、画像、音声の入力に対応しています。
LTX-2.3とは何ですか?
LTX-2.3は、イスラエルのAI企業Lightricksがオープンソース化した最新世代のビデオ生成モデルです。拡散トランスフォーマーアーキテクチャを採用し、220億個のパラメータを備えています。テキスト、画像、音声入力に対応し、最大出力解像度は4Kです。また、9:16の縦向きモードと24/48 FPSのフレームレート選択をネイティブでサポートしています。前バージョンと比較して、LTX-2.3は新たにトレーニングされたVAEアーキテクチャにより画像の詳細の鮮明度を大幅に向上させ、高解像度でのテクスチャのぼやけ問題を解決しています。さらに、ネイティブの音声生成機能を追加し、音声と映像の同期出力を可能にしています。このモデルは7つの生成エンドポイントを提供し、1回の反復で最大20秒のビデオを生成でき、LoRAファインチューニングにも対応しています。
LTX-2.3の主な機能
-
マルチモーダルビデオ生成テキストから動画へ、画像から動画へ、音声から動画へという3つの主要な生成方法をサポートし、さまざまなクリエイティブニーズに対応します。
-
ネイティブポートレートモードをサポート9:16の縦長フォーマット(最大1080×1920)を追加し、ショートビデオプラットフォームやソーシャルメディアコンテンツ制作に直接対応しました。
-
音声と映像の同期生成新たに搭載されたネイティブ音声生成機能は、環境音、効果音、セリフを同時に出力できるだけでなく、音声入力を介して映像生成を駆動することも可能です。
-
柔軟なフレームレート選択2つのフレームレートモード(24FPSシネマティックモードと48FPSスムーズモーションモード)に対応しています。
-
動画の延長と再撮影動画の延長機能と撮り直し機能を備えており、最大生成時間は20秒で、拡張機能によってさらに延長することも可能です。
-
クイック生成モード効率性が特に重要なシナリオ向けに、テキストからビデオへの高速変換、画像からビデオへの高速変換に対応した高速バージョンを提供しています。
-
高解像度出力最大4K解像度に対応し、新しいVAEアーキテクチャにより、より鮮明な画像ディテールとテクスチャを実現します。
-
LoRAの微調整サポート開発者はLoRAアダプタをローカルでトレーニングし、カスタマイズされたモデルの微調整を1時間以内に完了できます。
-
超解像ツールのサポート最終的な出力品質を最適化するために、2倍/1.5倍の空間超解像度と2倍のフレームレートブーストを備えた後処理モデルを提供します。
-
ローカルデスクトップエディタ同時に、LTX-2.3エンジンをベースにしたオープンソースのビデオエディタ「LTX Desktop」をリリースしました。これはクラウドアクセスを必要とせず、完全にローカルで動作します。
LTX-2.3の技術原理
-
DiT 拡散トランスのアーキテクチャ拡散トランスフォーマーアーキテクチャに基づき、拡散モデルとトランスフォーマーを組み合わせることで、約220億個のパラメータを持つ反復的なノイズ除去プロセスを通じて、高品質のビデオを生成します。
-
新しい VAE 変分オートエンコーダー再学習された変分オートエンコーダーは、エンコード・デコードの品質を大幅に向上させ、画像の鮮明度、テクスチャの詳細、顔の特徴の明瞭度を劇的に高め、前世代で高解像度時に発生していたディテールのぼやけという問題を解決します。
-
時空間結合モデリングこのシステムは、時空間注意機構を用いてビデオデータを処理し、空間的な画像コンテンツと時間的な動きの変化の両方を同時にモデル化することで、生成されるビデオの時間的な一貫性を確保します。
-
ネイティブオーディオ生成モジュール音声生成サブネットワークを統合することで、音声と映像のエンドツーエンドの同期生成を実現し、音声入力に基づいて映像コンテンツを生成する機能をサポートし、音声と映像の同期を保証します。
-
マルチモーダル条件付き注入異なる条件付きエンコーダを使用することで、テキスト、画像、音声といった様々なモード入力が潜在空間に均一にマッピングされ、柔軟なマルチモーダル制御が可能になる。
-
蒸留加速版これは、知識蒸留技術によってモデルのサイズを圧縮し、品質を維持しながら推論速度を向上させる、モデルの精製版を提供する。
-
LoRA低ランク適応低ランク適応技術をサポートしており、ユーザーは特定のスタイルやコンセプトを事前学習済みモデルに迅速に組み込むことで、低コストでカスタマイズを実現できます。
-
超解像後処理独立した超解像モデルを搭載しており、空間アップサンプリング(2倍/1.5倍)とフレームレート補間(2倍)の技術を用いて、生成されたビデオに対して二次的な最適化を実行します。
LTX-2.3プロジェクトの住所
- プロジェクト公式サイト:https://ltx.io/model/ltx-2-3
-
Hugging Face:https://huggingface.co/Lightricks/LTX-2.3
- arXiv技術論文:https://arxiv.org/pdf/2601.03233
LTX-2.3の応用シナリオ
-
ショートビデオとソーシャルメディアコンテンツネイティブの9:16縦向きモードをサポートし、24/48FPSのフレームレートを選択できるため、Douyin、TikTok、Instagram Reelsなどのプラットフォームのコンテンツ制作ニーズに完璧に対応します。
-
広告およびマーケティングビデオ製品紹介動画やブランドプロモーション動画を迅速に作成し、画像から動画への変換をサポートし、静止画の製品画像を動的な広告素材に変換します。
-
映画・テレビのプリビジュアライゼーションとコンセプトデザイン監督やプロデューサーは、テキストを使ってショットのプレビューを素早く作成したり、正式な撮影を開始する前にクリエイティブなコンセプトを確認したり、プリプロダクションのコストを削減したりすることができる。
-
ゲームおよびアニメーション制作ゲームのカットシーンやキャラクターの動きの参考資料を生成したり、アニメーション制作の初期素材として利用したりすることで、コンテンツ制作プロセスを加速させます。
-
ミュージックビデオおよびオーディオビジュアル制作音声から映像への変換機能は、音声を駆動した映像生成をサポートしており、ミュージシャンが歌詞に基づいたミュージックビデオや映像付きオーディオトラックを素早く作成するのに最適です。
-
教育および研修コンテンツ教育デモンストレーション動画を生成し、操作手順を視覚化することで、静的な教材を動的な解説コンテンツへと変換します。