AB
AiBoss
project

PixVerse R2 - PixVerse Technology社製のリアルタイム・フルモーダル世界モデル

PixVerse R2は、Aishike Technologyが開発したリアルタイムのマルチモーダル世界モデルであり、PixVerse R1のアップグレード版です。このモデルは、テキスト、画像、音声、モーション信号などのマルチモーダル入力をサポートし、動作中にユーザー制御信号を継続的に受信できます。

PixVerse R2とは何ですか?

PixVerse R2は、PixVerse Technologyが開発したリアルタイム・マルチモーダルな世界モデルであり、PixVerse R1のアップグレード版です。このモデルは、テキスト、画像、音声、モーション信号などのマルチモーダル入力をサポートし、ユーザー制御を継続的に受信し、世界状態をリアルタイムで更新し、同期された音声と映像を継続的に出力します。Omni Causal ARアーキテクチャとリアルタイムアクセラレーション技術により、PixVerse R2は長期的な一貫性を維持しながら低遅延のインタラクションを実現し、固定セグメントから継続的に進化する動的な世界へと映像生成を進化させます。

PixVerse R2の主な機能

  • リアルタイムのフルモーダルワールド生成テキスト、画像、音声、モーション信号などのマルチモーダル入力に対応し、動作中にユーザー制御を継続的に受信し、同期された音声と映像をリアルタイムで出力します。
  • 長期的な世界国家の維持マルチタイムスケールメモリシステムにより、キャラクターの同一性、場面設定、および重要な出来事の一貫性が長期運用中も維持される。
  • 動的な対話型制御ユーザーは、WASDキーや音声コマンドなどのアクション信号を使用して、生成プロセス中にリアルタイムで世界の進化の方向を制御できます。
  • 適応的な時間的粒度音声および映像生成ブロックのサイズは、制御信号の意味的境界に応じて自動的に調整され、応答速度と表現の完全性のバランスが取られます。
  • エラーの自己修正エラーバンク機構を通じて過去の生成データにおける偏差を積極的に学習・修正することで、長期的な運用安定性が向上します。

PixVerse R2の技術的原理

  • 完全モード因果自己回帰双方向の時空間生成事前分布は、単方向の因果的自己回帰アーキテクチャに変換され、短いビデオ、長いビデオ、および相互作用の軌跡の処理を統合し、画像品質、音声とビデオの表現、長距離生成、およびマルチモーダル制御を同じモデル内で同時に拡張することを可能にします。
  • 動的ブロック生成制御信号の時間スケールに基づいて、音声および映像シーケンスは適応的に分割されます。短いブロックは動作応答の精度を向上させ、長いブロックは意味的な整合性構造を維持することで、異なるタスクが同じ因果生成インターフェースを共有できるようにします。
  • 教師による強制と拡散による強制の混合クリーンな履歴とノイズのある履歴を混合してトレーニングを行い、因果的注意マスクと相対的な時間的位置エンコーディングを組み合わせることで、トレーニングと推論の間の分布ギャップが縮小し、長期的な安定性が向上します。
  • マルチタイムスケールメモリこれは、固定アンカーメモリ、スクロール履歴メモリ、およびオブジェクトキーバリューキャッシュで構成されており、これらが連携して、限られた予算内でグローバルな識別情報とローカルな連続性を維持します。
  • エラーライブラリ代表的なエラー履歴をトレーニングサンプルとして使用し、それを再生することで、モデルがバイアスを特定して修正することを能動的に学習できるようになり、長期的なドリフトを受動的な問題から能動的な最適化目標へと変えることができる。
  • 敵対的正則化、ノイズ除去、分布マッチング、蒸留生徒モデルの初期化と教師モデルの蒸留の両方にフルモーダル因果自己回帰を使用し、条件付きアライメント、分布マッチング、敵対的正則化という3つのシグナルを共同で最適化することにより、非常に少ない手順で制御の精度と現実性を維持します。
  • ブロックスパースアテンションブロックレベルの関連性ルーティングを使用することで、アテンションのスパース性が90%以上に向上し、重要な依存関係が一元的に計算されるため、パフォーマンスをほとんど損なうことなく、長いコンテキストのオーバーヘッドを大幅に削減できます。

PixVerse R2の使い方

PixVerse R2は現在ベータテスト中です。ユーザーは以下の手順に従う必要があります。QRコードをスキャンして体験申込フォームにご記入ください。早期アクセス権とAPIアクセス権を獲得しましょう。

PixVerse R2の主な利点

  • 統一されたトレーニングパラダイム本手法は、全モード因果自己回帰とリアルタイム高速化レイヤーを用いた2段階の統合トレーニングを採用しており、従来の多段階パイプラインにおける能力損失を回避している。
  • フルモーダルなリアルタイムインタラクションテキスト、画像、音声、モーション信号など、あらゆる形式の入力に対応し、生成プロセス中にユーザーからの制御を継続的に受け取り、同期された音声と映像をリアルタイムで出力できます。
  • 長期状態維持マルチタイムスケールメモリシステムとエラーライブラリ機構により、ワールド状態の一貫性を効果的に維持し、長期運用中のドリフトを積極的に補正します。
  • 適応型生成粒度動的セグメンテーション技術は、制御信号の意味に応じて生成粒度を適応的に調整することができ、対話的な応答速度と内容表現の完全性の両方を考慮に入れることができる。
  • 高効率ロスレス加速ブロックスパースアテンションとピラミッド型超少ステップ蒸留に基づき、90%を超えるスパース性において、性能をほとんど損なうことなく低遅延のリアルタイム生成を実現します。

PixVerse R2と類似製品との比較

比較対象寸法 PixVerse R2 マトリックス ゲーム 3.0 (クンルン ワンウェイ)
コアポジショニング 没入型コンテンツとインタラクティブな体験のために設計された、リアルタイムかつマルチモーダルな世界モデル。 AIゲームや仮想世界を構築するための、リアルタイムのインタラクティブな世界モデル。
コアアーキテクチャ オムニ・コーザルAR + リアルタイム高速蒸留 メモリ拡張のためのインタラクティブワールドモデル(パッチレベルのメモリ注入)
入力モード テキスト、画像/動画参照、音声、モーション信号(WASDキー) テキストプロンプト、キーボード/マウス操作制御
出力内容 音声と映像の同期ストリーミング(ビデオ+オーディオ) インタラクティブな3Dゲームワールドのグラフィック
世代のパフォーマンス 低遅延ストリーミング生成、継続的なインタラクションをサポート 720p @ 40 FPS (3.0)、一般消費者向けグラフィックカード1枚で20 FPS (3.5)
メモリ機構 マルチタイムスケールメモリ(シンク + ローリング + オブジェクトKV)+ エラーライブラリ補正 パッチレベルのメモリ注入アーキテクチャ、分単位の長期一貫性
長距離での安定性 エラーバンクを用いてドリフトを積極的に補正することで、輝度ドリフトを35.8%削減することができました。 分単位の記憶保持能力により、数分間にわたる継続的な探索をサポートします。

PixVerse R2のアプリケーションシナリオ

  • リアルタイムのインタラクティブな仮想ゲームワールドプレイヤーはWASDキーなどのモーション信号を用いて、リアルタイムで一人称視点または三人称視点を操作します。モデルは対応するシーンと視聴覚フィードバックをリアルタイムで生成し、無限に拡張可能なオープンワールド体験を実現します。
  • 映画の臨場感あふれるリアルタイムプレビュー撮影前に、監督はテキストによる説明とリアルタイムでのアクション調整を通して、動的な絵コンテ画像と同期した効果音をリアルタイムで生成し、カメラワークや物語のリズムを迅速に検証することで、試行錯誤にかかるコストを大幅に削減する。
  • バーチャルキャラクターのライブストリーミングとインタラクティブエンターテイメントデジタルアンカーやバーチャルアイドルは、ライブ配信中にリアルタイムで弾幕テキスト、音声コマンド、またはギフトジェスチャーを受け取り、表情、動作、シーンを動的に調整することで、真にリアルタイムな人間と機械のコンテンツ共同制作を実現します。
  • リアルタイムの広告およびマーケティングコンテンツ生成ブランドは、ユーザープロファイルやリアルタイムのトレンドトピックに基づいて、製品の参考画像と簡単なコピーを入力できます。モデルは、同期されたナレーション付きの短い広告動画の複数のバージョンを即座に生成し、迅速な反復とローンチ前のA/Bテストをサポートします。
  • 教育・訓練・シミュレーション医療、運転、または緊急時の訓練シナリオにおいて、訓練生は音声または操作デバイスを介して行動指示を発し、モデルは対応するシミュレーション環境とフィードバック画面をリアルタイムで生成するため、低コストで再現性の高い没入型の訓練体験が実現する。