AB
AiBoss
project

Zing-0.5 - Loopit オープンソースのリアルタイムインタラクティブビデオワールドモデル

Zing-0.5は、Loopitが開発したオープンソースのリアルタイムインタラクティブビデオワールドモデルで、5バイトのパラメータを持ち、Wan2.2-TI2V-5Bプラットフォームをベースとし、Apache 2.0ライセンスで提供されています。そのコア機能は「共同制御」であり、キーボード空間操作と自然言語処理を包含しています。

Zing-0.5とは何ですか?

Zing-0.5は、Loopitが開発したオープンソースのリアルタイムインタラクティブビデオワールドモデルで、5バイトのパラメータとWan2.2-TI2V-5Bベースを持ち、Apache 2.0ライセンスでライセンスされています。そのコア機能は「共同制御」で、キーボードによる空間操作と自然言語による意味書き換えの両方がCausal DiTに組み込まれています。ユーザーはキャラクターを移動させながら、展開するワールドをテキストで同時に書き換えることができます。新しいコマンドはシーンをリセットするのではなく、現在のワールドに適用されます。このモデルは、トレーニング中にプロンプトを切り替えることで「プレイしながら変更する」ことを学習し、過去のフレームを積極的に摂動させてエラーの蓄積を抑制します。単一のRTX 5090 GPUでリアルタイムに24 FPS以上を生成でき、ストリーミング推論コストは約6セント/分です。Meituan LongCatと復旦大学が共同で実施したWBenchベンチマークでは、リアルタイムワールドモデルの中で1位を獲得しました。

Zing-0.5の主な機能

  • 関節制御キーボードの空間操作(移動はW/A/S/D、視点移動はI/J/K/L)は、自然言語による意味書き換えと連携し、移動を制御しながらテキストで世界を変化させます。新しいコマンドはシーンを置き換えるのではなく、現在の世界に挿入されます。
  • リアルタイムストリーミング生成RTX 5090カード1枚で24FPSを超えるフレームレートを実現し、推論コストは約6セント/分で、無限に長い時間シーケンスの連続生成をサポートします。
  • 処理途中の意味書き換え「吹雪」や「ドラゴンが火を吹く」といったテキストコマンドは、生成プロセスのどの時点でも挿入でき、モデルは視覚的および操作的な履歴を保持するため、現在の世界で書き換えを行うことができます。
  • 複数のオブジェクトが同時に反応する単一のコマンドで、複数の異なるオブジェクトに同時に変更を加えることができます(例:ひざまずいて祈っている人物と、目を開けて光る複数の彫像)。
  • 長距離での安定性キャラクターの外見、シーン構成、およびアートスタイル(ピクセルアートなど)は、連続生成中も安定しており、アートスタイルがずれたり変化したりすることはありません。
  • 誤謬蓄積防止訓練中、過去の映像は意図的に改変され、モデルは「自身の誤りを認識する」ことを学習し、長期間にわたってさらに誤った方向へ進むことを防ぐ。
  • モーションコントロール: 8 次元連続モーション信号 (値 [0,1]) で、前方/後方/左/右方向の動きと 4 方向の視点変更をサポートし、フレームごとのアクション残差としてエンコードされます。
  • ローカル展開5B パラメータは、シングル カード、Linux + PyTorch 環境、80GB 以上の VRAM、またはスライディング アテンション構成 (RTX 4090 レベルも可能) で実行でき、H.264 MP4 を出力します。
  • オープンソースで無料Apache 2.0ライセンスの下でリリースされており、コードと重みはGitHub、ModelScope、およびHuggingFaceで入手可能です。Wan2.2-TI2V-5Bで学習されています。

Zing-0.5の技術原理

  • 基本モデルWan2.2-TI2V-5Bトレーニングに基づき、5Bパラメータを使用したコアジェネレーターネットワークはCausal DiT(Causal Diffusion Transformer)であり、これはcausal KVキャッシュと組み合わせることで、無限に長い時系列自己回帰推論をサポートします。
  • デュアル制御リンクアーキテクチャCausal DiTには、独立しながらも共有される2つの制御チャネルが組み込まれています。空間操作は「アクションチェーン」に従い、意味書き換えは「テキストチェーン」に従います。これら2つのチャネルが連携して、次に生成されるコンテンツを決定します。
  • 作用残余W/A/S/D方向の動きとI/J/K/L方向の視点は、8次元の連続的な動き信号(値[0,1])を構成し、これはsin/cosエンコーディングと因果的時間畳み込み(10Mパラメータ未満)によってフレームごとの動作残差に変換されます。この残差は、対応するビデオトークンとフレームごとに位置合わせされた後、注入および生成されます。
  • テキスト連鎖(相互注意)自然言語による指示は、言語モデルによって言語トークンにエンコードされ、相互注意機構を通じて現在の世代に書き込まれることで、途中で意味的な書き換えが実現される。
  • 2チェーン分離と連続並列処理テキスト条件が変更されてもアクションチェーンは中断されないため、操作中に書き換えられる「火を吐きながら元の方向に飛ぶ龍」といった効果を実現できる。
  • トレーニングとは、「途中で書き直す」ことを学ぶことである。トレーニング中、生成された視覚的および操作的履歴を保持するために、自己回帰生成の途中でプロンプトが切り替えられます。その後、新しいテキスト条件を使用して後続のテキストが予測されます。書き換え機能は、推論中に追加された機能ではなく、トレーニング中に開発されたネイティブ機能です。
  • エラー蓄積防止トレーニング自己回帰によって生成される「履歴」はモデル自身の出力であり、誤差が蓄積されます。Zing-0.5は、トレーニング中に履歴画像の一部に積極的に摂動(ノイズの追加、わずかなぼかし、色ずれ、視点の変更など)を加えることで、実際の誤差をシミュレートし、トレーニング対象をクリーンに保ちつつ、モデルが不完全な履歴から実際の状態を区別することを学習するように促します。
  • 純粋なトレーニングソリューション、推論オーバーヘッドゼロ蓄積防止機能は重みに完全に組み込まれており、オンライン推論には追加のエラー訂正モデルは必要ないため、レイテンシや計算能力が増加することはありません。
  • 4段階DMD蒸留サンプリング拡散サンプリングを4ステップに圧縮することが、シングルカードでのリアルタイム(24FPS以上)と低コスト(約6セント/分)を実現する鍵となる。
  • スライディングウィンドウ型アテンションベースビデオメモリ適応80GB以上のビデオメモリ --local-attn-size 97 --sink-size 9RTX 4090レベル --local-attn-size 33 --sink-size 5ローカルアテンションとシンクトークンを使用することで、限られたGPUメモリ内で長いコンテキストを維持します。
  • 出力パイプラインビデオフレームはトークンにパッチ埋め込みされ、Causal DiTに入力されます。予測されたフレームがデコードされた後、H.264エンコードされた24 FPS MP4として出力されます。

Zing-0.5の使い方

  • 環境準備ハードウェアとシステムの準備: Linux システム + NVIDIA GPU (80GB 以上の VRAM を推奨、例: H100/A100; RTX 4090 レベルではスライディング ウィンドウ 注意設定を使用できます)、基本環境のインストール: Python 3.11、PyTorch 2.9、CUDA。
  • コードとモデルを取得する
    • コードリポジトリをクローンする:git clone https://github.com/seedleap/zing-world-model.gitディレクトリに入る cd zing-world-model
    • 依存関係をインストールします:pip install -r requirements.txt
    • モデルの重みをダウンロードする:pip install modelscope次に実行する modelscope download --model seedleap/Zing-0.5 --local_dir ./Zing-0.5
    • ディレクトリ構造を確認してください: 重みには以下が含まれます generator/model.pt(発電機)と pretrained/(text_encoder、tokenizer、vae)。
  • 推論を実行中
    • テキスト駆動モード(アクション T2V):実行 run.sh、 特定 --pretrained-dir--checkpoint--messages examples/case3_action_t2v.jsonl出力ディレクトリと乱数シード。
    • イメージ初期化モード(アクションTI2V):また、以下の機能も使用します... run.sh交換する examples/case4_action_ti2v.jsonl 画像生成とビデオ設定。
    • ビデオメモリに基づいて注意パラメータを選択してください:80GB以上 --local-attn-size 97 --sink-size 980GB未満 --local-attn-size 33 --sink-size 5; 完全な歴史的考察 --local-attn-size -1 --sink-size 0
  • 対話型操作
    • キーボード操作: W/A/S/D キーで前進、後退、左、右への移動を制御。I/J/K/L キーでカメラの回転を制御(内部は値 [0,1] の 8 次元連続ベクトル)。
    • 処理途中の意味書き換え:生成中に自然言語コマンド(「吹雪」や「ドラゴンの口から火が噴く」など)を入力すると、シーンをリセットすることなく、世界がリアルタイムで反応します。
  • 出力を表示H.264エンコードされた24fpsのMP4ファイルを生成し、指定された場所に保存します。 --output-dir 目次。
  • ゼロデプロイメント体験(オプション)ローカル展開を希望しない場合は、公式製品のリリースをお待ちください。対応する機能は、Loopitアプリの海外版で2週間以内にリリースされる予定で、アプリ内でリアルタイムのインタラクティブな世界を体験できるようになります。

Zing-0.5の主な利点

  • リアルタイムリーダーボードで1位になることの圧倒的な強さWBenchベンチマークスコアは81.0で、総合ランキングでは非リアルタイム双方向モデルに次ぐ2位、リアルタイムワールドモデルランキングでは1位となっている。
  • 「演奏と修正を同時に行う」機能は、まさに別格だ。ほとんどのリアルタイムワールドモデルは「シーンの探索」のみをサポートしていますが、Zing-0.5は動きを操作しながらテキストで世界を書き換えることができる数少ないモデルの一つです。関節制御が、その最大の差別化要因となっています。
  • 書き換えはするが、世界を変えるな新しい指示は、現在の世界に正確に書き込まれ、変更が必要な部分(吹雪の追加、ドラゴンの火炎放射など)のみが変更され、残りの部分(キャラクター、アートスタイル、遠景など)は一切変更されません。このようなモデルは、しばしば「偶然にも世界全体を置き換える」ことがあります。
  • 長いタイミングは逸脱しないトレーニング中、モデルは過去の画像を積極的に摂動させることでエラーを修正することを学習し、長期間にわたってキャラクターの外観とシーン構造の安定性を維持します。さらに、これは純粋なトレーニングフェーズソリューションであり、推論中に追加のエラー修正モデルを必要とせず、レイテンシも増加しません。
  • 低コストで参入障壁が低い50億のパラメータとシングルカード構成により、RTX 5090 1枚で24 FPSを超えるフレームレートを実現でき、1分間のストリーミング推論にかかるコストは約6セントに過ぎないため、一般消費者向けグラフィックカードとのリアルタイムなやり取りが可能になります。
  • 軽量で優美な建築動作制御チェーンは1000万個未満のパラメータで構成されています(正弦波/余弦波エンコーディング + 因果畳み込み → フレームごとの動作残差)。2つの制御チェーンは同時に因果DiTに入力されるため、シンプルで効率的な設計となります。
  • 真のオープンソースApache 2.0ライセンスで提供され、コード、権限、導入に関するドキュメントはすべて公開されているため、商用利用可能です。Wan2.2-TI2V-5Bの基盤は成熟しており、信頼性も高いです。

Zing-0.5プロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/seedleap/zing-world-model
  • ハギングフェイスモデルライブラリ:https://huggingface.co/seedleap/zing-0.5
  • ModelScope:https://modelscope.cn/models/seedleap/Zing-0.5

Zing-0.5と類似競合製品との比較

比較対象 Zing-0.5(Loopit/SeedLeap) HiDream-O1-World(HiDream.ai) LingBot-World v2 (Ant Group)
WBench総合ランキング 2位(リアルタイムランキングでは1位) 3番目 第5号
総合平均スコア 81.0 80.9 79.4
画質 80.6 81.0(3つの中で最も高い) 81.8(3つの中で最も高い)
シーン設定 77.8 82.2 76.8
相互作用機能 84.2(3つの中で最も高い) 80.0 82.8
一貫性 88.5(3つの中で最も高い) 88.0 86.5
物理法則 73.8(3つの中で最も高い) 73.3 69.1
リアルタイム リアルタイム(シングルカード5090で24FPS以上) リアルタイムタグはラベル付けされていませんでした 「速い」とラベル付けしよう。
インタラクションの種類 アクションとテキストを組み合わせた操作(途中で世界を書き換えることが可能) モーションコントロール モーションコントロール
パラメータサイズ 5B (ベースWAN2.2-TI2V-5B) 非公開 非公開
オープンソースの状況 オープンソース(Apache 2.0、コード+認証機関) オープンソースとしてマークされていない オープンソース
主な機能 プレイヤーがゲームを操作している間、世界はテキストによって書き換えられ、シーンをリセットすることなく新しいコマンドが現在の世界に入力されます。 最高の画質とシーン設定 高速で優れたインタラクティブ性
推論コスト ストリーミング生成には1分あたり約6セントかかります。 非公開 非公開
製品発売 Loopitアプリの海外版は2週間以内にリリースされる予定です。

Zing-0.5の応用事例

  • AIインタラクティブエンターテインメント/AIゲームプレイヤーはキーボードを使ってキャラクターを操作し、生成された世界を探索する。また、言語(雪を降らせたり、モンスターを召喚したりするなど)を使っていつでもストーリーや環境を書き換えることができ、「誰もが遊べる生成型ゲーム」を実現している。
  • 「遊べる抖音(Douyin)」スタイルのコンテンツ消費ショート動画は「見る」ことから「遊ぶ」ことへと変化し、各ユーザーが同じコンテンツ内で異なる結果を生み出すことで、コンテンツプラットフォームのあり方を再構築している。
  • UGCインタラクティブコンテンツ制作クリエイターはファンが体験できるインタラクティブな動画の世界を作り出し、視聴者はもはや傍観者ではなく参加者となることで、全く新しいコンテンツカテゴリーが生まれる。
  • 迅速なプロトタイプ検証ゲーム開発チームは、エンジンシーンを構築することなく、ワールドモデルを使用してインタラクティブなデモを迅速に生成できるため、低コストでゲームプレイやレベルのアイデアを検証できます。
  • バーチャルライブストリーミング/バーチャルアンカーホストはリアルタイムで仮想世界を操作し、視聴者は箇条書きのコメントを通してシーンや出来事を書き換えることで参加し、ライブ配信のインタラクティブ性を高める。