AB
AiBoss
project

Wan-Streamer - アリババのオープンソースリアルタイム全二重マルチモーダル基盤モデル

Wan-Streamerは、Alibaba DAMO Academyが開発したオープンソースのエンドツーエンド、リアルタイム、全二重、マルチモーダルな基盤モデルです。テキスト、音声、動画の入力トークンと出力トークンを、統一された因果的Transformerアーキテクチャを通じて単一の因果シーケンスに統合します。

Wan-Streamerとは何ですか?

Wan-Streamerは、Alibaba DAMO Academyが開発したオープンソースのエンドツーエンドリアルタイム全二重マルチモーダル基本モデルです。テキスト、音声、動画の入出力トークンを統一された因果トランスフォーマーアーキテクチャを通して同一の因果シーケンスに統合し、1秒未満のリアルタイム双方向動画インタラクションを実現します。モデルの応答遅延はわずか200ms、エンドツーエンドの遅延は550msで、25FPSの同期音声と動画を安定して出力します。

Wan-Streamerの主な機能

  • リアルタイムの音声と映像による対話ユーザーとAIデジタルヒューマン間の双方向ビデオ通話をサポートしており、AIは音声と表情を同時に出力できる。
  • 全二重相互作用ユーザーによるリアルタイムの割り込みや、AIによる積極的な質問に対応し、自然で流暢な人間とコンピュータの対話を実現します。
  • マルチモーダル入力の理解ユーザーのビデオフィード、音声、テキスト入力を同時に受信し、理解することができる。
  • ストリーミングフラグメント生成160ミリ秒の短時間ストリーミング断片化を採用し、フルフレームを待つことなく、情報を受信しながらフィードバックを生成する。
  • 長期的な一貫性グローバルなキーバリュー型コンテキストキャッシュにより、長時間の会話においてもキャラクターの外見とトーンが安定し、一貫性を保つことが保証されます。

Wan-Streamerの技術原理

  • 統合された単一のTransformerストリーミングアーキテクチャこのシステムは、ユーザーの視覚情報、音声、テキスト入力を、AIが生成した音声、表情、字幕と組み合わせ、因果関係のあるトークンストリームに統合します。共同生成には、テキストの自己回帰予測と音声/映像の条件付きストリームマッチングを使用します。
  • 完全因果関係に基づく技術スタック設計エンコーダー、デコーダー、VAE、アテンション層はすべて因果制約に従い、過去の時間情報のみを使用して次のユニットを予測します。コアブロックの因果アテンションは、将来のトークンの可視性を制限します。
  • 3段階のトレーニングプロセステキスト、画像、音声の対話データが混在するマルチタスク事前学習。リスニング、中断、一時停止の行動を学習するための全二重微調整。ストリーミング蒸留とローリング自己強制戦略の採用による大規模教師モデルの軽量化。
  • 思考型・実行型デュアルGPU推論Thinkerはユーザーの音声および動画のエンコードとコンテキストの更新を処理し、Performerはストリームのマッチング、音声および動画のノイズ除去、生成を実行します。両者はコンテキストを共有し、並列に実行されます。

Wan-Streamerの使い方

現在、Wan-Streamerは公式ウェブサイトで論文とデモのみを公開しています。完全なコードとモデルの重みはまだオープンソース化されておらず、ローカル環境での展開もまだできません。

Wan-Streamerの主な利点

  • 超低遅延モデル側の応答時間は200ms、エンドツーエンドの応答時間はわずか550msで、業界平均の1秒以上をはるかに下回っています。
  • エンドツーエンドの統合単一のモデルで知覚、理解、生成の全プロセスを完了できるため、ASR、LLM、TTS、レンダリングなどの複数のモジュールは不要になります。
  • 全二重リアルタイム通信同時に聞き取りと応答を行うことができ、途中で中断することも可能で、まるで人間同士のように自然な対話を実現します。
  • 音声と映像の同期音声と顔の動きは同期して生成されるため、後からの位置合わせや修正が不要となり、唇のずれも完全に防止されます。
  • 長時間の対話の安定性グローバルなキーと値のコンテキストにより、キャラクターの外見やトーンが長期間にわたって変化しないことが保証されます。

Wan-Streamerプロジェクトのアドレス

  • プロジェクト公式サイト:https://wan-streamer.com/
  • arXiv技術論文:https://arxiv.org/pdf/2606.25041

Wan-Streamerと類似の競合製品との比較

比較対象寸法 Wan-Streamer GPT-4o Realtime
開発者 アリババDAMOアカデミー OpenAI
ビデオ入力 サポート サポート
同期ビデオ出力 デジタルヒューマンビデオ 音声のみ
全二重相互作用 リアルタイム中断/中断 部分的な支持
エンドツーエンドアーキテクチャ シングルトランス ASR+LLM+TTSスプライシング
モデル応答遅延 200ms 230ms
エンドツーエンドの総遅延 ~0.55s ~0.8s
レンダリング遅延 エンドツーエンドを含む (音声のみ)は除外します
リップシンク ネイティブ同期生成 映像出力なし
長期的な一貫性 グローバルキーバリューキャッシュ 外部システムに依存する
現在の解像度 192p(試作品) 映像出力なし

Wan-Streamerのアプリケーションシナリオ

  • バーチャルカスタマーサービス銀行業務や電子商取引などの場面において、対面式のリアルタイムビデオ相談サービスを提供します。
  • ライブインタラクションAIアンカーは視聴者のコメントや質問にリアルタイムで応答し、ライブ配信ルームでのインタラクティブな体験を向上させます。
  • AIコンパニオン感情を共有するデジタルヒューマンは、リアルタイムのビデオチャットに対応し、没入感のあるコンパニオン体験を提供します。
  • ゲームNPCインタラクティブなゲームキャラクターはプレイヤーとリアルタイムのビデオ会話を行い、ゲームの没入感を高めます。
  • オンライン教育AIを活用したバーチャル教師は、リアルタイムのビデオ質疑応答と個別指導を提供します。