project
Wan-Streamer - アリババのオープンソースリアルタイム全二重マルチモーダル基盤モデル
Wan-Streamerは、Alibaba DAMO Academyが開発したオープンソースのエンドツーエンド、リアルタイム、全二重、マルチモーダルな基盤モデルです。テキスト、音声、動画の入力トークンと出力トークンを、統一された因果的Transformerアーキテクチャを通じて単一の因果シーケンスに統合します。
Wan-Streamerとは何ですか?
Wan-Streamerは、Alibaba DAMO Academyが開発したオープンソースのエンドツーエンドリアルタイム全二重マルチモーダル基本モデルです。テキスト、音声、動画の入出力トークンを統一された因果トランスフォーマーアーキテクチャを通して同一の因果シーケンスに統合し、1秒未満のリアルタイム双方向動画インタラクションを実現します。モデルの応答遅延はわずか200ms、エンドツーエンドの遅延は550msで、25FPSの同期音声と動画を安定して出力します。
Wan-Streamerの主な機能
- リアルタイムの音声と映像による対話ユーザーとAIデジタルヒューマン間の双方向ビデオ通話をサポートしており、AIは音声と表情を同時に出力できる。
- 全二重相互作用ユーザーによるリアルタイムの割り込みや、AIによる積極的な質問に対応し、自然で流暢な人間とコンピュータの対話を実現します。
- マルチモーダル入力の理解ユーザーのビデオフィード、音声、テキスト入力を同時に受信し、理解することができる。
- ストリーミングフラグメント生成160ミリ秒の短時間ストリーミング断片化を採用し、フルフレームを待つことなく、情報を受信しながらフィードバックを生成する。
- 長期的な一貫性グローバルなキーバリュー型コンテキストキャッシュにより、長時間の会話においてもキャラクターの外見とトーンが安定し、一貫性を保つことが保証されます。
Wan-Streamerの技術原理
- 統合された単一のTransformerストリーミングアーキテクチャこのシステムは、ユーザーの視覚情報、音声、テキスト入力を、AIが生成した音声、表情、字幕と組み合わせ、因果関係のあるトークンストリームに統合します。共同生成には、テキストの自己回帰予測と音声/映像の条件付きストリームマッチングを使用します。
- 完全因果関係に基づく技術スタック設計エンコーダー、デコーダー、VAE、アテンション層はすべて因果制約に従い、過去の時間情報のみを使用して次のユニットを予測します。コアブロックの因果アテンションは、将来のトークンの可視性を制限します。
- 3段階のトレーニングプロセステキスト、画像、音声の対話データが混在するマルチタスク事前学習。リスニング、中断、一時停止の行動を学習するための全二重微調整。ストリーミング蒸留とローリング自己強制戦略の採用による大規模教師モデルの軽量化。
- 思考型・実行型デュアルGPU推論Thinkerはユーザーの音声および動画のエンコードとコンテキストの更新を処理し、Performerはストリームのマッチング、音声および動画のノイズ除去、生成を実行します。両者はコンテキストを共有し、並列に実行されます。
Wan-Streamerの使い方
現在、Wan-Streamerは公式ウェブサイトで論文とデモのみを公開しています。完全なコードとモデルの重みはまだオープンソース化されておらず、ローカル環境での展開もまだできません。
Wan-Streamerの主な利点
-
超低遅延モデル側の応答時間は200ms、エンドツーエンドの応答時間はわずか550msで、業界平均の1秒以上をはるかに下回っています。
-
エンドツーエンドの統合単一のモデルで知覚、理解、生成の全プロセスを完了できるため、ASR、LLM、TTS、レンダリングなどの複数のモジュールは不要になります。
-
全二重リアルタイム通信同時に聞き取りと応答を行うことができ、途中で中断することも可能で、まるで人間同士のように自然な対話を実現します。
-
音声と映像の同期音声と顔の動きは同期して生成されるため、後からの位置合わせや修正が不要となり、唇のずれも完全に防止されます。
-
長時間の対話の安定性グローバルなキーと値のコンテキストにより、キャラクターの外見やトーンが長期間にわたって変化しないことが保証されます。
Wan-Streamerプロジェクトのアドレス
- プロジェクト公式サイト:https://wan-streamer.com/
- arXiv技術論文:https://arxiv.org/pdf/2606.25041
Wan-Streamerと類似の競合製品との比較
| 比較対象寸法 | Wan-Streamer | GPT-4o Realtime |
|---|---|---|
| 開発者 | アリババDAMOアカデミー | OpenAI |
| ビデオ入力 | サポート | サポート |
| 同期ビデオ出力 | デジタルヒューマンビデオ | 音声のみ |
| 全二重相互作用 | リアルタイム中断/中断 | 部分的な支持 |
| エンドツーエンドアーキテクチャ | シングルトランス | ASR+LLM+TTSスプライシング |
| モデル応答遅延 | 200ms | 230ms |
| エンドツーエンドの総遅延 | ~0.55s | ~0.8s |
| レンダリング遅延 | エンドツーエンドを含む | (音声のみ)は除外します |
| リップシンク | ネイティブ同期生成 | 映像出力なし |
| 長期的な一貫性 | グローバルキーバリューキャッシュ | 外部システムに依存する |
| 現在の解像度 | 192p(試作品) | 映像出力なし |
Wan-Streamerのアプリケーションシナリオ
-
バーチャルカスタマーサービス銀行業務や電子商取引などの場面において、対面式のリアルタイムビデオ相談サービスを提供します。
-
ライブインタラクションAIアンカーは視聴者のコメントや質問にリアルタイムで応答し、ライブ配信ルームでのインタラクティブな体験を向上させます。
-
AIコンパニオン感情を共有するデジタルヒューマンは、リアルタイムのビデオチャットに対応し、没入感のあるコンパニオン体験を提供します。
-
ゲームNPCインタラクティブなゲームキャラクターはプレイヤーとリアルタイムのビデオ会話を行い、ゲームの没入感を高めます。
-
オンライン教育AIを活用したバーチャル教師は、リアルタイムのビデオ質疑応答と個別指導を提供します。