project
Wan-Streamer v0.2 - Alibaba Tongyiが発表した、完全なモーダル理解と生成モデル。
Wan-Streamer v0.2 は、アリババの Tongyi Lab が開発した、リアルタイム双方向インタラクションのためのエンドツーエンドのフルモーダル理解および生成モデルです。このモデルは、「聞く、見る、話す、行動する」を単一の Transformer に統合し、テキスト、音声、音声などをネイティブにサポートしています。
Wan-Streamer v0.2とは何ですか?
Wan-Streamer v0.2は、アリババ傘下のTongyi Labが開発した、リアルタイム双方向インタラクションのためのエンドツーエンドのフルモーダル理解・生成モデルです。このモデルは、「聞く、見る、話す、行動する」という機能を単一のTransformerに統合し、テキスト、音声、動画のリアルタイム理解と同期生成をネイティブにサポートします。エンドツーエンドの応答遅延はわずか550ms、出力解像度は640×368@25FPSで、AIがまるで人間のように聞き、見て、応答することで、真に自然な対面式ビデオコミュニケーションを実現します。
Wan-Streamer v0.2の主な機能
-
リアルタイムの音声と映像による対話このシステムはビデオ通話による対面でのやり取りをサポートしており、AIがユーザーの音声と映像をリアルタイムで感知し、同時に応答を生成します。
-
完全なモーダル理解外部モジュールを必要とせずに、テキスト、音声、ビデオ入力のリアルタイム認識をネイティブにサポートしています。
-
音声と映像の同期生成音声と高精細映像を同時に出力でき、完璧な音声・映像同期を実現します。
-
微表情とジェスチャーの生成自然な目の表情、体の姿勢、ジェスチャー、そして場面の細部を生成できる。
-
フリーロールプレイング自然言語による説明を用いて、あらゆるキャラクターをリアルタイムで生成し、対話を行うことをサポートします。
Wan-Streamer v0.2の技術原理
-
ネイティブストリーミングアーキテクチャこれは、処理全体の終了を待たずに、ユーザー入力とエージェント出力を同じ因果関係のタイムラインにマッピングします。
-
フローセル閉ループ知覚、理解、生成、解読という一連のプロセスが160ミリ秒ごとに完全に閉じられ、同時発話、聴取、応答が可能となる。
-
思考家兼実行者という二つの道を歩むThinkerシングルカードは低遅延の知覚と言語推論を担当し、PerformerマルチカードUlyssesパラレルは高解像度ビデオ生成を担当する。
-
スケジュールの重複シングルカードのThinkerとマルチカードのPerformerの処理領域は重なり合っており、ビデオ生成コストとレイテンシに敏感な処理経路を分離している。
-
エンドツーエンドの統合モデリングテキスト、音声、ビデオの入出力を単一のTransformerに統合することで、パイプラインの断片化を回避します。
Wan-Streamer v0.2 の使い方
Wan-Streamer v0.2は現在、研究プロジェクトとしてリリースされています。具体的なアクセスポイントやAPI統合方法については、Tongyi Labsからの今後の公式発表をご参照ください。
Wan-Streamer v0.2の主な利点
-
極めて低遅延エンドツーエンドの処理時間は550ms、モデル側の処理時間はわずか200msであり、主流のリアルタイム音声対話モデルよりも大幅に高速です。
-
フルモーダルエンドツーエンド音声と映像の同期認識および生成をネイティブにサポートしているため、ASR、LLM、TTSなどの外部モジュールは不要です。
-
高品質な出力640×368@25FPSに対応し、微細な表情、ジェスチャー、シーンの詳細をサポートし、もはや浮遊する頭部だけに限定されません。
-
全二重相互作用これにより、話す、聞く、応答することが同時に可能になり、処理を開始する前にユーザーが話し終えるのを待つ必要がなくなるため、より自然なコミュニケーションが可能になります。
-
スケーラブルなアーキテクチャThinker-Performerデュアルパス設計は、極めて低い遅延を維持しながら画質を向上させます。
Wan-Streamer v0.2 のプロジェクトアドレス
- プロジェクト公式サイト:https://wan-streamer.com/
- arXiv技術論文:https://arxiv.org/pdf/2607.04443
Wan-Streamer v0.2と類似の競合製品との比較
| 比較対象寸法 | Wan-Streamer v0.2 | GPT-4o Realtime |
|---|---|---|
| 研究開発 | アリ・トンイ研究室 | OpenAI |
| エンドツーエンド遅延 | 約0.55秒(ネットワーク遅延350msを含む) | 約0.23~0.8秒 |
| モデル側の遅延 | 約200ミリ秒 | 約230ミリ秒 |
| ビデオ出力 | 640×368 @ 25FPS | サポートされていません |
| ビデオ認識 | サポート | サポート |
| 音声出力 | サポート | サポート |
| テキスト出力 | サポート | サポート |
| エンドツーエンドアーキテクチャ | ネイティブエンドツーエンドトランスフォーマー | カスケード型パイプライン(エンドツーエンドではない) |
| 全二重相互作用 | 完全サポート | 部分的な支持 |
| 外部モジュールの依存関係 | なし(ネイティブ統合モデリング) | ASR + LLM + TTS アセンブリが必要です |
| 建築設計 | 思考家・実行者二重経路 + ユリシーズとの並行関係 | シングルパス |
Wan-Streamer v0.2のアプリケーションシナリオ
-
ビデオ通話用AIアシスタントカメラをオンにすることで対面でのコミュニケーションが可能になり、口頭練習、模擬面接、心理カウンセリングなど、「臨場感」が求められる場面に適している。
-
文脈に即した教育AI教師は、画面上の生徒の表情を観察することで、生徒の理解度を判断し、リアルタイムで授業のペースを調整することができる。
-
没入型ゲームNPCゲームキャラクターは表情や身振り手振り、リアルタイムの反応などがあり、プレイヤーと真に「対面」した対話をすることができる。
-
アクセシビリティ聴覚障害のあるユーザー向けには、正確な読唇術とジェスチャーによるリアルタイムのビデオ応答を生成し、視覚障害のあるユーザー向けには周囲の環境を説明する。
-
バーチャルロールプレイングこれにより、ユーザーは歴史上の人物、芸術作品、またはオリジナルのキャラクターとリアルタイムで会話することができ、没入感のある文化体験を生み出すことができます。