project
Vidu S1 - Shengshu Technologyが開発したリアルタイムインタラクティブビデオプラットフォーム
Shengshu Technologyが発表したVidu S1は、世界をリードするリアルタイムインタラクティブビデオ基盤モデルであり、AIビデオがオフライン生成からリアルタイム双方向インタラクションの時代へと移行することを示しています。自己回帰拡散アーキテクチャに基づいており、540P解像度と25FPS(最大...
Vidu S1とは何ですか?
Shengshu Technologyが発表したVidu S1は、世界をリードするリアルタイムインタラクティブビデオ基盤モデルであり、AIビデオがオフライン生成からリアルタイム双方向インタラクションの時代へと移行することを示しています。自己回帰拡散アーキテクチャに基づき、540P解像度、25FPS(最大42FPS)でのリアルタイムビデオ生成をサポートし、コンシューマーグレードのGPUで動作します。ユーザーは、単一の画像をアップロードするだけで、トレーニング不要のデジタルキャラクターを作成できます。音声コマンドによって、キャラクターの表情、口の動き、ジェスチャー、全身の動きをリアルタイムで制御でき、無制限の安定したインタラクションを実現します。Vidu S1はシーン認識機能を備え、カメラ画像を認識してリアルタイムで応答することができ、AIコンパニオン、バーチャルアイドル、インタラクティブライブストリーミング、ゲームNPCなどのシナリオで幅広く使用されており、デジタルヒューマンの進化の道筋を、静的なコンテンツ資産から継続的にオンラインでインテリジェントなインタラクティブポータルへと再定義します。
Vidu S1の主な機能
-
リアルタイム双方向ビデオインタラクションビデオ通話のように、AIキャラクターとのリアルタイム対話をサポートし、AIキャラクターが同時に理解、生成、出力することを可能にします。ユーザーはいつでもコマンドを中断したり変更したりでき、モデルは画面コンテンツを即座に調整します。
-
音声によるフルディメンションな動作音声は唇の動きを制御するだけでなく、意味、意図、感情を理解し、それに合った表情、視線、ジェスチャー、そして全身の動きをリアルタイムで生成します。
-
無制限のリアルタイム生成自己回帰拡散(AR + 拡散)アーキテクチャに基づいており、キャラクターのアイデンティティと動作が一貫して維持され、ずれや崩壊を起こすことなく、何時間も連続して生成することができます。
-
540P高解像度リアルタイム画質540P(960×540)解像度、25FPSのリアルタイム生成、最大42FPSに対応し、一般消費者向けGPUでもスムーズに動作します。
-
単一画像によるゼロトレーニングキャラクター生成3Dモデリングや専門的なトレーニングは一切不要です。画像(実在の人物、アニメ、かわいいペットなど)をアップロードするだけで、モデルがキャラクターの外見やスタイルを自動的に理解し、瞬時にインタラクションが可能になります。
-
カスタムトーンシステムにプリセットされたトーンを選択したり、自分の声を録音したりすることで、統一感のあるパーソナライズされた映像と音声を実現できます。
-
場面認識と理解カメラの電源を入れると、モデルはシーン内の人数や動きの状況といった環境情報を認識し、それに応じてリアルタイムでフィードバックを提供することができます。
-
ストリーミングリアルタイムレスポンスTurboServe推論エンジンを採用することで、効率的なストリーミングスケジューリングを実現し、低遅延で非常に安定した、途切れることのないオンラインインタラクティブ体験を保証します。
Vidu S1の使い方
-
アクセス体験エントリーVidu AIの公式ウェブサイト(https://www.vidu.cn/vidu-stream)にアクセスするか、「Vidu AI Pro」アプリをダウンロードしてください。APIを通じて開発プラットフォームにアクセスすることも可能です。
-
新しいキャラクターを作成する「キャラクター作成」をクリックし、最初のフレーム画像(実在の人物、アニメ、かわいいペット、ゲームキャラクターなど、あらゆる画像に対応)をアップロードし、キャラクター名と説明を入力してください。
-
トーンを設定するシステムにプリセットされたトーンを選択するか、「音声を録音」をクリックして自分の声を録音し、画像と音声の一貫性を高めてください。完了したら「送信」をクリックしてください。
-
会話を始める既存の役割またはプリセットの役割を選択し、マイクとカメラのアクセス許可を与えて、「許可」をクリックすると、リアルタイムの対話型インターフェースに入ります。
-
リアルタイム音声対話音声コマンドはマイクを通して直接送信でき、キャラクターはリアルタイムでその意味を理解し、それに応じた唇の動き、表情、ジェスチャー、そして全身の動きのフィードバックを生成します。
-
指示はいつでも変更できます対話中、指示はいつでも変更可能であり(例えば、「ハートの形を作る」「眼鏡を調整する」「怒る」など)、モデルは即座に反応し、後続の画面コンテンツを調整します。
-
カメラを有効にしてインタラクションを強化しますカメラの電源を入れると、モデルはシーン内の人数とその動きの状態を識別し、環境認識を組み合わせることで、より豊富なリアルタイムフィードバックを提供することができます。
Vidu S1の公式サイトアドレス
-
公式サイトアドレス:https://www.vidu.cn/vidu-stream
-
APIプラットフォーム:https://platform.vidu.cn/live/landing
-
技術報告書:https://jt-zhang.github.io/files/Vidu_S1.pdf
Vidu S1の主な利点
-
リアルタイム双方向インタラクションこれは、従来のオフライン制作からリアルタイムのビデオ通話レベルの対話へとアップグレードし、ユーザーがいつでもコマンドを中断したり変更したりすることができ、モデルは即座に反応します。
-
音声によるフルディメンションな動作音声による読唇術の限界を打ち破り、音声が顔の表情、目の動き、ジェスチャー、全身の姿勢を直接制御することで、真に「理解しやすく正確な動き」を実現します。
-
無制限の期間にわたる安定した発電自己回帰拡散アーキテクチャに基づいているため、このゲームは何時間にもわたってインタラクションを維持でき、キャラクターのアイデンティティや行動は、逸脱したり崩壊したりすることなく一貫性を保つ。
-
高品質、高フレームレートのリアルタイム出力540P + 25FPSのリアルタイム生成をサポートし、最大42FPSを実現することで、同様のリアルタイムインタラクティブソリューションにおける業界トップクラスの地位を確立しています。
-
民生用ハードウェアでも動作可能ですTurboDiffusionとTurboServeの協調最適化を活用することで、導入のハードルを低く抑えつつ、コンシューマー向けGPU上でスムーズなリアルタイムインタラクションを実現します。
-
単一画像によるゼロトレーニングキャラクター生成3Dモデリングや専門的なトレーニングは一切不要です。実在の人物、アニメ、かわいいペットなど、どんな画像でもアップロードするだけで、数秒でインタラクティブなデジタル人間を作成できます。
-
役割の長期的な一貫性長時間のリアルタイム生成においても、キャラクターの外観、スタイル、音色の一貫性を維持し、従来のビデオ生成における破損や歪みといった問題点を解決します。
-
シーン認識能力カメラ入力に対応しており、シーン内の人数や行動などの環境情報を認識できるため、音声コマンドを凌駕する物理環境認識を実現します。
-
主要な定量的指標CSIM(0.9192)やSync-D(7.8470)といった主要な音声駆動型デジタルヒューマン評価指標において、OmniAvatarやHeyGenなどの主流ソリューションを上回る性能を発揮します。
Vidu S1と類似の競合製品との比較
| 比較対象寸法 | Vidu S1 | HeyGen | D-ID |
|---|---|---|---|
| コアポジショニング | リアルタイムインタラクティブビデオ基本モデル | AIリアルタイムデジタルヒューマンおよびビデオ生成プラットフォーム | AIデジタルヒューマンおよびリアルタイム対話エージェントプラットフォーム |
| インタラクションモード | ビデオ通話レベルでのリアルタイム双方向通信が可能で、いつでもコマンドを中断できます。 | ストリーミングアバター(リアルタイムで会話できるデジタル人間) | リアルタイム対話エージェント(D-IDエージェント) |
| コマンド応答深度 | 声の意味論+感情に基づく全身行動(表情、視線、ジェスチャー、姿勢) | 主な反応は対話テキストに対するものであり、動作は主にプリセットされた動作や口の動きに基づいて行われる。 | 主な反応は対話に対するもので、動きの範囲は限られており、主に頭の動きと読唇術を用いる。 |
| リアルタイム画像品質 | 540P / 25FPS(最大42FPS) | 高解像度出力だが、リアルタイムのインタラクティブなフレームレートは通常低い。 | 滑らかさを優先するため、リアルタイム解像度は通常720Pよりも低くなります。 |
| キャラクター作成 | トレーニング不要の単一画像、即時起動、実写/アニメ/かわいいペットに対応 | トレーニング用の動画をアップロードするか、プラットフォームのテンプレートキャラクターを選択する必要があります。 | 写真を1枚アップロードするだけ。特別なトレーニングは不要です。 |
| 継続的な対話機能 | 無制限の期間、数時間にわたる連続生成、キャラクターの同一性は時間の経過とともに一貫して維持される。 | リアルタイムセッションの継続時間は限られており、再初期化が必要です。 | リアルタイムセッションの継続時間は制限されています |
| 展開しきい値 | コンシューマーグレードのGPUはローカルで実行できます | 完全なクラウドベースのSaaSであり、ローカルコンピューティング能力は不要です。 | 完全なクラウドベースのSaaSであり、ローカルコンピューティング能力は不要です。 |
| シーンフォーカス | AIコンパニオン、ゲームNPC、インタラクティブなライブストリーミング、バーチャルアイドル、XR | 企業研修、マーケティングビデオ、越境ECカスタマーサービス | インテリジェントな顧客サービス、ブランドマーケティング、オンライン教育 |
| テクニカルルート | 自己回帰拡散(AR+拡散)のリアルタイムフレームごとの生成 | 訓練済みのデジタル人体モデルに基づくリアルタイムレンダリング | 顔認識と音声駆動型合成に基づく |
Vidu S1の応用シナリオ
-
AIを活用した感情的な仲間実写写真、アニメキャラクター、ペットの写真などを、リアルタイムで会話したり感情的なフィードバックを提供したりできる仮想のコンパニオンキャラクターに変換し、24時間365日オンラインで感情的な交流を提供する。
-
AIバーチャルアイドルとインタラクティブなライブストリーミングバーチャルアンカーは、コメントやチップの指示にリアルタイムで対応し、視聴者の声に合わせてパフォーマンスや表情を調整することで、真にインタラクティブなライブストリーミング体験を実現します。
-
ゲームのNPCとロールプレイングゲームキャラクターはもはやあらかじめ用意されたスクリプトに頼る必要がなくなり、プレイヤーの音声コマンドをリアルタイムで理解し、それに応じた行動やセリフを生成できるようになった。これにより、没入感と自由度が大幅に向上する。
-
ブランドデジタルヒューマンとバーチャルカスタマーサービス企業は、自社のブランドIPを、問い合わせ対応、製品説明、高度な顧客サービス提供といった場面で活用できるリアルタイムのオンラインデジタル従業員へと迅速に転換することで、人件費を削減できる。
-
オンライン教育とスマートチュータリング歴史上の人物や教科の講師を「起動」させて、リアルタイムの質疑応答やインタラクティブな授業を行うことができます。また、語学学習においては、リアルタイムの対話相手を作成することも可能です。
-
XR / メタバース体験これは、VR/ARデバイスに低遅延かつ高フレームレートのリアルタイムデジタルヒューマンレンダリング機能を提供し、メタバースにおけるリアルタイムのソーシャルインタラクションや仮想会議をサポートする。