project
Higgs Avatar v1 - 音声対応エージェント向けリアルタイムAIデジタルヒューマンモデル
Higgs Avatar v1は、BosonAIが開発した音声起動型エージェント向けのリアルタイムAIデジタルヒューマンモデルです。このモデルは、静止画1枚だけで、唇の動き、表情、頭のジェスチャーが同期したリアルタイムのインタラクティブなデジタルヒューマンを生成します。
Higgs Avatar v1とは何ですか?
Higgs Avatar v1は、BosonAIが開発した音声ベースのインテリジェントエージェントです。リアルタイム AIデジタルヒューマンモデル。このモデルは、静止画1枚だけで、唇の動き、表情、頭のジェスチャーが同期したリアルタイムのインタラクティブなデジタルヒューマンを生成します。1フレームのレンダリング時間はわずか16ミリ秒で、1枚のH100画像で8つの同時対話に対応できます。自社開発のHiggs Audio音声モデルとエンドツーエンドで連携し、カスタマーサービス、営業、トレーニングなどのシナリオに適しています。
Higgs Avatar v1の主な特徴
- 一枚の画像からリアルタイムでデジタル人間を生成する静止画をアップロードするだけで、3Dモデリングやモーションキャプチャ機器を必要とせず、リアルな顔立ちのリアルタイムで会話可能なデジタル人間を生成できます。
- 音声による顔の表情同期デジタル化された唇の形、表情、頭の動きは、音声コンテンツの変化にリアルタイムで追従し、聞く、話す、応答するという完全なインタラクティブなループを実現します。
- リアルタイムのフレームごとのレンダリング対話のすべてのフレームは、事前にレンダリングされたループやプリセットされたアニメーションスクリプトを使用せず、AIによってリアルタイムで生成されます。表情や動きは完全に即興です。
- マルチパス同時対話のサポート1基のH100 GPUは、同時に8つの独立したリアルタイム対話をサポートでき、企業レベルの高並行性を必要とする顧客サービスやコンサルティングのシナリオのニーズを満たします。
- エンドツーエンドのフルスタックコラボレーションこれは、独自開発のHiggs Audio音声モデルと緊密に連携し、音声理解と顔認識を統合することで、複数のコンポーネントを繋ぎ合わせることによって生じる遅延を回避します。
ヒッグスアバターv1の技術的原理
-
事前学習済み動画生成モデル大規模ビデオの事前学習済みモデルを改良することで、このモデルはフレームを1つずつ生成する機能を備え、各フレームは音声ストリームと同期して出力される。
-
フレームごとのストリーミング推論アーキテクチャ従来のビデオ生成モデルをストリーミング推論モードに適用することで、各フレームの生成にかかる時間は約16ミリ秒となり、リアルタイム対話に必要な62.5ミリ秒という閾値をはるかに下回る。
-
音声と映像の連携ヒッグスオーディオモデルと連携して設計されたこのシステムは、トレーニング段階において、音声の特徴と顔の表情、唇の形、頭の姿勢との間のマッピング関係を確立します。
-
単一画像識別符号化このシステムは、画像エンコーダーを使用して個々の写真から識別特徴を抽出し、フレームごとの生成中に顔の一貫性と安定性を維持します。
-
実運用レベルの推論最適化H100 GPU上で推論の高速化とメモリ最適化を実行することで、1枚のカード上で8ウェイの並列処理を実現し、会話あたりの計算コストを削減します。
Higgs Avatar v1 の使い方
- ベータテスト参加資格を申請するHiggs Avatar v1の公式ウェブサイト(https://www.boson.ai/blog/higgs-avatar-v1)にアクセスし、「待機リストに参加」をクリックして情報を入力し、待機リストに参加してください。
- 承認と有効化を待っていますプライベートプレビューまたはエンタープライズ統合ポータルへのトライアルアクセスを取得するための公式承認を待っています。
- プロフィール写真をアップロードデジタルヒューマンの基本画像入力として、鮮明な正面向きの静止画を用意してください。
- 音声対話へのアクセス: Boson PresenceまたはAPIを介してHiggs Audioの音声モデルに接続し、リアルタイムの音声+ビデオ会話を開始します。
- ビジネスシナリオへの展開アバターを既存のワークフローに統合し、顧客サービス、販売、またはトレーニングのニーズに基づいて展開します。
Higgs Avatar v1 の主な利点
-
エンドツーエンドで自社開発音声モデルと画像モデルは、APIの結合によって生じる遅延、中断、および不自然な表現を回避するために、トレーニング段階から共同で設計されています。
-
極めて低い遅延1フレームあたり16ミリ秒という高速生成速度をサポートし、デジタル上の人間の表情と音声の時間差をゼロに同期させることを保証します。
-
高い計算能力とコスト効率H100は1台で8件のリアルタイム会話を同時にサポートでき、会話あたりのコストも制御可能なため、本番環境への導入要件を満たします。
-
ゼロモーションキャプチャしきい値3Dモデリングやモーションキャプチャは不要です。一枚の写真から、動的でインタラクティブなアバターを生成できます。
Higgs Avatar v1と類似の競合製品との比較
| 比較対象寸法 | Higgs Avatar v1 (BosonAI) | ライブアバター(アリババと大学の共同開発) |
|---|---|---|
| 研究開発機関 | BosonAI(創業者:李牧) | アリババは複数の大学と提携 |
| オープンソースのステータス | クローズドソースのエンタープライズレベル基本モデル | オープンソース(GitHub / HuggingFace) |
| 技術アーキテクチャ | Higgs Audioとネイティブに連携する、自社開発のエンドツーエンドの基本モデル。 | 140億個のパラメータを持つ拡散モデルが使用され、DMD蒸留は4段階のフロー拡散プロセスである。 |
| 入力方法 | 静止画1枚 | マイク+カメラリアルタイムオーディオおよびビデオドライバー |
| フレームレート生成 | 単一フレーム処理時間:16ミリ秒(リアルタイム処理のしきい値である62.5ミリ秒をはるかに下回る) | 20 FPSリアルタイムストリーミング世代 |
| 持続時間の安定性 | 過度に長い時間をかけるのではなく、リアルタイムの会話に焦点を当てましょう。 | 10,000秒以上の連続生成をサポートし、イメージのずれや色の歪みを防ぎます。 |
| 音声コラボレーション | 自社開発のHiggs Audio音声モデルとのエンドツーエンドの緊密な連携 | 音声駆動型のリップシンクに対応していますが、専用の音声ベースモデルに限定されるものではありません。 |
| コア最適化 | エンドツーエンドの遅延と感情の一致 | ローリングRoPE、適応型アテンションプール、および履歴干渉メカニズムにより、長期的な一貫性が保証されます。 |
| 展開方法 | API / エンタープライズカスタマイズ / プライベートデプロイメント | オープンソースモデルにより、独立した展開と二次開発をサポート |
| 並行処理機能 | 1つのH100イメージで、8つの同時リアルタイム会話をサポートできます。 | タイムステップにおける強制的なパイプライン並列処理をサポートし、線形的な加速スケーリングを可能にします。 |
Higgs Avatar v1 の応用シナリオ
-
インテリジェントな顧客サービスeコマースや金融などの業界向けに、24時間365日対応の音声およびビデオによるカスタマーサービスを、実際の顔写真付きで提供し、ユーザーの信頼を高めます。
-
セールスコンサルタント保険や不動産などの分野で、バーチャルセールスパーソンとして活動し、対面でのコミュニケーションを通じて説得力と成約効率を高める。
-
企業研修AIコーチまたはインストラクターとして、従業員に対し、没入型のマンツーマンのスキル研修とビジネス指導を提供する。
-
医療相談遠隔医療の場面では、患者の不安を和らげるために、視覚的な補助資料を用いて予備的な診察や健康に関するアドバイスを提供する。
-
インタラクティブエンターテイメント視聴者のエンゲージメントを高めるため、バーチャル面接、AIによるロールプレイング、没入型インタラクティブコンテンツ制作などに活用されます。