AB
AiBoss
project

Huya VAM 1.0 - Huyaのリアルタイムマルチモーダルデジタル人体基本モデル

Huya VAM 1.0(Vivid Avatar Model)は、HuyaがDiTアーキテクチャに基づいて開発した、リアルタイムのマルチモーダルデジタルヒューマン基本モデルです。1枚の写真から、話したり、歌ったり、踊ったりできるAIデジタルヒューマンを生成できます。

Huya VAM 1.0とは何ですか?

Huya VAM 1.0(Vivid Avatar Model)は、HuyaがDiTアーキテクチャに基づいて開発したリアルタイムマルチモーダルデジタルヒューマン基本モデルです。1枚の写真から、話したり、歌ったり、踊ったりできるAIデジタルヒューマンを生成できます。このモデルは、解像度480×832、フレームレート28で24時間365日のリアルタイムライブストリーミングインタラクションを可能にします。全二重対話、即時割り込み、弾幕スクリーン応答、マルチロール戦略ゲームなどに対応しています。リアリズム、アイデンティティ保持、推論速度において総合的に優れており、ライブeコマース、ニュース放送、バーチャルコンサートなどのシナリオに適しています。

Huya VAM 1.0の主な機能

  • 写真からワンクリックでデジタル人間を作成写真をアップロードすると、話したり、歌ったり、踊ったりできるリアルタイムのAIデジタル人間アバターが生成されます。
  • 全二重リアルタイム対話テキスト入力と音声入力の両方をサポートしており、ユーザーは即座に割り込み応答できるため、スムーズで人間らしいやり取りを実現します。
  • 多才なライブパフォーマンス歌詞に合わせた口の動きや、自然で滑らかな体の動きで、歌やダンスなどのコンテンツをリアルタイムで生成できます。
  • マルチロール戦略ゲーム人狼やタロットカードといった複雑なマルチプレイヤーインタラクティブゲームに対応しており、AIキャラクターはそれぞれ独立した立場や話し方を持つ。
  • 24時間365日ライブ配信解像度480×832、毎秒28フレームのストリーミング出力で、クラッシュや歪みなく24時間以上連続稼働が可能。
  • 箇条書きコメントによるリアルタイムのやり取りライブ配信のコメントをリアルタイムで読み上げ、返信する機能をサポートしており、ライブECやニュース放送などのシナリオに対応できます。

Huya VAM 1.0の技術原理

  • DiTマルチモーダルアーキテクチャ拡散トランスフォーマーをベースに構築されており、VAE画像エンコーディング、テキストエンコーディング、音声エンコーディングを統合し、チャンネルをDiTブロックに連結することでそれらを均一に生成します。
  • トリプルクロスアテンションメカニズムDiT Blockは、自己注意、画像とテキストのアライメント、音声駆動型リップシンクをそれぞれ処理するために、自己注意、テキストと画像の相互注意、適応型音声相互注意を組み込んでいます。
  • モーションコントローラーモーション潜在変数制御モジュールの導入により、顔の表情や動きの多様性が豊かになり、会話が中断された際には頭と手足の動きが同期して遅くなったり、音楽が流れている際にはリズムに合わせてうなずいたりすることが可能になる。
  • 3段階の段階的トレーニング第1段階では、複数の参照画像とモーションフレームを使用してキャラクターを固定し、それらを劣化シーンに入力して安定性をトレーニングします。第2段階では、DPOの選好度を使用して、口の形、表情、動きなどの複数の目的を最適化およびバランス調整します。第3段階では、モデル蒸留によって推論ステップ数を20ステップから4ステップに圧縮します。
  • 自己修正機構推論段階では、既に生成されたフレームが入力として使用され、生成が継続されます。トレーニング段階では、自己修正を学習し、蓄積されたエラーが顔のずれや画面のティアリングを引き起こすのを防ぎます。

Huya VAM 1.0 の使い方

このモデルは現在、内部テスト/招待制の段階にあり、まだ一般公開されていません。

VAM 1.0の主な利点

  • 安定したマルチリファレンス画像アンカー、モーションフレーム戦略、自己補正メカニズムにより、24時間連続でクラッシュ、歪み、ティアリングが発生しないことを保証します。
  • 許可するネイティブでは、沈黙、傾聴、発話の3つの状態をカバーし、微表情や身体動作の制御精度は、実際の人間とほぼ同等である。
  • 素早い最初のフレームの遅延は約1.3秒、セグメント生成の遅延はわずか0.77秒で、8×H200 GPUは業界最速の36.4 FPSを実現しています。
  • モデル蒸留により推論ステップ数が20から4に削減され、同様のソリューションと比較して計算負荷が大幅に低減されます。
  • 本物DPOの最適化は、唇の形状、表情、動きを複数の目標にわたってバランスよく調整し、リアリズムとアイデンティティにおいて常に優位性を維持します。

VAM 1.0 類似製品との比較

比較対象寸法 Huya VAM 1.0 OmniHuman 1.5
建築 DiT(Diffusion Transformer) 拡散モデル+オーディオドライバー
リアルタイム リアルタイムストリーミング出力、28FPS リアルタイムではなく、ビデオは事前に生成しておく必要があります。
対話機能 全二重通信に対応し、割り込み/応答をサポートします。 一方通行の放送で、リアルタイムのやり取りはありません。
連続運転 24時間365日安定したライブストリーミング 長時間連続運転できない
入力方法 写真+テキスト/音声/箇条書きコメント 写真+音声
アプリケーションシナリオ ライブ配信型eコマース、インタラクティブゲーム、バーチャルな交流 ショートビデオ制作、ナレーション付きビデオ
遅れ 0.77秒/セグメント 分単位の生成
複数の役割 最大10人同時プレイの狼男ゲームに対応 単一役割駆動

VAM 1.0の適用シナリオ

  • AIを活用したライブストリーミングeコマースデジタルヒューマンアンカーは24時間365日オンラインで、リアルタイムのコメントややり取りを読み、商品を推薦し、質問に答えています。
  • バーチャルニュース放送ニュースキャスターは24時間体制で放送を行い、流暢な話し方と自然な身振り手振りで、一貫性のあるプロフェッショナルなイメージを維持している。
  • バーチャルコンサートAIシンガーは、音楽のリズムに合わせて唇の動きを同期させながらリアルタイムで歌唱し、複数の音楽スタイルの連続演奏にも対応しています。
  • ゲームコンパニオンとの連携タロット占いや人狼ゲームなどの戦略ゲームでは、AIキャラクターはそれぞれ独立した個性とゲームプレイ能力を持っている。
  • 感情的な交流チャット方言での会話をサポートし、ユーザーの好みを記憶し、没入感のある会話体験を提供する、パーソナライズされたAIアシスタント。