AB
AiBoss
project

Maya1 - Maya Researchチームによるオープンソースの音声合成モデル。

Maya1は、Maya Researchチームが開発したオープンソースのAI音声合成モデルで、感情表現豊かな音声を生成するために特別に設計されています。このモデルは自然言語による記述に基づいて音声を生成し、笑い声や泣き声など20種類以上の感情表現に対応しています。

Maya1とは何ですか?

Maya1は、Maya Researchチームが開発したオープンソースのAI音声合成モデルで、感情豊かな音声を生成するために特別に設計されています。このモデルは、自然言語による記述に基づいて音声を生成し、笑い、泣き、ため息など20種類以上の感情表現をサポートし、リアルタイムで音声をストリーミングできます。30億個のパラメータを持つTransformerアーキテクチャとSNACニューラルコーデックをベースとしており、高品質かつ低遅延の24kHzオーディオを出力します。ゲームのナレーション、ポッドキャスト制作、音声アシスタント開発など、さまざまな用途に適しており、AI音声をより人間らしく、表現力豊かにします。

Maya1の主な機能

  • 自然言語音声設計ユーザーは、複雑なパラメータ調整を行うことなく、簡単な自然言語による説明(例えば、「穏やかで誠実な声の30歳のアメリカ人女性」など)で音声の特徴を定義できます。
  • 豊かな感情表現笑い、泣き、ため息など、20 種類以上の感情をサポートし、テキスト内の感情タグ (例: <laugh>感情表現を正確にコントロールする。
  • リアルタイムストリーミングSNACニューラルコーデックを使用することで、低遅延(約100ミリ秒)でのリアルタイム音声生成をサポートしており、音声アシスタントやゲームの対話など、即時フィードバックが求められる場面に適しています。
  • 効率的な展開30億個のパラメータを持つ軽量なTransformerアーキテクチャに基づいており、単一のGPU上で動作可能で、vLLM推論フレームワークをサポートし、高並列処理のシナリオに適しています。

Maya1の技術的原則

  • 建築Maya1は、30億個のパラメータを持つTransformerアーキテクチャ(Llamaに類似)に基づいており、波形を直接生成するのではなく、SNACコーデック用のオーディオトークンシーケンスを生成するために使用されます。
  • SNACコーデックマルチスケールレイヤー圧縮(約12Hz/23Hz/47Hz)を使用することで、音声は7トークンのフレームに効率的にエンコードされ、低ビットレート(約0.98kbps)で高品質の音声出力を実現します。
  • トレーニングプロセス事前トレーニング多様なアクセントや発話速度を網羅した、大規模な英語音声データを使用する。スタジオ品質の音声サンプルに基づいて、20種類以上の感情およびアイデンティティに関するタグがラベル付けされました。
  • 音声の説明: XML属性ベースの自然言語記述を使用する(例: <description="...">これにより、モデルが説明文を声に出して「読み上げる」ことを防ぎます。
  • 推論最適化vLLMエンジンとの統合をサポートし、自動プレフィックスキャッシュ(APC)メカニズムと組み合わせることで、繰り返し生成の計算コストを大幅に削減します。また、WebAudioの循環バッファにも対応しており、ブラウザ側でのリアルタイム再生を容易にします。

Maya1のプロジェクトアドレス

  • ハギングフェイスモデルライブラリ:https://huggingface.co/maya-research/maya1

Maya1の応用シナリオ

  • ゲーム開発ゲームキャラクターの感情的なセリフを生成することで、没入感を高める。例えば、NPCが会話の中で嘲笑や怒りを表現するようにする。
  • ポッドキャストとオーディオブック自動音声合成機能は、複数キャラクターの会話や感情表現をサポートし、プロの声優の必要性を排除し、コンテンツの魅力を高めます。
  • AI音声アシスタント自然で感情豊かな音声対話体験を実現し、アシスタントが応答時に共感や喜びといった感情を表現できるようにする。
  • ショートビデオ制作感情に訴えかけるナレーションを素早く生成し、動画の表現力と視聴者の没入感を高めます。
  • アクセシビリティアプリケーションスクリーンリーダーをより使いやすくするために、温かみのある自然な声を使用することで、視覚障害のある人がコンテンツをよりよく理解できるようにする。