project
Higgs Audio V2 - 複数人による対話シナリオをシミュレートできる、オープンソースの大規模音声モデル。
Higgs Audio V2は、Boson AIのLi Mu氏とそのチームによって開発されたオープンソースの音声モデルです。1000万時間以上の音声データで学習されており、多言語対話生成、自動韻律調整、音声クローン、歌唱機能などを備えています。
Higgs Audio V2とは何ですか?
Higgs Audio V2は、Boson AIのLi Mu氏とそのチームによって開発されたオープンソースの音声モデルです。1,000万時間以上の音声データで学習されており、多言語対話生成、自動韻律調整、音声クローニング、音声合成などの機能を備えています。このモデルは、自然で流暢な複数人による会話をシミュレートし、話者の感情やイントネーションを自動的に一致させ、低遅延のリアルタイム音声対話をサポートします。ゼロサンプル音声クローニングにも対応しており、ユーザーは短い音声サンプルを提供するだけで特定の人物の声の特徴を再現でき、歌声の合成も可能です。Higgs Audio V2は音声とBGMを同時に生成できるため、オーディオコンテンツ制作を強力にサポートします。
Higgs Audio V2の主な特徴
- 多言語対話生成多言語での対話生成をサポートし、複数人による対話シナリオをシミュレートできるほか、話者の感情やエネルギーレベルを自動的に調整して、自然で流暢な対話を実現します。
- 自動リズム調整長文の読み上げにおいて、手動操作なしに内容に応じて発話速度、間、イントネーションを自動的に調整し、自然で流暢な音声を生成します。
- 音声クローンと歌声合成ユーザーは短い音声サンプルを提供するだけでよく、このモデルはサンプルなしで音声クローンを作成し、特定の人物の声の特徴を再現できるだけでなく、クローンされた声でメロディーをハミングさせることさえ可能です。
- リアルタイム音声対話低遅延応答をサポートし、ユーザーの感情を理解して感情表現を行うことができ、人間に近いインタラクティブな体験を提供します。
- 音声とBGMは同時に生成される。音声とBGMを同時に生成できるため、「曲を作って歌う」という制作プロセスが可能になります。
ヒッグス音の技術的原理 V2
-
AudioVerseデータセット私たちは、複数の音声認識モデル、音響イベント分類モデル、そして独自開発の音声理解モデルを組み合わせた自動アノテーションプロセスを開発し、1000万時間分の音声データのクリーニングとアノテーションを行いました。
-
統合オーディオセグメンター意味的特徴と音響的特徴の両方を捉えることができる、統合された音声セグメンテーションツールがゼロから訓練された。
-
DualFFNアーキテクチャこれは、計算負荷をほとんど増加させることなく、大規模言語モデルが音響トークンをモデル化する能力を大幅に向上させる。
-
ゼロサンプル音声クローニングこのモデルは文脈学習を取り入れており、簡単な手がかり(短い参照音声サンプルなど)を使用して、ゼロショットでの音声クローン作成や話し方のマッチングを可能にする。
Higgs Audio V2プロジェクトのアドレス
- GitHubリポジトリ:https://github.com/boson-ai/higgs-audio
- オンラインでデモを体験してください:https://huggingface.co/spaces/smola/higgs_audio_v2
Higgs Audio V2の応用事例
-
リアルタイム音声対話バーチャルアンカーやリアルタイム音声アシスタントなどのシナリオに適しており、低遅延で自然な対話と感情表現を実現します。
-
オーディオコンテンツ制作自然な対話やナレーションを生成できるため、オーディオブック、インタラクティブなトレーニング、ダイナミックなストーリーテリングを強力にサポートします。
-
エンターテインメントおよびクリエイティブ分野音声クローン機能は、特定の人物の声を再現できるため、エンターテインメントやクリエイティブ分野に新たな可能性を切り開く。