project
Llasa TTS - 香港科技大学が開発したオープンソースのテキスト音声合成モデル
Llasa TTSは、香港科技大学がLLaMAアーキテクチャに基づいて開発したオープンソースのテキスト音声合成(TTS)モデルです。高品質な音声合成とクローニングをサポートしています。Llasa TTSは、単層ベクトル量子化(VQ)コーデックと単一のTrに基づいています。
Llasa TTSとは何ですか?
Llasa TTSは、香港科技大学がLLaMAアーキテクチャに基づいて開発したオープンソースのテキスト音声合成(TTS)モデルです。高品質な音声合成とクローニングをサポートしています。単層ベクトル量子化(VQ)コーデックと単一のTransformerアーキテクチャをベースとするLlasa TTSは、標準のLLaMAモデルと完全に整合しており、自然で流暢な音声を生成し、感情表現や音色クローニングなどの機能をサポートしています。Llasa TTSは、トレーニングと推論の両方のフェーズで優れたパフォーマンスを発揮し、トレーニングと推論時間を延長する計算リソースを活用することで、音声の自然さ、韻律の正確さ、感情表現を向上させています。Llasa TTSは、1B、3B、8Bのパラメータを持つモデルを提供し、多言語合成をサポートしています。
Llasa TTSの主な機能
- 高品質な音声合成自然で流暢な音声を生成し、中国語と英語の両方をサポートしており、さまざまなアプリケーションシナリオに適しています。
- 感情表現感情的な情報を盛り込むことで、喜び、怒り、悲しみといった感情的なニュアンスを含む発話が生成され、発話の自然さと表現力が向上する。
- 音声クローンわずか数個の音声サンプル(例えば15秒)だけで、特定の人間の声の音色や感情を再現し、パーソナライズされた音声合成を実現できる。
- 長文テキストのサポート長文入力の処理と、一貫性のある音声出力の生成をサポートしているため、オーディオブックや音声放送などの用途に適しています。
- ゼロショット学習追加の微調整を必要とせずに、これまで見たことのない話者や感情の音声合成をサポートします。
Llasa TTSの技術原理
- トランスフォーマーベースのアーキテクチャ単一のTransformerアーキテクチャに基づいており、標準的な大規模言語モデルと完全に整合しています。音声波形をTransformerでモデル化された離散的な音声トークンに変換するために、単層ベクトル量子化(VQ)コーデックを使用します。
- 音声セグメンテーション:
- コーディング音声信号は意味的特徴と音響的特徴に分解され、それぞれ事前学習済みのWav2Vec2-BERTモジュールと畳み込みモジュールに基づいて抽出される。
- 定量化特徴量は、改良されたベクトル量子化(VQ)技術を用いて、離散的なラベルに符号化される。
- デコードこれは、個々のトークンを高品質の音声波形にデコードし、意味情報と音響情報の再構築をサポートします。
- トレーニングと推論の拡張:
- トレーニング時間の延長モデルサイズ(例:1B、3B、8Bパラメータ)またはトレーニングデータ量(例:25万時間の音声データ)を増やすことで、音声の自然さと韻律の正確性を向上させます。
- 推論時間の延長推論段階では、音声理解モデルが検証ツールとして導入され、複雑な探索戦略(バンドル探索や最適候補選択など)を用いて生成された結果を最適化し、それによって感情表現と音色の一貫性を向上させる。
- 自己回帰生成自己回帰生成法に基づき、音声タグを一つずつ生成することで、生成された音声が意味と韻律の両面で入力テキストと一致するようにする。
Llasa TTSプロジェクトの住所
- GitHubリポジトリ:https://github.com/zhenye234/LLaSA_training
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/HKUSTAudio/llasa
- arXiv技術論文:https://arxiv.org/pdf/2502.04128
- オンラインでデモを体験してください:https://huggingface.co/spaces/srinivasbilla/llasa-3b-tts
Llasa TTSの応用シナリオ
- インテリジェント音声アシスタントスマートデバイスやソフトウェアとの自然で流暢な音声対話を実現し、ユーザーエクスペリエンスを向上させます。
- オーディオブックとオンライン教育テキストコンテンツを生き生きとした音声に変換し、ユーザーや学生に聴覚的な学習体験を提供する。
- 音声放送およびカスタマーサービスニュース放送、交通情報案内、顧客サービスシステムなどにおいて、効率的な情報配信を提供するために使用されます。
- ゲームとエンターテイメントゲームキャラクターやバーチャルアバターに個性的な声を与えることで、没入感を高めることができます。
- 音声クローンとコンテンツ作成広告ナレーション、ビデオ制作、またはパーソナライズされた音声コンテンツ作成に使用するために、特定の人間の声を複製する。