AB
AiBoss
project

VoiceSculptor - 西北工業大学およびVoiceGraph Intelligenceなどの他のオープンソースプラットフォームとの共同開発により開発された音色設計モデル。

VoiceSculptorは、西北工業大学、YTO Intelligenceなどの機関が共同開発した音声設計モデルです。自然言語コマンドを通して、音声合成をきめ細かく制御することができます。

VoiceSculptorとは何ですか?

VoiceSculptorは、西北工業大学とグラフインテリジェンス研究所が共同開発した技術です。VoiceSculptorなどの機関が開発した音声設計モデルは、自然言語コマンドによる音声合成のきめ細かな制御を可能にします。これらのモデルは、性別、年齢、発話速度、ピッチ、音量、感情といった属性を柔軟に調整できるだけでなく、検索強化生成(RAG)技術を組み合わせることで、複雑なコマンドの理解度を向上させます。VoiceSculptorで生成された音声は、音声クローン作成、パーソナライズされた音声合成、仮想音声、インタラクティブなAIアプリケーションのニーズを満たすために利用でき、音声合成技術の自由度と制御性をさらに高めます。

VoiceSculptorの主な機能

  • 自然言語による音色生成制御ユーザーは、性別、年齢、話速、声のトーン、感情など、希望する音声特性を自然言語コマンドで記述することで、高度にカスタマイズされた音声合成を実現できます。
  • きめ細かな属性制御このモデルは、性別、年齢、発話速度、音高、音量、感情表現など、さまざまな音声属性を微調整して、個々のニーズに対応します。
  • 検索機能強化生成(RAG)検索強化技術を用いることで、モデルはドメイン外の自然言語指示に対応する音声をより良く理解し生成できるようになり、それによって汎化能力と堅牢性が向上する。
  • 音声クローンと音声合成生成された音声は、CosyVoice2の音色クローニングや下流の音声合成タスクのキュー波形として使用でき、効率的な音色転送と合成を可能にします。
  • ロールプレイングと多様な声の生成サスペンス小説のナレーター、ニュースキャスター、童話のナレーターなど、さまざまな役割の説明に基づいて対応する音声スタイルを生成することをサポートしており、多様なアプリケーションシナリオに適応します。

VoiceSculptorの技術的原理

  • 全体的なアーキテクチャVoiceSculptorは、音声デザインモジュールと音声クローンモジュールで構成されています。音声デザインモジュールは、LLaSAモデルに基づいて音色と音声属性を生成し、XCodec2デコーダを使用してそれらを音声に復元します。音声クローンモジュールは、生成された音声をキュー波形として使用し、CosyVoice2を使用して音色のクローン作成と音声合成を実現します。
  • 音声デザインモジュール音声設計モジュールは、LLaSAモデルを基盤としています。自然言語コマンド、きめ細かい属性トークン、およびターゲットテキストを共同で学習することで、テキストを音声特徴表現にマッピングします。次に、XCodec2デコーダーが特徴ベクトルを音声波形に変換し、自然言語コマンドによる音色生成を可能にします。
  • 検索機能強化生成(RAG)このモデルは、検索強化技術を組み込んでおり、Qwen3-Embedding-0.6Bを使用して自然言語の指示をベクトル化し、Milvusデータベースに保存します。推論時には、入力された指示に対してベクトル検索が実行され、類似の指示を照合することで、モデルが複雑な指示を理解し生成する能力が向上します。
  • 音声クローンモジュール音声クローニングモジュールはCosyVoice2をベースとしています。音声デザインモジュールによって生成された音声を入力プロンプト波形として受け取り、音色クローニング技術を用いてプロンプト波形に類似した音声を生成し、下流の音声合成処理を完了させます。
  • トレーニングデータと戦略トレーニングデータには、音色属性がラベル付けされた多数の音声サンプルが含まれています。モデルの汎化能力と生成効果がさまざまなシナリオで確実に発揮されるよう、継続的な事前学習と教師ありファインチューニングを組み合わせることで、モデルの性能が向上します。

VoiceSculptorプロジェクトの住所

  • GitHubリポジトリ:https://github.com/ASLP-lab/VoiceSculptor
  • ハギングフェイスモデルライブラリ:https://huggingface.co/ASLP-lab/VoiceSculptor-VD

VoiceSculptorの応用事例

  • パーソナライズされた音声合成この技術は、ユーザーの説明に基づいて特定のスタイルの音声を生成するなど、ユーザーに合わせた音声サービスを提供し、パーソナルアシスタントやスマートスピーカーなどのデバイスで使用することで、ユーザーの音声スタイルに関する個別のニーズを満たす。
  • 仮想音声とデジタル人間仮想アンカー、仮想カスタマーサービス担当者、仮想キャラクター向けに自然で多様な音声を生成し、仮想キャラクターの表現力とインタラクティブ性を高め、ユーザーエクスペリエンスを向上させます。
  • オーディオコンテンツ制作オーディオブック、ラジオドラマ、アニメーションの吹き替えといった分野では、テキストコンテンツに基づいて様々なスタイルの音声を迅速に生成できるため、コンテンツ制作の効率が向上し、制作コストが削減される。
  • インタラクティブAIこれは、チャットボットやインテリジェントな顧客サービスなどの対話型AIシステム向けに、自然言語制御による音声出力を提供し、システムの自然さと使いやすさを向上させます。
  • 教育と訓練教育用ソフトウェア向けに、登場人物間の対話や歴史上の人物による演説などをシミュレートする、臨場感あふれる音声ナレーションを生成することで、学習の楽しさと没入感を高めます。