project
SoulX-Podcast - Soulのマルチスピーカー音声合成モデル
SoulX-Podcastは、Soul AI Labが開発したマルチスピーカー音声合成(TTS)モデルで、特に長時間のポッドキャスト会話の生成を目的として設計されています。このモデルは17億個のパラメータを持ち、北京語、英語、および様々な中国語方言(四川語など)に対応しています。
SoulX-Podcastとは何ですか?
SoulX-Podcastは、Soul AI Labが開発したマルチスピーカーテキスト音声合成(TTS)モデルで、長時間のポッドキャスト会話の生成に特化して設計されています。このモデルは17億個のパラメータを持ち、北京語、英語、および様々な中国語方言(四川語、河南語、広東語など)に対応しています。方言間プロンプト機能を備え、北京語のプロンプトに基づいて目的の方言の音声を生成します。また、合成音声のリアリティを高めるために、笑い声やため息などのパラ言語制御にも対応しています。SoulX-Podcastは、90分を超える一貫性のある会話を生成でき、安定した音色と感情の連続性を維持するため、ポッドキャスト、オーディオブック、その他同様の用途に適しています。
SoulX-Podcastの主な機能
- より多くの人が支持する複数の話者間の対話生成をサポートし、異なる話者の声を自然に切り替えることができるため、ポッドキャスト、オーディオブック、その他のシナリオに適しています。
- 多言語および方言対応中国語(北京語)、英語、および様々な中国語方言(四川語、河南語、広東語など)に対応しており、方言間プロンプト機能も備えています。これにより、中国語のプロンプトを通して目的の方言の音声を生成できます。
- 第二言語の制御笑い声、ため息、咳払いなどの非言語情報をサポートすることで、音声合成のリアリティを高め、生成される音声をより自然で生き生きとしたものにします。
- 長文対話生成90分を超える一貫性のある対話を生成でき、安定したトーンと感情的な連続性を維持できるため、長尺のポッドキャストコンテンツの生成に適しています。
- ゼロサンプル音声クローニングゼロサンプル音声クローニングをサポートしており、対象話者の音声サンプルがなくても、高品質でパーソナライズされた音声を生成することが可能です。
SoulX-Podcastの技術的原則
- 基本モデルアーキテクチャQwen3-1.7Bアーキテクチャをベースにした、強力な事前学習済み言語モデルであり、複数話者による対話生成タスクに適応するように微調整されています。
- マルチスピーカーモデリング話者埋め込み技術を導入することで、このモデルは異なる話者の音声特徴を識別し、生成プロセス中に話者を自然に切り替えることができる。
- 方言間生成方言誘導型プロンプト(DGP)方式を用いることで、このモデルは標準中国語のプロンプトに基づいて目標とする方言で音声を生成でき、複数の方言のゼロショット生成をサポートする。
- 第二言語の制御テキスト入力に特定のサブ言語マーカー(例:...)を追加することで
<|laughter|>、<|sigh|>(など)モデルは、生成された音声に対応する非言語情報を追加して、音声のリアリティを高めることができます。 - 長編作品の生成安定性モデルの注意機構とデコーダー構造を最適化することで、長い対話の生成において安定した音色と感情の連続性を確保し、音色のずれや感情の不整合といった問題を回避します。
- データ処理とトレーニングこのモデルは、大規模な複数話者による対話データを用いて学習されます。データ処理ワークフローには、音声強調、音声セグメンテーション、話者ログ記録、テキスト転写、および品質フィルタリングが含まれており、モデルが豊富な対話特徴を学習できるようになっています。
SoulX-Podcastプロジェクトのアドレス
- プロジェクト公式サイト:https://soul-ailab.github.io/soulx-podcast/
- GitHubリポジトリ:https://github.com/Soul-AILab/SoulX-Podcast
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/Soul-AILab/soulx-podcast
- arXiv技術論文:https://arxiv.org/pdf/2510.23541
SoulX-Podcastの応用事例
- ポッドキャスト制作このモデルは90分を超える一貫性のある対話を生成できるため、テクノロジー、文化、エンターテインメントなど、さまざまな分野のポッドキャストコンテンツの作成に適しています。
- オーディオブックこのモデルは複数の登場人物間の対話を生成できるため、オーディオブックをより生き生きと面白くすることができ、小説や物語などの長編コンテンツに適しています。
- 教育コンテンツ言語学習や歴史物語などの教育コンテンツのインタラクティブ性と楽しさを高めるために、複数の役割を持つ対話を生成します。
- エンターテインメントとゲームゲーム、アニメーション、ビデオ向けに自然な複数キャラクターの音声を生成し、コンテンツの没入感を高めます。
- 企業研修従業員のコミュニケーションスキルと顧客サービス能力を向上させるためのトレーニングとして、模擬対話を作成する。