AB
AiBoss
project

MOSS-TTSD - 清華大学の研究室が開発した、オープンソースの音声対話生成モデル。

MOSS-TTSD(Text to Spoken Dialogue)は、清華大学音声言語研究所(テンセントAIラボ)が開発したオープンソースの音声対話生成モデルです。テキストベースの対話スクリプトを自然で流暢な音声に変換できます。

MOSS-TTSDとは何ですか?

MOSS-TTSD(Text to Spoken Dialogue)は、清華大学のテンセントAIラボが開発したオープンソースの音声対話生成モデルです。テキストベースの対話スクリプトを、中国語と英語のバイリンガル生成に対応し、自然で流暢かつ表現力豊かな対話音声に変換できます。このモデルは、高度な意味音韻ニューラルネットワークオーディオコーデックと、100万時間以上の単一話者音声データと40万時間の対話音声データを使用して学習された大規模な事前学習済み言語モデルに基づいています。ゼロショット音声クローニングに対応し、対話スクリプトに基づいて正確な話者切り替え音声を生成できるため、AIポッドキャスト、インタビュー、ニュース報道など、さまざまなシナリオに適しています。

MOSS-TTSDの主な機能

  • 非常に表現力豊かな対話音声生成対話スクリプトを自然で表現力豊かな対話音声に変換し、対話のリズム、イントネーション、その他の特徴を正確に捉えることができます。
  • ゼロサンプルによる複数スピーカーの音色クローニング対話スクリプトに基づいて正確な話者切り替え音声を生成する機能をサポートしており、追加のサンプルを必要とせずに2人の話者の音声をクローン化できます。
  • 中国語と英語のバイリンガルサポート中国語と英語の両方で、高品質な対話音声を生成できます。
  • 長文音声生成低ビットレートコーデックと最適化されたトレーニングフレームワークに基づいて、超長尺の音声を一度に生成することができ、音声セグメントを接合する際の不自然な移行を回避します。
  • 完全オープンソースで商用利用可能モデルの重み、推論コード、およびAPIインターフェースはすべてオープンソースであり、商用アプリケーションで無料で使用できます。

MOSS-TTSDの技術原理

  • 基本モデルアーキテクチャMOSS-TTSDはQwen3-1.7Bベースモデルをベースとしており、離散音声シーケンスモデリング手法を採用しています。このモデルは、8層のRVQ(残差ベクトル量子化)コードブックを用いて音声を離散化し、連続音声信号を離散トークンシーケンスに変換します。これらのトークンシーケンスは自己回帰と遅延パターンによって生成され、最終的にトークナイザのデコーダがトークンから音声を再構築します。
  • 音声離散化とエンコーダの革新その主要なイノベーションの一つは、特別に設計された音声離散化エンコーダであるXYトークナイザーです。XYトークナイザーは、2段階のマルチタスク学習アプローチを使用してトレーニングされます。
    • フェーズ1自動音声認識(ASR)および音声再構成タスクのトレーニングにより、エンコーダは意味情報をエンコードしながら、粗粒度の音響情報を保持することができる。
    • フェーズ2エンコーダと量子化層が固定されているため、デコーダのみが学習され、再構成損失とGAN損失によってきめ細かい音響情報が補完されます。XY-Tokenizerは、1kbpsのビットレートと12.5Hzのフレームレートで意味情報と音響情報の両方を同時にモデル化でき、他の類似コーデックを凌駕します。
  • データ処理と事前学習MOSS-TTSDは、約100万時間の単一話者音声データと40万時間の対話音声データを使用して学習されました。研究チームは、膨大な量の生音声データから高品質な単一話者音声と複数人対話音声を選別し、注釈を付ける効率的なデータ処理パイプラインを設計しました。このモデルはTTSデータを使用して事前学習されており、110万時間の中国語と英語のTTSデータを使用することで、音声の韻律と表現力が大幅に向上しました。
  • 長文音声生成機能超低ビットレートコーデックをベースとするMOSS-TTSDは、最大960秒の音声生成をサポートしており、超長尺の音声セグメントを一度に生成し、継ぎ接ぎされた音声断片間の不自然な移行を回避することを可能にします。

MOSS TTSDプロジェクトの住所

  • プロジェクト公式サイト:https://www.open-moss.com/en/moss-ttsd/
  • GitHubリポジトリ:https://github.com/OpenMOSS/MOSS-TTSD
  • ハギングフェイスモデルライブラリ:https://huggingface.co/fnlp/MOSS-TTSD-v0.5
  • オンラインでデモを体験してください:https://huggingface.co/spaces/fnlp/MOSS-TTSD

MOSS-TTSDの応用シナリオ

  • AIによるポッドキャスト制作MOSS-TTSDは、自然で流暢な会話音声を生成するため、AIポッドキャストの制作に特に適しています。現実的な会話シナリオをシミュレートし、高品質なポッドキャストコンテンツを生成できます。
  • 映画やテレビ番組の吹き替えこのモデルは、中国語と英語の両方で表現力豊かな対話音声の生成をサポートし、ゼロサンプル音色クローニングも実行できるため、映画やテレビ番組のセリフ吹き替えに適しています。
  • 長時間のインタビューMOSS-TTSDは最大960秒の音声生成に対応しており、超長尺の音声クリップを一度に生成できます。これにより、音声セグメント間の不自然な遷移が回避され、長時間のインタビュー音声の生成に最適です。
  • ニュース報道ニュース報道において、MOSS-TTSDは自然で会話的な音声を生成し、ニュースコンテンツを伝え、その魅力を高めることができる。
  • eコマースのライブストリーミングこのモデルは、デジタル人間対話など、eコマースのライブストリーミングシナリオにおいて、自然な会話音声を生成することで視聴者を引き付けるために使用できます。