project
Ming-omni-tts - Ant Groupのオープンソース統合音声生成モデル
Ming-omni-ttsは、Ant Groupが開発したオープンソースの統合音声生成モデルで、自己回帰アーキテクチャを採用し、音声、音楽、効果音を統合的に生成します。このモデルは、音声速度、ピッチ、音量、感情表現などのパラメータを調整するための自然言語コマンドをサポートしています。
Ming-omni-ttsとは何ですか?
Ming-omni-tts は Ant Group のオープンソースの統合オーディオ生成モデルで、自己回帰アーキテクチャを採用して音声、音楽、効果音を共同で生成します。このモデルは、自然言語コマンドによる音声速度、ピッチ、音量、感情、方言のきめ細かな制御をサポートし、広東語方言制御で 93% の精度、感情制御で 46.7% の精度を達成し、CosyVoice3 を上回ります。技術的には、統合された連続オーディオトークナイザーと Diffusion Transformer アーキテクチャを使用し、マルチモーダルオーディオを 12.5Hz のフレームレートで処理します。「Patch-by-Patch」圧縮戦略により、LLM 推論フレームレートが 3.1Hz に削減され、音質を維持しながら遅延が削減されます。16.8B パラメータバージョンは、Seed-tts-eval 中国語テストセットでわずか 0.83% の WER を達成し、SeedTTS と GLM-TTS を上回りました。このモデルには100種類以上の高品質な音色が含まれており、ゼロサンプルによるサウンドデザインをサポートし、DockerイメージとGradoのデモも提供されているため、オーディオブック、ポッドキャスト、多言語コンテンツ制作に適しています。
Ming-omni-ttsの主な機能
-
統合型マルチモーダル音声生成業界初の自己回帰モデルは、音声、環境音、音楽を単一チャンネルで同時に生成することができ、没入感のある聴覚体験を実現します。
-
きめ細かな音声制御簡単なコマンドで、話速、声のトーン、音量、感情表現、方言を精密に制御できます。広東語の方言制御の精度は93%と高く、感情表現の制御精度は46.7%です。
-
インテリジェントなサウンドデザイン100種類以上の高品質な内蔵サウンドを備え、自然言語による説明を通してゼロサンプルサウンドデザインをサポートします。
-
効率的な推論最適化「パッチごとの圧縮」戦略を採用することで、LLM推論のフレームレートを3.1Hzに低減し、レイテンシを大幅に削減します。
-
プロフェッショナルなテキスト正規化複雑な数式、化学式、その他の専門的な書式を正確に解析し、読み上げます。内部テストセットにおけるCER(誤り率)はわずか1.97%です。
-
多言語対応中国語や英語を含む複数の言語での音声合成と異言語間転送をサポートしています。
-
ゼロサンプルTTSわずか3~10秒の参照音声があれば、どんな音色でも複製でき、Seed-tts-evalでのWERは0.83%と非常に低い値です。
Ming-omni-ttsの技術原理
-
統合型連続音声トークナイザーVAEベースの連続トークナイザーは、音声、音楽、および一般的なオーディオを12.5Hzのフレームレートで統一された潜在空間に統合し、マルチモーダルオーディオの共同モデリングをサポートします。
-
Diffusion Transformer (DiT) Head拡散構造により音声生成品質が向上し、音の繊細さと自然さが増します。
-
パッチ生成戦略生成戦略では、局所的な音響の詳細と長期的な構造的整合性のバランスを取るために、パッチサイズを4、バックトラッキング履歴を32としている。
-
自己回帰生成アーキテクチャ業界初の自己回帰モデルにより、音声、音楽、効果音を単一チャンネルで同時に生成し、統一された音声生成を実現します。
-
パッチごとの圧縮メカニズム圧縮戦略を用いることで、LLM推論のフレームレートは元の周波数から3.1Hzに低減され、計算遅延と推論コストが大幅に削減される。
-
微調整のための手順コマンドベースの微調整により、発話速度、声のトーン、音量、感情、方言などをきめ細かく制御でき、自然言語コマンドの解析にも対応しています。
Ming-omni-ttsのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/inclusionAI/Ming-omni-tts
- ハグ顔モデルライブラリ:
- https://modelscope.cn/models/inclusionAI/Ming-omni-tts-16.8B-A3B
- https://huggingface.co/inclusionAI/Ming-omni-tts-0.5B
Ming-omni-ttsの応用シナリオ
-
オーディオブックとポッドキャストの制作長文の音声合成に対応しており、ポッドキャストの音声合成タスクにおけるCER(誤り率)はわずか1.84%であるため、オーディオブック、ニュース放送、ポッドキャストコンテンツの生成に適しています。
-
多言語コンテンツ作成中国語や英語を含む複数の言語での音声合成、および言語間の音声転送をサポートし、グローバルなコンテンツ制作のニーズに対応します。
-
ゲームサウンドデザイン音声、環境音、音楽を同時に生成することで、ゲームシーンに没入感のあるオーディオ体験を提供することができます。
-
教育・研修分野複雑な数式、化学式、その他の専門的な内容を正確に読み上げることができ、オンライン教育コースや学術的な説明に適しています。
-
インテリジェントな顧客サービスとアシスタント100種類以上の高品質な内蔵音声を搭載し、ゼロサンプル音声クローンに対応、さらにブランド独自の音声アシスタントを素早くカスタマイズできる機能を備えています。
-
広告・マーケティングのナレーション感情表現のコントロールと方言サポートにより、説得力のある広告ナレーションと地域に合わせたマーケティングコンテンツを生成します。