project
Luna-TTS - Yusheng Yuebanが開発した大規模なテキスト音声合成モデル
Luna-TTSは、上海交通大学傘下のスタートアップ企業であるVUI Labsが独自開発した大規模なテキスト音声合成モデルです。このモデルは、主流の自己回帰アプローチを放棄し、Qwen3-0.6をベースとしたマスク拡散アーキテクチャを採用しています。
Luna-TTSとは何ですか?
Luna-TTSは、上海交通大学傘下のスタートアップ企業であるVUI Labsが独自開発した大規模なテキスト音声合成モデルです。このモデルは、主流の自己回帰アプローチを捨て、Qwen3-0.6Bで学習されたマスク拡散アーキテクチャを採用し、中国語、英語、日本語、韓国語の100万時間分の音声データで事前学習された独自開発のLuna-Codecと組み合わせています。このモデルは、Hugging Face TTS Arena V2のブラインドリスニングテストで世界トップの成績を収め、権威あるArtificial AnalysisのリーダーボードでもGoogleを上回り3位にランクインしました。
Luna-TTSの主な機能
- 多言語音声合成中国語、英語、日本語、韓国語の4言語で高品質な音声合成に対応しています。自然な音声と滑らかなリズムで、オーディオブックやポッドキャストなど、長文コンテンツに最適です。
- 感情と非言語的制御中立、悲しみ、驚きといった感情だけでなく、呼吸、間、笑い、ため息といった非言語的な細部まで正確に制御できる。
- リアルタイムストリーミング出力Luna-TTS Realtimeは、最初のブロックのレイテンシがわずか41.6ms、エンドツーエンドのRTFが0.024という低さで、ブロックレベルのストリーミング生成をサポートしています。
- トーンの一貫性とクローン音色の複製と保存をサポートし、長文テキスト生成時にも音色のずれがなく安定した音色を維持します。
Luna-TTSの技術原理
-
マスク拡散アーキテクチャ主流の自己回帰アプローチを放棄し、音声RVQトークングリッドを全体として扱い、マスクされた位置を複数回の反復処理によって並列に予測する。生成順序はモデルによって動的に決定され、接頭辞に沿ったエラーの蓄積を回避する。
-
自社開発のLunaコーデック24kHzの波形は、25Hzの離散トークングリッドに8つのコードブックを用いてエンコードされ、ビットレートはわずか2.2kbpsです。ストリーミングとフレーム同期出力を実現するために、因果コーデックが使用されています。
-
Qwen3 メインモデルQwen3-0.6Bをベースに、引き続きトレーニングを行います。標準バージョンでは双方向アテンションを使用し、リアルタイムバージョンではブロックレベルの因果アテンションとKVキャッシュを使用してストリーミング生成を実現します。
-
大規模訓練と強化学習このプログラムは、中国語、英語、日本語、韓国語の4言語で、約100万時間の事前学習と10万時間の高品質なアニーリングを実施しました。その後、GRPO強化学習を拡散ノイズ除去軌跡に適用し、コンテンツの精度と話者の一貫性を最適化しました。
Luna-TTSプロジェクトのアドレス
- プロジェクト公式サイト:https://vuilabs-ai.github.io/luna-tts/
- arXiv技術論文:https://arxiv.org/pdf/2608.11593
Luna-TTSと類似製品との比較
| 比較対象寸法 | Luna-TTS | ElevenLabs Eleven v3 |
|---|---|---|
| 開発チーム | ユースイエバンVUIラボ(中国) | ElevenLabs(アメリカ) |
| テクニカルルート | マスク拡散 | 自己回帰生成 |
| モデルパラメータ | 0.6B | 非公開 |
| 言語サポート | 中国、英国、日本、韓国 | 多言語対応(32言語以上) |
| 感情のコントロール | きめ細かな制御(無表情/悲しい表情/驚いた表情など) | 気分やスタイルの調整をサポートする |
| 非言語的詳細 | 呼吸、間、笑い、ため息 | 一部の第二言語のサポート |
| リアルタイム版 | Luna-TTS Realtime(RTF 0.024) | Turbo v2.5(低遅延) |
| API価格設定 | $80.0 / 1M chars | $100.0 / 1M chars |
| TTS Arena V2 | 1位(Rating 1574) | 10位(評価1176) |
| Artificial Analysis | 3位(Elo 1220) | 10位(レーティング1176) |
Luna-TTSの応用シナリオ
- 高度な顧客サービスとテレマーケティングこれは従来の音声ロボットに取って代わり、自然で感情豊かな会話体験を提供し、リアルタイムのストリーミング応答をサポートし、ユーザーの通話切断率を低減します。
- 音声コンテンツとポッドキャストオーディオブック、ニュース放送、知識系ポッドキャスト向けに、高品質な長文音声を生成し、一貫したトーンと物語のリズムを維持しながら、複数の感情的なセグメント間の切り替えをサポートします。
- オンライン教育とトレーニングコース指導や語学学習において、明確で標準的な多言語発音を提供し、指導内容に合わせて感情表現(励まし、真剣さ、穏やかさなど)を調整することも可能です。
- 車載用およびスマートハードウェアLuna-TTS Realtimeの低遅延性を活用することで、車載ナビゲーション、スマートホーム、ヘッドホンアシスタント向けに、瞬時かつ自然な音声対話インターフェースを提供します。
- リアルタイム同時通訳および会議アシスタント音声理解機能を組み合わせることで、多言語会議の場面において低遅延で非常に自然な音声翻訳出力が可能になり、コミュニケーション効率が向上します。