project
Voxtral TTS - Mistral AIのオープンソーステキスト音声合成モデル
Voxtral TTSは、Mistral AIが開発したオープンソースのテキスト音声合成モデルで、40億個のパラメータを持つアーキテクチャに基づき、9つの言語をサポートしています。このモデルは、90ミリ秒という超低遅延と、リアルタイム生成速度の6倍という驚異的な速度を誇り、わずか3~5秒の音声からテキストを生成できます。
Voxtral TTSとは何ですか?
Voxtral TTSは、Mistral AIが開発したオープンソースのテキスト音声合成モデルで、40億個のパラメータを持つアーキテクチャに基づき、9つの言語をサポートしています。このモデルは、90ミリ秒という超低遅延と、6倍高速なリアルタイム生成速度を誇り、わずか3~5秒の音声データでゼロサンプル音声クローニングを実現します。エッジデバイスへの展開が可能で、量子化後わずか3GBのメモリしか必要としません。APIの価格は1,000文字あたり0.016ドルです。Voxtral TTSは、音声カスタマーサービス、リアルタイム翻訳、オーディオブックなどのシナリオに適した、Mistralのエンドツーエンド音声AIプラットフォームを完成させるものであり、複数の評価において競合製品であるElevenLabsを凌駕しています。
Voxtral TTSの主な機能
-
多言語音声合成英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語でのテキスト読み上げに対応しています。
-
ゼロサンプル音声クローニングわずか3~5秒の基準音声があれば、あらゆる話者の声を複製でき、言語間の音色転送にも対応できます。
-
感情スタイルのコントロールこのモデルは、生成される音声の感情状態(怒り、喜び、悲しみなど)や、発話速度、音色、音量などのパラメータを調整することができます。
-
超低遅延リアルタイム生成初期の音声時間はわずか90ミリ秒で、リアルタイム性は実際の対話シナリオの6倍です。
-
エンドサイド機器の展開このモデルはスマートウォッチや携帯電話などのエッジデバイス上で動作可能で、量子化後も約3GBのメモリしか必要としない。
Voxtral TTSの技術原則
- 3つのモジュールをカスケード接続したアーキテクチャこのモデルは、34億個のパラメータを持つTransformer言語モデル、3億9000万個のパラメータを持つストリームマッチング音響モデル、および3億個のパラメータを持つニューラルオーディオコーデックで構成されており、合計で約40億個のパラメータがあります。
- テキストから離散表現への変換Ministral 3Bバックボーンネットワークを基盤として、ストリーミングBERTスタイルのマスク言語モデルを用いて、入力テキストを個別の音声トークンに変換する。
- ストリームマッチングスペクトル生成このモデルは、従来の拡散モデルに代わり、フローマッチング技術を採用しています。これにより、離散的なトークンを連続的なメルスペクトログラムに迅速に変換し、推論速度を向上させることができます。
- ニューラルオーディオのエンコーディングとデコーディングスペクトログラムは、300Mパラメータコーデックを使用して高品質の音声波形に再構築され、出力の自然さが保証されます。
- エッジ最適化されたデプロイメントINT8/INT4量子化圧縮をサポートし、モデルサイズを3GBのメモリ使用量に削減し、スマートフォンなどのエッジデバイスでの動作に対応します。
Voxtral TTSの主要情報と使用要件
- リリース時間ミストラルAIにより2026年3月26日に正式リリースされました。
- モデルサイズパラメータの総数は約40億で、内訳は34億のTransformer言語モデル、3億9000万のストリームマッチング音響モデル、3億のニューラルオーディオコーデックとなっている。
- 対応言語対応言語は、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の計9言語です。
- パフォーマンス指標初期音声時間は90ミリ秒、リアルタイム係数は6倍で、音声クローン作成に必要な参照音声はわずか3~5秒です。
- ライセンスオープンソースの重み付けツールはクリエイティブ・コモンズ・ライセンスの下で提供され、APIの価格は1000文字あたり0.016ドルです。
- ハードウェア要件ローカル展開には最低3GBのメモリ(量子化バージョン)が必要で、スマートウォッチ、スマートフォン、ノートパソコンなどのエッジデバイスをサポートします。
Voxtral TTSの主な利点
- オープンソースでカスタマイズ可能モデルの重み付けは完全にオープンソースであるため、企業はそれをローカルに展開し、必要に応じて微調整することができ、サードパーティのクラウドサービスに依存することに伴うデータプライバシーのリスクを回避できます。
- 超低遅延と高性能初期音声時間はわずか90ミリ秒で、リアルタイム性は6倍も高く、類似の競合製品と比べて格段に優れており、リアルタイム対話のシナリオのニーズを満たしています。
- エンドサイド展開機能量子化処理後は、わずか3GBのメモリで済み、クラウド接続なしでスマートフォンやスマートウォッチなどのエッジデバイス上で動作させることができる。
- ゼロサンプル音声クローニングわずか3~5秒の音声データで、あらゆる話者の声を複製でき、言語間の音色転送にも対応し、音声カスタマイズのコストを大幅に削減します。
Voxtral TTSの使い方
- オンライン体験音声を生成するには、Mistral StudioコンソールまたはLe Chatプラットフォームにアクセスし、テキストを入力して、音声パラメーターを選択するだけです。
- API呼び出しMistralアカウントを登録してAPIキーを取得し、REST API経由でテキストとオプションの参照オーディオURLを送信すると、生成されたオーディオファイルが届きます。
- オープンソースのローカルデプロイメントHugging Faceからモデルの重みをダウンロードし、PyTorchまたはtransformersライブラリを使用して読み込み、ローカルのGPUまたはCPUで推論を実行します。
Voxtral TTSプロジェクトの住所
- プロジェクト公式サイト:https://mistral.ai/news/voxtral-tts
- ハギングフェイスモデルライブラリ:https://huggingface.co/mistralai/Voxtral-4B-TTS-2603
- 技術論文:https://mistral.ai/static/research/voxtral-tts.pdf
Voxtral TTSと類似競合製品との比較
| 寸法 | Voxtral TTS | ElevenLabs | OpenAI TTS |
|---|---|---|---|
| オープンソース | 完全にオープンソースで、ローカルにデプロイ可能 | クローズドソース、APIのみ | クローズドソース、APIのみ |
| レイテンシー性能 | 初期オーディオ90ms、リアルタイム6倍高速 | Flash v2.5はレイテンシが低い。 | 中程度の遅延 |
| 音声クローン | 3~5秒でサンプルなしのクローニングが可能 | サポート、優れた成果 | 限定的なサポート |
| 価格設定 | 1000文字あたり0.016ドル | 価格上昇 | 従量課金制 |
| 展開方法 | クラウドAPI + ローカルエッジデバイス | クラウドAPIのみ | クラウドAPIのみ |
Voxtral TTSの応用シナリオ
- リアルタイム音声対話このモデルは、低遅延のインテリジェントな顧客サービス、音声アシスタント、チャットボットの構築をサポートし、90ミリ秒の応答時間で自然な人間とコンピュータの対話を実現します。
- 多言語コンテンツのローカライズこのサービスは、動画、ポッドキャスト、その他のコンテンツを9つの対象言語に翻訳する際に、元の話者の声の特徴を維持するため、多言語制作のコストを削減します。
- パーソナライズされたオーディオコンテンツこのモデルは特定の音声を複製してオーディオブック、ニュース放送、教育研修用音声などを生成でき、ブランドのカスタマイズされたニーズに対応します。
- 没入型エンターテイメント体験ゲーム内のNPCやインタラクティブな物語に、感情を自在にコントロールできるダイナミックな音声を提供し、プレイヤーの没入感を高めます。
- アクセシビリティツール視覚障害のあるユーザー向けにテキストメッセージを読み上げたり、言語障害のある人向けに個別のデジタル音声を再現したりすることができる。