project
OmniVoice - Xiaomiチームによるオープンソースの多言語音声合成モデル
OmniVoiceは、Xiaomi AI Labsの次世代Kaldiチームがオープンソース化した、大規模な多言語TTSモデルです。600以上の言語でゼロショット音声クローニングをサポートしています。このモデルは、最小限の非自己回帰拡散アーキテクチャと、フルコードブックランダム化マスキングを組み合わせています。
OmniVoiceとは何ですか?
OmniVoiceは、Xiaomi AI Labsの次世代Kaldiチームがオープンソース化した、大規模な多言語TTSモデルです。600以上の言語でゼロショット音声クローニングをサポートしています。このモデルは、最小限の非自己回帰拡散アーキテクチャを採用し、フルコードブックランダム化マスキングとLLM初期化技術を組み合わせることで、リアルタイム推論速度を40倍高速化しています。OmniVoiceは、音色設計、音声ノイズ除去、サブ言語制御(笑い声など)、発音補正をサポートし、音質と対応言語において最先端(SOTA)レベルを達成、特にリソースの少ない言語に対して優れた汎化能力を発揮します。
OmniVoiceの主な機能
- 大規模多言語合成600以上の言語に対応したゼロショットTTSをサポートし、使用頻度の高い言語からリソースの少ない言語までを網羅しており、58万時間分のオープンソースデータで学習されています。
- ゼロサンプル音声クローニングわずか3~10秒の参照音声だけで、あらゆる話者の声を複製でき、自動文字起こし(内蔵のWhisper)または手動で入力したテキストにも対応しています。
- 属性トーンデザイン参照音声を必要とせず、自然言語による記述(性別、年齢、声のトーン、方言/アクセント、ささやき声のスタイルなど)から直接、カスタマイズされた音声を生成します。
- リファレンスオーディオのノイズ除去ノイズや残響のある参照音声を処理し、クリアな話者の特徴を抽出し、環境ノイズを含む合成音声を回避することができます。
-
第二言語の制御:入れる
[laughter]、[sigh]タグに笑い声やため息などの感情表現を追加してください。 -
発音の訂正ピンインを使用してください(例)
ZHE2)または CMU 音素(例:[B EY1 S]多声文字と固有名詞の発音の修正
OmniVoiceの使い方
- インストールと展開ユーザーは、pipコマンドを使用するか、GitHubからソースコードをクローンしてインストールコマンドを実行することで、OmniVoiceをデプロイできます。
- クイックエクスペリエンスユーザーは、ローカルのWebサービスを起動するか、HuggingFaceのオンラインデモにアクセスすることで、コードを一切記述することなく、OmniVoiceの音声合成効果をすぐに体験できます。
- 音声クローン開発者は、Python API を使用して事前学習済みモデルをロードし、参照音声と書き起こしテキストを提供することで、ゼロショット音声クローニングを実装できます。
- トーンデザインユーザーは、話者の性別、年齢、声のトーン、アクセント、その他の属性を自然言語で記述することにより、特定の音色を直接設計および生成できます。
- コマンドラインツールこのシステムは、コマンドラインツールを介して、単一音声合成または複数のGPUにまたがるバッチ推論タスクをサポートします。
- きめ細かな制御ユーザーは、合成テキストに特定のタグを挿入して、笑い声やため息などの非言語的表現を追加したり、ピンインや音素記号を使用して多声文字や固有名詞の発音を修正したりできます。
OmniVoiceの重要な情報と使用要件
- 技術的な位置付けOmniVoiceは、Xiaomi AI Labsが開発した拡散言語モデルに基づく、オープンソースの非自己回帰型音声合成システムです。従来のカスケードパイプラインを廃止し、最小限の双方向Transformerアーキテクチャを採用してテキストを複数のコードブック音響トークンに直接マッピングし、600以上の言語でゼロサンプル音声のクローン作成と合成をサポートしています。
- コアパラメータこのモデルは0.8B個のパラメータを持ち、Qwen3-0.6Bに基づいて初期化されています。646言語を網羅する581,000時間分のオープンソース音声データで学習されており、推論速度はRTF 0.025(リアルタイムの40倍)に達しています。中国語、英語、および多言語ベンチマークテストにおいて、話者類似度と明瞭度指標は最先端のレベルに達しています。
- 機能的境界3~10秒の参照音声のゼロサンプル音声クローン作成(ノイズや残響のある音声のノイズ低減を含む)、性別、年齢、ピッチ、方言、アクセントなどの属性に基づく音色設計、タグやピンイン/音素によるパラ言語的制御および発音補正をサポートします。
- ハードウェア環境モデル推論を実行するには、CUDAをサポートするNVIDIA GPU(最高のパフォーマンスを得るにはH800/H20を推奨)またはMPSをサポートするApple Siliconデバイスが必要です。
- ソフトウェアの依存関係実行時の依存関係を満たすには、Python仮想環境にPyTorch(CUDAのバージョンに一致するもの)をインストールし、pipまたはソースコードを使用してomnivoiceパッケージをインストールする必要があります。
OmniVoiceの主な利点
- ミニマルで効率的な建築本システムは、単段非自己回帰拡散言語モデルアーキテクチャを採用し、双方向トランスフォーマーを使用してテキストを複数のコードブック音響トークンに直接マッピングすることで、従来のカスケードパイプラインにおけるエラー伝播と情報ボトルネックを解消し、アーキテクチャの簡素化とパフォーマンスの両面で画期的な成果を達成しています。
- 最も幅広い言語に対応58万1000時間分のオープンソースデータで学習されたこのモデルは、600以上の言語に対応したゼロショット音声合成をサポートし、リソースの少ない、あまり一般的でない言語でも極めて低い単語誤り率を維持します。現在、最も幅広い言語をカバーするTTSモデルです。
- 極めて速い推論速度フルコードブックランダムマスキング戦略と効率的なアーキテクチャ設計を採用することで、RTF 0.025という低い推論速度を実現しました。これはリアルタイムの40倍の速さであり、自己回帰モデルを大幅に上回る性能です。
- 音質と明瞭度:SOTALLMを活用して事前学習済みの言語知識を初期化および継承することで、LibriSpeech-PCやSeed-TTSなどのベンチマークテストにおいて、話者類似性(SIM-o)と明瞭度(WER)が既存の非自己回帰モデルや商用システムを上回る性能を発揮します。
- 多次元制御可能性ゼロサンプル音声クローニング、属性ベースの音色設計、ノイズ周波数によるノイズ低減、二次音声記号(笑い声/ため息)の挿入、ピンイン/音素レベルの発音補正などをサポートし、複雑なシナリオにおけるきめ細かな制御要件を満たします。
OmniVoiceプロジェクトの住所
- GitHubリポジトリ:https://github.com/k2-fsa/OmniVoice
- ハギングフェイスモデルライブラリ:https://huggingface.co/k2-fsa/OmniVoice
- arXiv技術論文:https://arxiv.org/pdf/2604.00688
- オンラインでデモを体験してください:https://huggingface.co/spaces/k2-fsa/OmniVoice
OmniVoiceと類似の競合製品との比較
| 寸法 | OmniVoice | ElevenLabs v2 | MiniMax-Speech |
|---|---|---|---|
| 言語対応範囲 | 600以上の言語 (リソースの少ない言語が多数含まれています) |
約29の主要言語 | 約24言語 |
| 建築タイプ | 非自己回帰拡散モデル (単一段階ミニマリズム) |
自己回帰型/ハイブリッド型 (ブラックボックスアーキテクチャ) |
帰還以来 |
| パラメータ | 0.8B | 非公開 | 非公開 |
| 推論速度 | RTF 0.025 (40倍速リアルタイム/ローカル) |
もっとゆっくり (クラウドAPIへの依存) |
中くらい (クラウドAPIへの依存関係) |
| ゼロサンプルクローニング | サポート (3~10秒/600以上の言語に対応) |
サポート (リアルタイム/29言語) |
サポート |
| 制御可能な機能 | サウンドデザイン/ノイズリダクション/ 副言語学/発音矯正 |
基本的なクローン作成 + 感情のコントロール |
基本的なクローン作成 |
OmniVoiceのアプリケーションシナリオ
- 多言語コンテンツのローカライズクリエイターは、OmniVoiceの600以上の言語対応機能を利用して、ポッドキャスト、オーディオブック、教育コース、その他のコンテンツをさまざまな言語バージョンにすばやく変換できます。しかも、ゼロサンプルクローニングによって元の話者の音色の一貫性を維持できます。
- ゲームと映画の吹き替えゲーム開発者や制作会社は、音声クローニング技術を利用したり、特定の声をデザインしたりすることで、キャラクターに多様な声を与えることができる。
- インテリジェントな顧客サービスとアシスタント企業はOmniVoiceを導入することで、多言語対応のインテリジェントな顧客サービスシステムを構築したり、サンプルを一切使用せずに特定のブランドアンバサダーの声を複製したり、音声デザインを通じてブランドイメージに合ったカスタム音声アシスタントを生成したりすることができます。
- 教育と語学学習教育機関は、ピンイン/音素レベルの発音訂正機能を通して、学習者が中国語の多声文字や英語の固有名詞の正確な発音を習得するのに役立つ、希少な言語学習教材を開発することができる。