project
ViiTorVoice - Cloud Curvatureが開発したAI搭載音声合成モデル
Cloudwise社が開発したViiTorVoiceは、部分編集をサポートする世界初のAI音声合成モデルであり、Seed-TTSの権威ある評価リストでトップに輝いています。NAR(非自己回帰型)アーキテクチャを採用することで、Word文書を編集するのと同じくらい簡単に音声編集が可能です。
ViiTorVoiceとは何ですか?
Cloudwiseが開発したViiTorVoiceは、部分編集をサポートする世界初のAI音声合成モデルであり、Seed-TTSの権威ある評価リストでトップに輝いています。NAR(非自己回帰)アーキテクチャを採用することで、「Word編集のような音声編集」を実現。音声内の単語やセグメントを選択的に置き換えながら、音色、リズム、感情表現を完全に維持できます。テキスト不要の多言語クローン、高精度な感情制御、そして60msという超低遅延推論に対応しています。10億パラメータのモデルはオープンソースです。
ViiTorVoiceの主な機能
-
フラグメントレベルのローカル編集: 音声内の単語やセグメントを置き換え、残りの部分は完全に変更せずに残すことができます。
-
音声クローンゼロショット方式の言語間クローンに対応。プレーンな音声ファイルをアップロードするだけで、音色を抽出できます。
-
感情と非言語的制御特殊なトークンを挿入することで、単語レベルでの精密な制御が実現され、CFG技術を導入することで感情表現が強化される。
-
低遅延推論エンドツーエンドの初回フレーム生成時間は60ms未満であり、初回ブロック推論がサポートされています。
-
多言語対応中国語、英語、日本語、韓国語など、複数の言語でコンテンツを生成できます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
ViiTorVoiceの使い方
-
デモページをご覧くださいHugging Faceのオンライン体験ページ(https://huggingface.co/spaces/ZzWater/ViiTorVoice)を開いてください。
-
機能モードを選択インターフェース上部の「音声編集」タブと「音声クローン」タブを切り替えてください。
-
ソースオーディオをアップロード編集または複製したい元の音声ファイルを、左側の「ソース音声」アップロードエリアにドラッグしてください。
-
テキストコマンドを入力してください編集ボックスに元の書き起こしテキストと修正後のターゲットテキストを入力すると、システムが自動的に差分部分を特定します。
-
感情タグを挿入感情を制御するには、テキストに特別なトークンを挿入します(例:
<laugh>、<sigh>(サブ言語情報タグ) -
生成パラメータを調整する推論ステップ数(4ステップまたは8ステップ)やその他の設定を行い、生成ボタンをクリックしてモデルの処理が完了するまで待ちます。
-
プレビューとダウンロード右側の「編集済み音声」エリアで音声を再生し、内容が正しいことを確認したら、ダウンロードしてローカルデバイスに保存してください。
ViiTorVoiceの主な利点
-
評価結果で世界一Seed-TTSは、英語の単語誤り率が1.32、中国語の単語誤り率が0.99であり、SIM-oとUTMOSの両方を上回っている。
-
独自のローカル編集機能これは業界で唯一、セグメントレベルでのターゲット編集をサポートする技術であり、単語を変更する際にセグメント全体を再録音する必要があるという従来の音声合成の問題点を解決します。
-
テキスト不要の依存関係クローン正確なテキスト転写を必要とせずに言語間の音色転送を実現でき、少数言語の場面にも適している。
-
スピード推論最初のフレームの遅延は60ms未満で、業界平均の150~200msをはるかに上回っています。
ViiTorVoiceプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/viitor-ai/viitor-voice-nar
- ハギングフェイスモデルライブラリ:https://huggingface.co/ZzWater/ViiTorVoice-NAR
ViiTorVoiceと類似製品との比較
| 比較対象寸法 | ViiTorVoice | Qwen3-TTS |
|---|---|---|
| 研究開発 | 雲の曲率 | アリババ同義研究所 |
| コアアーキテクチャ | NAR 非自己回帰(穴埋め問題) | AR自己回帰(フレームごとの連鎖生成) |
| 部分的な編集 | フラグメントレベルの標的修飾をサポート単語だけを変更し、段落全体は変更しない | サポートされていません単語一つを変更するだけでも、段落全体を再生成する必要がある。 |
| Seed-TTS English WER | 1.32(数値が低いほど精度が高い) | 1.54 |
| Seed-TTS 中国語 WER | 0.99(業界初、1.0未満) | 1.15 |
| 最初のフレーム遅延 | <60ms | ~150-200ms |
| テキストクローンなし | 純粋な音声のみを使用した言語間クローニング | 音声データと正確な文字起こしテキストが必要です。 |
| 感情のコントロール | 単語レベルでの正確なトークン制御(笑い声/ため息など) | 基本的な自然言語記述制御 |
ViiTorVoiceの応用事例
- 映画・テレビのポストプロダクションセリフの調整には、俳優を録音スタジオに呼び戻す必要はありません。監督は、音色や呼吸のリズムを途切れることなく維持したまま、非線形なタイムライン上でリアルタイムにセリフを差し替えることができます。
- オーディオブックとポッドキャスト録音中に言い間違いや固有名詞の誤りがあった場合でも、1~2秒の音声を修正するだけで済み、章全体を録り直す必要はありません。ポストプロダクションにおける音声編集時間は、数日から数十分へと短縮されました。
- 海外市場向け短編ドラマのローカライズ声優を再編成する必要はありません。元の録音の特定の単語を置き換えるだけで、それぞれが元のパフォーマンスのように聞こえる多言語版を作成できます。
- 広告とマーケティング商品名やスローガンを一時的に変更する場合は、元のブランドイメージや感情的な訴求力を維持するために、音声部分を部分的に直接置き換えるようにしてください。
- ゲーム音声演技多言語対応のキャラクター音声クローン:キャラクターのオリジナル音声をアップロードするだけで、中国語、英語、日本語、韓国語など、複数の言語で音声を生成できます。