AB
AiBoss
チュートリアル

ViiTorVoice-NARの実地テスト - オープンソースで無料の音声クローンツール

今日は、音声複製に適したいくつかのことを共有します。正直なところ、現在AI音声作業で最も面倒なのは、生成された音声の単語を数語だけ変更したい場合でも、録音し直し、セリフを録り直し、編集し直さなければならないことです。

今日は、音響再生に適したいくつかのアイテムをご紹介します。

正直に言うと、今やるのは AI 音声編集で最も厄介なのは、生成された音声の中のほんの数語だけを変更したいのに、録音し直し、セリフを録り直し、編集し直さなければならないことだ。

本日GitHubで公開されたViiTorVoice-NARプロジェクトは、まさにこのシナリオに最適です。オリジナルの音声クリップとそれに対応するテキストがあれば、声の雰囲気、トーン、リズムといった本来の要素を損なうことなく、その一部を直接変更することができます。

ViiTorVoice-NARはviitor-aiです オープンソース非自己回帰型音声生成システムは、主に音声クローン作成、局所的な音声編集、感情制御、および副言語制御のために設計されている。

プロジェクトのアドレス: https://github.com/viitor-ai/viitor-voice-nar

ViiTorVoice-NARの核心的なアイデアは、音声生成をトークンごとの連鎖から、離散的な音声トークン充填方式に変更することです。

従来の自己回帰型TTSは、多くの場合、音声トークンを順次生成し、前のトークンが完成してからでないと次のトークンを生成できません。一方、ViiTorVoice-NARは、マスク言語モデルを使用して、離散的なコードブック空間でマスクされた音声セグメントを完成させます。

この構造は、部分的な音声編集に最適です。例えば、文中の「Friday」を「Monday」に変更する場合、変更された部分を特定して再結合するだけで済み、音声セグメント全体を再生成する必要はありません。

ViiTorVoice-NAR のコア機能:

  • 音声クローン:プロンプト音声を入力すると、モデルはターゲットテキストに対応する音声を生成し、プロンプト音声中の話者の音色を維持しようとします。
  • ローカル音声編集:元の音声、元のテキスト、編集後の全文テキストを入力します。システムはまずテキストの差分を計算し、次に強制アライメントの結果を組み合わせて置換が必要な音声領域を特定し、最後にその小さな音声セグメントのみを再構成します。
  • 感情および非言語的制御:気分、笑い、間、トーンなどの感情または非言語的タグをテキスト条件に挿入できます。
  • 低遅延推論:本プロジェクトは、ファーストブロック推論モードをサポートしています。モデルは最初のオーディオトークンを最初に生成することで、最初のフレームの遅延を短縮できます。

このプロジェクトには、Git、UV、およびNVIDIAグラフィックカードが必要です。8GBのVRAMで十分ですが、12GBあればよりスムーズな動作が得られます。

環境設定が完了したら、プロジェクトを英語のパスにクローンするだけです。

1 cd D:\ 2 git clone https://github.com/viitor-ai/viitor-voice-nar.git viitor-voice-nar 3 cd D:\viitor-voice-nar

次に、Python 3.12の仮想環境を作成し、依存関係をインストールします。

1 uv venv --python 3.12 2 uv pip install --python .venv\Scripts\python.exe -r requirements-grpc.txt 3 uv pip install --python .venv\Scripts\python.exe -r requirements-alone.txt 4 uv pip install --python .venv\Scripts\python.exe protobuf==4.25.3

モデルをダウンロードしてください。サイズは10GB以上ありますので、十分な空き容量を確保してください。

1 New-Item -ItemType Directory -Force local_models 2 $env:PYTHONIOENCODING="utf-8" 3 .venv\Scripts\hf.exe download ZzWater/ViiTorVoice-NAR --local-dir local_models

最後に、起動後に使用を開始できます。

1 cd D:\viitor-voice-nar 2 .\run_grpc_v2.ps1 start all -- --no-warmup

事例1:音声クローン

1 Copy-Item "被克隆的语音位置" "D:\viitor-voice-nar\input_voice_clone.mp3" -Force
2 
3 curl.exe -X POST http://127.0.0.1:7861/v1/voice-clone `
4 -F "ref_audio=@D:\viitor-voice-nar\input_voice_clone.mp3" `
5 -F "text=你好,这是一次语音克隆测试。" `
6 -F "language=zh" `
7 -F "allow_missing_ref_text=true" `
8 -F "output_format=wav" `
9 -F "num_steps=32" `
10 --output "语音克隆输出位置" `
11 --write-out "HTTP %{http_code} size %{size_download}`n"

オリジナル版:

このクローンは、音色が似ているだけでなく、ラップっぽい雰囲気も少し持っていることがわかる。

ケース2:部分的な単語の変更

1 Copy-Item "被克隆的语音位置""D:\viitor-voice-nar\input_liziming.mp3" -Force 2 3 curl.exe -X POST http://127.0.0.1:7861/v1/text-local-edit ` 4 -F "source_audio=@D:\viitor-voice-nar\input_liziming.mp3" ` 5 -F "original_text=请注意三年六班李子明,李子明同学,你妈妈拿了两罐旺仔牛奶要给你。" ` 6 -F "edited_text=请注意三年六班克劳德,克劳德同学,你妈妈拿了两份迪普斯科要给你。" ` 7 -F "language=zh" ` 8 -F "input_format=wav" ` 9 -F "output_format=wav" ` 10 -F "align_granularity=word" ` 11 -F "expand_mask_ratio=1.5" ` 12 -F "num_steps=32" ` 13 --output "语音克隆输出的位置" ` 14 --write-out "HTTP %{http_code} size %{size_download}`n"

オリジナル版:

修正が必要な箇所を除けば、基本的に他の箇所に変更はなかった。

ケース3:感情制御

1 Copy-Item "被克隆的语音位置""D:\viitor-voice-nar\input_sad_ref.wav" -Force 2 3 $Text = "你好,这是一次悲伤情绪的语音生成测试。" 4 5 curl.exe -X POST http://127.0.0.1:7861/v1/voice-clone ` 6 -F "ref_audio=@D:\viitor-voice-nar\input_sad_ref.wav" ` 7 --form-string"text=<|emotion-sad|>$Text" ` 8 -F "language=zh" ` 9 -F "allow_missing_ref_text=true" ` 10 -F "emotion_guidance_scale=6.0" ` 11 -F "nvv_guidance_scale=2.0" ` 12 -F "output_format=wav" ` 13 -F "num_steps=32" ` 14 --output "语音克隆输出的位置" ` 15 --write-out "HTTP %{http_code} size %{size_download}`n"

オリジナル版:

感情表現は完璧で、感情の変化に伴って音色も変わらなかった。

AI ナレーション作業は、コンテンツ制作において最も時間と費用のかかる工程、つまり編集作業へと移行する。

Monotype社は2025年に1,008人のクリエイティブ専門家を対象に調査を行い、クリエイティブチームの57%が、アセット管理、コンプライアンスチェック、プロセスのボトルネックなど、クリエイティブ以外の業務に毎週4分の1以上の時間を費やしていることを発見した。

短い動画のナレーション、広告素材、コースのナレーション、ゲームのナレーション、顧客サービスのアナウンスなどは、多くの場合、人名、日付、ブランド名、価格などを変更するだけで済みますが、従来の方法では、再録音、再編集、再確認が必要となります。

ViiTorVoice-NARの音声クローン機能は新しいコンテンツの生成を担当し、ローカル音声編集機能は古い音声のいくつかの単語の変更を担当し、感情制御機能は音色の変化を追加することで再設計を容易にします。

節約できるのは吹き替え料金だけではなく、やり取りにかかる時間、スケジュール調整の待ち時間、そして何度も繰り返す編集作業の時間も含まれる。

個人クリエイターは音声制作や脚本の修正に利用でき、企業は社内ナレーションツールとして利用したり、ライセンス取得済みの音源を活用した低コストの制作プロセスを構築したりすることができる。

AI 音声技術が本格的に実用化される際には、初回から素晴らしいものを作り出すことではなく、毎回修正回数を最小限に抑えることが重要となる。

元のリンク:GitHubで評価の低いgem無料音響再生プロジェクト