project
TicVoice 7.0 - Mobvoiの第7世代音声合成エンジン
TicVoice 7.0は、Mobvoiの第7世代高品質TTS(テキスト読み上げ)エンジンで、次世代音声生成モデルであるSpark-TTSをベースにしています。TicVoice 7.0は、革新的なBiCodecエンコーディング方式を使用して音声をセグメント化します。
TicVoice 7.0とは何ですか?
TicVoice 7.0は、次世代Spark-TTS音声生成モデルをベースにした、Mobvoiの第7世代高品質TTS(テキスト読み上げ)エンジンです。TicVoice 7.0は、革新的なBiCodecエンコーディング方式を採用し、音声をグローバルトークンとセマンティックトークンに分解することで、音色と意味を正確に制御し、テキストLLM構造との高い一貫性を維持します。このエンジンは、3秒の音声クローン機能を備え、複数の役割、複数の感情、あらゆる年齢層、中国語/英語の切り替えに対応し、放送品質に近い自然で流暢な音声を提供します。TicVoice 7.0は、Mobvoi Workshopの「3秒音声クローン」機能で既に利用可能で、インテリジェントカスタマーサービス、オーディオブック、映画の吹き替えなど幅広い分野に適用でき、ユーザーに究極のAI吹き替え体験を提供します。
TicVoice 7.0の主な機能
- 3秒間の音声クローンユーザーの声紋を3秒で取得し、個々の声のトーンを正確に再現し、低品質の音声入力にも対応します。
- パフォーマンスにおける複数の役割と複数の感情喜び、怒り、悲しみなど、さまざまな感情のシミュレーションをサポートし、コンテンツの表現力を高めます。
- あらゆる年齢層向けの音声適応子供から高齢者まで、幅広い音を網羅しており、さまざまな場面のニーズに対応します。
- 中国語と英語を柔軟に切り替え可能中国語と英語の混合音声合成をサポートし、多言語コンテンツの作成を容易にします。
- 放送品質の音声合成音声は明瞭で流暢、自然で聞き心地が良く、力強い音色と感情表現を備えており、プロの放送レベルに匹敵する。
- カスタマイズされた専用音声ユーザーは、個々の吹き替えニーズに合わせて、自分の声をカスタマイズできます。
TicVoice 7.0の技術的原則
- 革新的な音声符号化方式BiCodec技術に基づき、音声はグローバルトークン(音色などのグローバルな特徴)とセマンティックトークン(意味的に関連する特徴、50トークン/秒)に分解され、グローバルな制御性と意味的な関連性のバランスが取られます。これにより、セマンティックトークンによる音色の正確な制御の難しさや、音響符号化における複数のコードブックへの依存など、従来の音声符号化の問題点が解決されます。
- テキストLLM構造と統合Qwen2.5のアーキテクチャを再利用し、属性ラベル(性別、基本周波数レベルなど)と詳細な属性値(正確な基本周波数など)に基づいて、テキスト+属性ラベルを入力として、詳細な属性値→グローバルトークン→セマンティックトークンを順次予測します。これにより、音声トークンモデリングとテキストトークンモデリングの間で高い一貫性を実現します。
- 単段、単流生成TTS生成は、追加の生成モデルを必要とせず、言語モデル(シーケンスモンキー)を使用して単一ステージ、単一ストリーム方式で実現されるため、生成効率と制御性が向上します。
- 深層学習に基づく音声合成深層学習技術に基づき、大量の音声データを用いてモデルを訓練することで、自然で流暢な音声合成効果を実現した。
TicVoice 7.0プロジェクトのアドレス
- プロジェクト公式サイトマジックサウンドワークショップ
TicVoice 7.0のアプリケーションシナリオ
- インテリジェントな顧客サービスオンライン顧客サービスシステムに、自然で流暢な音声対話機能を提供し、ユーザーエクスペリエンスの向上と人件費の削減を実現します。
- オーディオブックとポッドキャスト高品質なオーディオブックやポッドキャストを迅速に生成でき、複数のキャラクターや感情表現をサポートし、リスナーの没入感を高めることができます。
- 映画やテレビの吹き替えとナレーション映画や短編動画の吹き替えやナレーション作業を効率的に完了させ、多言語切り替えに対応し、制作コストを削減します。
- 感情を揺さぶるライブ配信とインタラクションライブ配信中にリアルな感情をシミュレートすることで、配信者と視聴者間のインタラクションが強化され、コンテンツの魅力が増す。
- 教育と訓練オンライン教育プラットフォーム向けに鮮明な音声教材を提供し、多言語・多役割に対応することで、学習体験を向上させます。