AB
AiBoss
project

CosyVoice - アリババのオープンソース大規模音声生成モデル

CosyVoiceは、アリババ傘下のTongyi Labがオープンソース化した大規模な自然音声合成モデルです。中国語、英語、日本語、広東語、韓国語の5言語に対応しており、わずか3秒から10秒の音声サンプルで、イントネーションや感情表現を含む音色を忠実に再現できます。

CosyVoiceとは何ですか?

CosyVoiceは、アリババ傘下のTongyi Labがオープンソース化した大規模な自然音声合成モデルです。中国語、英語、日本語、広東語、韓国語の5言語に対応し、わずか3~10秒の音声サンプルで、イントネーションや感情表現など、類似した音色を再現できます。また、複数の言語間で音声合成が可能です。このモデルの特長は、豊富なテキストや自然言語入力によって、音声の感情やリズムをきめ細かく制御できる点にあります。これにより、合成音声は従来のモデルをはるかに凌駕する、リアルで感情豊かなものとなります。音声放送、オーディオブック、音声対話など、幅広い分野で活用されており、ユーザーに高度にパーソナライズされた感情豊かな音声体験を提供します。

CosyVoice 2.0は、アリババ同義研究所が発表した音声生成モデル「CosyVoice」のアップグレード版です。このモデルは、有限スカラー量子化技術を用いてコードブックの利用効率を向上させ、テキスト音声言語モデルのアーキテクチャを簡素化し、ブロック認識型因果フローマッチングモデルを導入することで、多様な合成シナリオに対応しています。CosyVoice 2は、発音精度、音色の一貫性、韻律、音質が大幅に向上し、MOSスコアは5.4から5.53に上昇しました。ストリーミング推論に対応し、最初のパケット合成遅延を150msに大幅に短縮することで、リアルタイム音声合成シナリオにも適しています。

CosyVoice 3は、音声に感情と表現力をより豊かにするために全面的にアップグレードされました。音声クローニングと音声合成を統合し、わずか3秒の音声サンプルでユーザーの音色、イントネーション、話し方の癖を正確に捉えます。ユーザーの声を使ってあらゆるテキストを読み上げる機能もサポートしています。CosyVoice 3は、中国語、英語、日本語を含む9つの言語に対応し、テキストやコマンドに基づいて「嬉しい」「悲しい」「怒っている」といった特定の感情を表す音声を生成することで、より生き生きとした表現力豊かな音声を実現します。CosyVoice 3はユーザーのアクセントを保持し、それをユーザーのデジタルアイデンティティの一部として残します。このモデルは現在、Alibaba CloudのBailianプラットフォームで利用可能です。

Tongyi Labsは最近、CosyVoice3をアップグレードし、初回パケット遅延を50%削減、中国語と英語が混在するテキストの精度を2倍に向上、9つの主要言語と18の方言アクセントをサポート、さらに言語間クローニングと感情制御機能など、いくつかの改良を加えました。また、Fun-CosyVoice3-0.5Bが正式にオープンソース化され、ゼロショット音声クローニング機能を提供しています。これにより、わずか3秒の録音時間で音声の複製と新しい音声の合成が可能になり、ローカル展開と二次開発もサポートされるため、開発者にとって強力な音声合成ツールとなります。

CosyVoiceの主な機能

  • 超低遅延ストリーミング音声合成双方向ストリーミング音声合成をサポートしており、最初のパケットの合成遅延は最大150msであるため、リアルタイムアプリケーションシナリオに適しています。
  • 非常に正確な発音以前のバージョンと比較して、発音エラー率が大幅に減少しました。特に、早口言葉、多声文字、珍しい文字の処理において顕著です。
  • 音色の一貫性ゼロサンプル音声合成および多言語音声合成において、音色の一貫性を高く維持することで、合成音声の自然さを向上させる。
  • 自然体験合成音声のリズム、音質、感情表現の一致性が向上し、MOSスコアも上昇し、市販の音声合成モデルのレベルに近づいています。
  • 多言語対応大規模な多言語データセットで学習を行い、言語横断的な音声合成機能を実現する。

CosyVoiceの技術原則

  • LLM backbone事前学習済みの大規模テキストベースモデル(Qwen2.5-0.5Bなど)に基づいて、元のテキストエンコーダー+ランダムトランスフォーマー構造を置き換えて、テキストのセマンティックモデリングを実行します。
  • FSQ Speech Tokenizerベクトル量子化(VQ)をフルスケール量子化(FSQ)に置き換えることで、より大きなコードブック(6561)を学習させ、100%の活性化率を達成し、発音精度を向上させます。
  • オフラインとストリーミングを統合したモデリングソリューション我々は、LLMとFMの両方がストリーミング推論をサポートし、最初のパケットオーディオの高速合成を実現する統合モデリング方式を提案する。
  • コマンド制御による音声生成機能のアップグレード基本モデルと指示モデルの統合を最適化し、感情、話し方、きめ細かな制御指示をサポートし、中国語の指示処理機能を追加します。
  • マルチモーダル大型モデル技術マルチモーダル大規模モデル技術に基づき、音声認識、音声合成、自然言語理解などのAI技術を実現し、「聞くことができ、話すことができ、理解することができる」という、インテリジェントな人間とコンピュータのインタラクション体験を提供します。

CosyVoiceプロジェクトのアドレス

CosyVoiceの応用事例

  • スマートアシスタントとチャットボットインテリジェントアシスタントやチャットボット向けに、自然で流暢な音声出力を提供し、ユーザーエクスペリエンスを向上させます。
  • オーディオブックとオーディオブック高品質なオーディオブックを生成し、複数の言語や方言に対応し、様々なユーザーのニーズを満たします。
  • 動画の吹き替えとナレーション当社は、教育ビデオ、企業プロモーションビデオ、映画やテレビシリーズの吹き替えなど、ビデオコンテンツ向けのナレーションサービスを提供しています。
  • カスタマーサービスおよびコールセンター顧客サービスにおいて音声による対話機能を提供することで、サービス効率と顧客満足度を向上させる。
  • 言語学習と教育標準的な発音例を提供することで、学習者が発音の正確性を向上させるのを支援し、言語学習を促進します。