AB
AiBoss
project

Breeze TTS 2 - BreezeBlueの次世代音声合成モデル

Breeze TTS 2は、BreezeBlueが開発した新世代の音声合成モデルです。自然言語によるゼロサンプル設計でキャラクターの音色を再現し、自然言語コマンドを用いて感情、話速、アクセントといったパフォーマンスの詳細を精密に制御できます。

Breeze TTS 2とは何ですか?

Breeze TTS 2は、BreezeBlue社が開発した次世代音声合成モデルです。自然言語を用いたゼロサンプル設計によるキャラクターボイスの作成に加え、感情、話速、アクセントといったパフォーマンスの詳細を自然言語コマンドで精密に制御できます。モデル側のレイテンシはわずか40msと非常に低く、音声設計、音声方向、レイテンシという3つの権威ある評価において世界第1位を獲得しています。50以上の言語に対応しています。

Breeze TTS 2の主な機能

  • トーンデザインあらかじめ用意された音声ライブラリに頼ることなく、年齢、気質、性格、その他の特徴を自然言語で記述することで、独自のキャラクターボイスをゼロから生成します。
  • 音声ガイダンス自然言語コマンドを使用して、キャラクターの声とアイデンティティの一貫性を維持しながら、感情、話速、アクセント、生理的状態、動的なパフォーマンスの変化を正確に制御します。
  • 超低遅延リアルタイム生成モデル側のファーストバイト遅延は40msと低く、リアルタイムの対話やインタラクションのニーズを満たすためにWebSocketストリーミングをサポートしています。
  • 多言語対応50以上の言語に対応し、多言語環境においても自然な音声、キャラクターの一貫性、パフォーマンス制御を維持します。

Breeze TTS 2 の技術的原理

  • 大規模言語モデルのパラダイム転換Breeze TTS 2はLLMの技術的アプローチを踏襲し、言語モデルの汎化能力、指示遵守能力、スケーリング法則を音声生成の分野に応用することで、音声モデルが複雑な文字設定や文脈を理解できるようにしています。
  • 長文の会話型データ戦略研究チームは、映画、テレビシリーズ、インタビュー、ポッドキャストなどから、登場人物の関係性、感情的な緊張感、会話のリズム、間合いの意図などに焦点を当てた、実際の長時間の対話データを収集しています。これにより、モデルは標準化されたテキストの読み上げではなく、人間が複雑なやり取りの中でどのように自己表現するかを学習することができます。
  • シナリオ駆動型評価システムの再構築学術的な基準がクリエイターの実際のニーズと乖離していることに気づいたチームは、音色デザインと音響演出という2つの主要な側面を中心に評価基準を再構築し、シーン間の役割の一貫性と継続的な変化への対応能力をモデルの反復の基礎として、対応する基準をオープンソース化した。
  • エンドツーエンドの統合アーキテクチャ音色設計、音響ガイダンス、低遅延ストリーミング生成を単一のモデルに統合し、統一された推論チェーンを通じてキャラクター生成、パフォーマンス制御、リアルタイム応答を実現することで、複数のモジュールを接合することによって生じる遅延や一貫性の損失を回避します。

Breeze TTS 2 の使い方

  • BreezeCreator Web版BreezeCreatorプラットフォームのウェブサイト(https://breezeblue.ai/app)にアクセスし、自然言語を使用してキャラクターの特徴を説明して独自の声をデザインし、その後、自然言語コマンドを使用して感情やパフォーマンスを調整して、オーディオコンテンツを直接生成します。
  • HTTP API呼び出しAPIキーを取得後、開発者は標準のHTTPインターフェースを通じてテキストと音色/パフォーマンスパラメータを送信することで、合成音声ファイルを取得できます。これは、コンテンツの一括制作に適しています。
  • WebSocketリアルタイムAPI永続的なWebSocket接続を確立し、リアルタイムでテキストを追加し、生のPCMオーディオをストリーミング配信します。仮想アンカー、ゲームNPC、AIエージェントなど、低遅延が求められるインタラクティブなシナリオに適しています。
  • SDK統合公式のJavaScript/TypeScript SDKを使用すれば、簡単に統合でき、わずか数行のコードでリアルタイムの音声会話の作成、対話のターン管理、音声再生が可能になります。

Breeze TTS 2の主な利点

  • ゼロサンプル音設計あらかじめ用意された音声ライブラリに頼ることなく、年齢、気質、性格、その他の特徴を自然言語で記述することで、独自のキャラクターボイスをゼロから生成します。
  • 自然言語音声ガイダンス自然言語コマンドを使用して、キャラクターの声とアイデンティティの一貫性を維持しながら、感情、話速、アクセント、生理的状態、動的なパフォーマンスの変化を正確に制御します。
  • 超低遅延リアルタイム生成モデル側のファーストバイト遅延はわずか40msで、TTS遅延ベンチマークにおいて世界第1位にランクインし、リアルタイムインタラクションの要件を満たしています。
  • 多言語における役割の一貫性50以上の言語に対応し、多言語環境においても自然な音声、キャラクターの一貫性、パフォーマンス制御を維持します。
  • 評価のあらゆる側面において主導的な役割を果たす音声デザイン、音声方向、遅延という3つの権威ある評価項目において、世界第1位にランクされています。

Breeze TTS 2 プロジェクト住所

  • プロジェクト公式サイト:https://breezeblue.ai/breeze-tts-2

Breeze TTS 2と類似の競合製品との比較

比較対象寸法 Breeze TTS 2 Eleven v3
トーンデザイン 自然言語を用いたゼロサンプルによるキャラクターボイスの作成、ボイスデザインベンチマーク 1位 プリセットのサウンドライブラリに頼ったり、オーディオサンプルのクローンをアップロードしたりする
音声ガイダンス 自然言語コマンドは複雑なパフォーマンス(感情、意図、生理的状態)を制御します。音声方向ベンチマーク 1位 基本的な感情ラベル(嬉しい/悲しいなど)の制御
レイテンシー性能 モデル側TTFB 40msAPI p50 約119ms、レイテンシベンチマーク 1位 v3のTTFBは約544msかかりますが、Flash v2.5はモデル側で50msかかりますが、画質が大幅に低下します。
API価格設定 100万文字あたり34ドル v3 Conversational 100万文字あたり50ドル
多言語の一貫性 50以上の言語に対応し、言語を問わずキャラクターの声と演技スタイルの一貫性を維持しています。 複数の言語に対応しているが、言語間の役割の一貫性は比較的低い。
テクニカルルート エンドツーエンドの統合モデルは、LLMの汎化能力を音声生成に転用する。 マルチモデル/マルチバージョン並列処理(v3/Flash/会話型)

Breeze TTS 2の応用シナリオ

  • バーチャルアンカーとAIライブストリーミングAIアンカーは、視聴者のコメントに基づいてリアルタイムで口調やパフォーマンスを調整し、1回のライブ配信は1~2時間続くこともあり、これまでに数百回のライブ配信が完了している。
  • ゲームのNPCとロールプレイングゲーム内の数千ものNPCにそれぞれ独自の音声を生成し、リアルタイムの対話や感情の変化をサポートすることで、没入感を高めます。
  • 音声コンテンツとラジオドラマクリエイターたちは自然言語を用いて複数のキャラクターの声をデザインし、長編ラジオドラマ(例えばファンが制作した「三体」など)を制作する。これらの作品は公開初日から人気を博す。
  • AIエージェントとインテリジェントカスタマーサービス低遅延のリアルタイム音声対話により、AIエージェントは進捗状況を積極的に報告し、中断を受け入れ、ユーザーの意図を理解し、共同作業を継続することが可能になります。
  • インタラクティブなエンターテイメントとバーチャルな交流これにより、仮想キャラクターやAIコンパニオンに独自の音声アイデンティティが与えられ、長期にわたる役割に基づいた感情的な交流や物語体験が促進されます。