project
Realtime TTS-2 - Inworld AIが発表したリアルタイム音声合成モデル
Realtime TTS-2は、Inworld AIが開発した次世代リアルタイム音声合成モデルで、特に会話型AIシナリオ向けに設計されています。このモデルはテキストを自然な音声に変換できるだけでなく、さらに重要なことに、会話の文脈における音声の感情、トーンなどを「理解」することができます。
Realtime TTS-2とは何ですか?
Realtime TTS-2は、Inworld AIが開発した次世代リアルタイム音声合成モデルで、特に会話型AIシナリオ向けに設計されています。このモデルは、テキストを自然な音声に変換できるだけでなく、会話の文脈における音声の感情、トーン、リズムを「理解」し、複数ターンにわたる知覚的な音声合成を可能にします。Realtime TTS-2は、100以上の言語のクロス言語切り替えと、自然言語による音声方向制御(例:...)をサポートしています。 、 さらに、テキストによる説明から直接仮想サウンドを設計でき、リアルタイムストリーミング並みの低遅延を実現します。
Realtime TTS-2の主な機能
- 音声演出自然言語による説明(例:「疲れているけれど温かい、まるで家に帰ってきたばかりのよう」)またはインラインタグ(例:)を通して 、 固定された感情の列挙を必要とせず、話し方の感情、速度、スタイルについてリアルタイムでガイダンスを提供する。
- 会話認識このモデルは、過去の会話の実際の音声(単なるテキストの書き起こしではない)を入力として受け取り、ユーザーの口調に基づいて応答を自動的に調整します。例えば、同じ文章でも、冗談を言った後はより明るい調子になり、悪い知らせを聞いた後はより深刻で慎重な調子になります。
- 言語間の一貫性単一の音声識別子を100以上の言語で一貫して維持できるため、言語ごとに異なる音声ライブラリを管理する必要なく、同じ文の中で中国語、英語、スペイン語、日本語などの言語をシームレスに切り替えることができます。
- 高度な音声設計参照音声を用意する必要なく、テキストによる説明(例:「温かみのある低音で、ややかすれのある30代後半の女性の声」)を使用して、独自のサウンドを生成して保存できます。
リアルタイムTTS-2の技術原理
- エンドツーエンドの統合アーキテクチャこの技術は、「聞く・考える・表現する」という3つの段階を、単一の永続的なつながりに統合します。従来の音声合成(TTS)は単一の文を単独で生成するのに対し、このモデルは複数ターンの対話という完全な音声コンテキストの中で学習されるため、音色、トーン、感情状態が対話の流れに合わせて自動的に継続されます。
- 複数ターン音声認識メカニズム(会話認識)このシステムは、過去の会話の音声データ(テキストの書き起こしだけでなく)を入力として受け取り、ユーザーの声のトーンや感情に基づいて応答を自動的に調整します。同じ文章でも、会話の文脈によって異なる音声表現が生まれます。
- トークンレベルのストリーミングオーディオ生成SSE(Server-Sent Events)ストリーミングとトークンレベルの音声出力に対応し、低遅延のリアルタイム対話を実現します。対話シナリオに最適化されており、音声アシスタント、ゲームNPCなどのリアルタイムインタラクションのニーズを満たします。
- 音声方向制御(自然言語)これは、自然言語による説明(「疲れているけれど温かい、まるで家に帰ってきたばかりのようだ」など)を通して音声生成を誘導し、固定された感情列挙を必要とせずに、感情、話速、スタイルをリアルタイムで調整するためのインラインタグ([笑う]、[呼吸する]、[ため息をつく]など)をサポートしています。
- 言語間の一貫性を保つための技術単一の音声識別子を100以上の言語で一貫して維持できるため、言語ごとに異なる音声ライブラリを管理する必要なく、同じ文の中で複数の言語をシームレスに切り替えることができます。
- 高度な音声指紋設計テキストによる説明のみでカスタムサウンドを生成・保存できるため、参照音声は不要で、サンプルを一切使用せずにボイスプリントを設計できます。安定性モード(表現力豊か/バランスの取れた/安定)もサポートされています。
Realtime TTS-2の使い方
- インワールドAPI経由で呼び出しInworld AIアカウントを登録後、リクエストでモデル識別子としてRealtime TTS-2を指定すると、RESTまたはRealtime APIを介してテキストと音声の方向コマンドを送信することで音声を生成できます。
- リアルタイムセッションとの統合リアルタイムセッションでは、システムはユーザーの音声履歴をコンテキストとして自動的に渡すため、開発者は同じセッション接続を維持するだけでよく、prior_audioフィールドを手動で連結する必要はありません。
- サウンドクローニングとデザイン: オリジナルのリファレンスオーディオを使用してサウンドを再クローンして最適な忠実度を維持するか、テキストプロンプトから直接新しいサウンドを作成し、安定性モード(表現力豊か/バランスが取れている/安定している)を選択します。
リアルタイムTTS-2の主要情報と使用要件
- 製品名:Inworld Realtime TTS-2
- 出版社:Inworld AI
- 製品ポジショニングリアルタイム対話音声合成モデル
- 対応言語100以上の言語に対応し、文中で言語を切り替えることができます。
- レイテンシー性能リアルタイムストリーミング、最初のトークンの低遅延
- アクセス方法:Inworld API / Inworld Realtime API / Node & Python SDK
- 価格設定価格はInworldの公式価格に基づいています(詳細はinworld.ai/pricingをご覧ください)。
- 互換性 OpenAI Realtimeプロトコルをサポートしており、既存のOpenAI RealtimeクライアントはURLを変更するだけで簡単に接続できます。
Realtime TTS-2の主な利点
- 文脈を考慮した表現AI音声は、複数の音声コンテキストに基づいて声のトーンを動的に調整するため、単一の文を機械的につなぎ合わせるのではなく、真の会話の一貫性を実現できる。
- ディレクターレベルの音声制御自然言語によるプロンプトは、感情や表現スタイルを細かく調整できるだけでなく、インラインの非言語的マーカー(ため息、笑い声、呼吸音など)にも対応しているため、固定された感情スライダーよりもはるかに表現力豊かです。
- 言語を跨いだ音色の統一同一の仮想キャラクターが、グローバルな多言語環境において完全に一貫した音声アイデンティティを維持することで、多言語コンテンツの制作コストを大幅に削減します。
- 低遅延リアルタイムストリーミング対話シナリオに最適化されており、SSEストリーミングをサポートすることで、音声アシスタント、ゲームNPC、その他のアプリケーションのリアルタイムな対話ニーズに対応します。
- ゼロサンプル音声プリント設計声優の音声を収集する必要はありません。テキストによる説明だけで、極めて低い反復コストでプロレベルのキャラクターボイスを生成できます。
リアルタイムTTS2プロジェクトの住所
- プロジェクト公式サイト:https://inworld.ai/blog/realtime-tts-2
Realtime TTS-2と類似の競合製品との比較
| 比較対象寸法 | Inworld Realtime TTS-2 | ElevenLabs | OpenAI GPT-4o Audio |
|---|---|---|---|
| 音声品質(人工知能による分析ランキング) | #1 | #3 | #5 |
| 自然な会話表現 | 不明 | ||
| リアルタイム低遅延 | 不明 | 不明 | |
| 会話認識 | |||
| 自然言語音声方向制御 | |||
| サウンドクローニング | 不明 | ||
| テキストの説明で音が鳴る | |||
| 100以上の言語で統一された音色 | |||
| ユーザーの声プロファイル認識 | |||
| 単一のカスタマイズ可能な音声API | |||
| OpenAI Realtimeプロトコルに対応 | (オリジナル) |
リアルタイムTTS-2の応用シナリオ
- AIゲームNPCこの機能により、ゲームキャラクターはプレイヤーの感情を感知し、リアルタイムで反応できる音声を持つことができ、NPCが会話の状況に応じて自然に声のトーンを変えることが可能になり、没入感とインタラクションのリアリティが大幅に向上します。
- インテリジェントな顧客サービスと音声アシスタントこのシステムは、ユーザーの口調に基づいて応答戦略を自動的に調整し、苦情をなだめる際には低く慎重な口調を、成功を祝う際には明るく熱意のある口調を用いることで、真に人間味のあるサービス体験を実現します。
- 多言語教育指導同じ仮想外国人教師の声を、中国語、英語、日本語を含む100以上の言語間でシームレスに切り替えることができ、学習者は声の同一性に対する親しみやすさを維持しつつ、多言語学習における認知的な切り替えコストを削減できます。
- バーチャルアンカーと音声コンテンツテキストプロンプトを使用して、異なるキャラクターボイスを一括生成し、感情豊かな長文ナレーションをサポートし、実際の声優を必要とせずに高品質のオーディオコンテンツを迅速に作成します。