Voice Engine - OpenAIのAI搭載音声合成および音声クローンモデル
Voice Engineは、OpenAIが開発した最新のAI搭載音声合成・音声クローン技術です。15秒程度の短い音声サンプルとテキスト入力から、ほぼ自然な音声を生成できます。この技術は2022年から提供されています。
音声エンジンとは何ですか?
Voice Engineは、OpenAIの最新のAI搭載音声合成および音声クローン技術です。15秒程度の短い音声サンプルとテキスト入力から、ほぼ自然な音声を生成できます。2022年後半から開発が進められてきたこの技術は、OpenAIのテキスト読み上げAPIやChatGPTの音声機能に活用されています。Voice Engineは、子供や読み書きのできない人への読書支援、世界中の視聴者にコンテンツを届けるための翻訳、非言語コミュニケーションのサポート、患者の音声回復支援など、幅広い用途に利用できます。OpenAIは、この技術の安全な利用を確保するため、音声なりすましを防止する厳格な利用ポリシーを策定し、ウォーターマーク追跡を含む複数のセキュリティ対策を実施しています。
公式ブログ紹介:https://openai.com/blog/navigating-the-challenges-and-opportunities-of-synthetic-voices
音声エンジンのアプリケーションシナリオと事例
- 教育および読書支援音声エンジンは、子供や文字が読めない人にも自然な音声を提供することで、文章コンテンツへの理解と関心を高めるのに役立ちます。例えば、教育テクノロジー企業のAge of Learningは、この技術を用いて事前にスクリプト化された音声コンテンツを生成し、それをGPT-4と組み合わせることで、リアルタイムでパーソナライズされたインタラクティブな応答を作成し、生徒の学習体験を向上させています。
- コンテンツの翻訳とグローバル化Voice Engineは、動画やポッドキャストなどのコンテンツを、元の話者のアクセントを保持したままリスナーの母国語に翻訳することを可能にします。これにより、クリエイターや企業は、より本物らしく、共感を呼ぶ方法で世界中の視聴者にリーチできます。例えば、AIを活用したビジュアルストーリーテリングプラットフォームであるHeyGenは、動画翻訳にVoice Engineを使用しており、コンテンツが言語の壁を越え、より幅広い視聴者に届くようにしています。
- 遠隔地におけるサービス提供の改善ボイスエンジンは、地域言語でのサービス提供を通じて、遠隔地のコミュニティにおける健康相談などの重要なサービスを向上させることができます。Dimagi社は、ボイスエンジンとGPT-4を活用したツールを開発しており、地域医療従事者へのインタラクティブなフィードバックを提供することで、彼らのスキル向上を支援しています。
- 言語障害のある人々を支援するコミュニケーションに困難を抱える人々にとって、ボイスエンジンは、機械的な印象を与えない自然な音声を提供し、補助代替コミュニケーション(AAC)機器を介したコミュニケーションを可能にします。Livoxはこの技術を活用し、ユーザーに多言語で自然な音声を提供することで、より効果的な自己表現を支援しています。
- 患者の声を回復させる病気や神経系の問題で発話能力を失った患者にとって、ボイスエンジンは声を取り戻したり、再構築したりするのに役立ちます。例えば、ノーマン・プリンス神経科学研究所は、腫瘍や神経系の問題が原因で発話障害を抱える人々にボイスエンジンがどのように役立つかを研究しています。
Voice Engineからの音声サンプル
1. 音声翻訳
英語音声を参照してください
生成された中国語音声
2. 患者の声が回復した。
患者本人の声
リファレンスオーディオ
音声を生成する
Voice Engineの使い方
Voice Engineは現在、小規模なプレビュー段階にあり、広く公開されていません。OpenAIは、信頼できる少数のパートナー企業と非公開のテストを実施し、この技術の潜在的な用途をより深く理解するとともに、これらの小規模テストの結果と寄せられたフィードバックに基づいて、今後この技術をより広く展開する方法と、展開するかどうかを決定します。
そのため、Voice Engineは現在、一般向けのオンライン利用はできません。OpenAIは、この技術の普及にあたり、悪用される可能性のあるリスクを十分に考慮し、適切なセキュリティ対策と利用ポリシーを策定するなど、慎重なアプローチを採用しています。今後、OpenAIはテスト結果や社会発展のニーズに基づき、Voice Engineをより幅広いユーザーに提供するかどうかを決定する可能性があります。