project
SpeechGPT 2.0プレビュー - 復旦大学が開発したエンドツーエンドのリアルタイム音声対話モデル
SpeechGPT 2.0-previewは、復旦大学のOpenMOSSチームが開発した、人間のようなリアルタイム対話型システムです。数百万時間分の中国語音声データで学習されており、エンドツーエンドのアーキテクチャを採用し、音声とテキストのモダリティ間の高度な統合を実現しています。
SpeechGPT 2.0プレビューとは何ですか?
SpeechGPT 2.0-previewは、復旦大学のOpenMOSSチームが開発した、人間のようなリアルタイム対話システムです。数百万時間に及ぶ中国語音声データで学習されており、音声とテキストのモダリティ間の高度な統合を実現するためにエンドツーエンドのアーキテクチャを採用しています。このモデルは、人間のような話し方、ミリ秒単位の低遅延応答、そして自然で流暢なリアルタイムの中断型対話に対応しています。また、発話速度、感情、スタイル、音色を正確に制御し、インテリジェントな切り替えを実現します。SpeechGPT 2.0-previewは、詩の朗読、物語の語り、方言での会話など、多様な音声表現能力を備えています。
SpeechGPT 2.0プレビューの主な機能
-
感情とスタイルのコントロール優れたロールプレイング能力を備え、弱さや喜びといった複数の感情、男性の声と女性の声の切り替えといった複数の音色、詩の朗読や方言の模倣といった複数のスタイルを精密に制御できます。
-
リアルタイムでのやり取りを中断するミリ秒単位の応答速度により、自然な会話における即時の中断と再開が可能になります。
-
テキスト機能の統合音声の表現力を基盤としつつ、テキストモデルの知能を維持し、ツールへのアクセス、オンライン検索、外部知識ベースとの統合といった機能をサポートする。
-
マルチタスク対応長文ドキュメントの解析や複数ターンの対話といったシナリオにも対応でき、長いコンテキストを処理できる能力のおかげで、短いテキスト処理におけるパフォーマンスが低下することもありません。
音声技術原理GPT 2.0プレビュー
- エンドツーエンドの音声モデリング
-
超低ビットレートストリーミング音声コーデック自社開発の超低ビットレートストリーミング音声コーデックは、24kHzの音声入力を処理し、音声を毎秒75トークンに圧縮し、ストリーミング入出力に対応し、200ms未満の遅延でリアルタイムの対話を実現します。
-
意味論的音響学的結合モデリングこれは、従来のカスケード接続されたASR(音声認識)モジュールやTTS(音声合成)モジュールを必要とせず、意味論的・音響的統合モデリングを通じて、音声入力を直接処理し、音声またはテキスト出力を生成します。
-
- 音声・テキストハイブリッドモデリング
-
Codec PatchifyCodec Patchify技術を用いて隣接するタイムステップの音声トークンを統合ベクトルに集約することで、音声シーケンスとテキストシーケンス間のモダリティの違いが効果的に低減され、クロスモーダルモデリングにおける競合問題が緩和されます。
-
多段階トレーニングプロセスこれには、モダリティ適応の事前学習、クロスモーダルな指示の微調整、および連鎖的なモダリティ微調整が含まれ、テキストと音声の両方の機能を考慮に入れ、音声機能を学習する際にモデルの知能が低下することを防ぎます。
-
-
音声テキストアライメントの事前学習音声とテキストのアライメントによる十分な事前学習を行うことで、モデルは音声速度調整データを必要とせずに音声速度を制御したり、馴染みのないキャラクターのトーンやスタイルを模倣したりするなど、音声スタイルの一般化を「獲得」することができる。
- モデルアーキテクチャ設計
-
音声とテキストの統合モデリング音声テキストLLMは、音声表現とテキスト表現を入力として受け取り、同時に出力します。LLMの隠れ状態は、音声とテキストの両方のデコードタスクに使用されます。
-
複数のデコーダを備えた自己回帰言語モデル複数のデコードヘッドを備えた自己回帰型言語モデルをパッチデコーダーとして設計しました。このモデルは、自己回帰的な方法で段階的にデコードを行い、一度に1つのタイムステップに対して複数のRVQコーデックトークンを生成し、音声を出力します。
-
SpeechGPT 2.0-preview のプロジェクトアドレス
- プロジェクト公式サイト:https://www.open-moss.com/cn/speechgpt2-preview/
- GitHubリポジトリ:https://github.com/OpenMOSS/SpeechGPT-2.0-preview
- ハギングフェイスモデルライブラリ:https://huggingface.co/fnlp/SpeechGPT-2.0-preview-7B
- オンラインでデモを体験してください:https://sp2.open-moss.com/
SpeechGPT 2.0プレビューの応用シナリオ
-
スマートアシスタントこれは、顧客サービス、教育、医療などの分野におけるインテリジェントアシスタントとして活用でき、リアルタイムの音声言語練習や感情的な支えといったサービスを提供することができる。
-
コンテンツ作成オーディオブック、詩の朗読、方言コンテンツなどを自動生成でき、マルチメディア制作のフォーマットを豊かにします。
-
アクセスしやすいコミュニケーション聴覚障害や言語障害のある方向けに、リアルタイムの音声認識およびテキスト合成サービスを提供します。