project
Spirit LM - Metaは、音声とテキストをシームレスに統合するマルチモーダル言語モデルを導入しています。
Spirit LMは、Meta AIチームが開発したマルチモーダル言語モデルで、テキストデータと音声データをシームレスに融合します。Spirit LMは、事前学習済みのテキスト言語モデルをベースに、テキストと音声のユニットで継続的に学習されています。
Spirit LMとは何ですか?
Meta AIチームが開発したSpirit LMは、テキストと音声データをシームレスに融合するマルチモーダル言語モデルです。事前学習済みのテキスト言語モデルをベースに、テキストと音声ユニットの継続的な学習を通じて音声モダリティへと拡張されています。このモデルにはBASEとEXPRESSIVEの2つのバージョンがあります。BASEバージョンは音声の意味ユニットを使用し、EXPRESSIVEバージョンは意味ユニットに加えてピッチとスタイルのユニットを使用して音声の表現力をシミュレートします。学習中、Spirit LMは単語レベルのインターリーブ方式に基づいて音声とテキストのシーケンスを単一のタグセットに連結します。テキストモデルの意味能力を備えたテキストと、音声モデルの表現能力を備えた音声を生成できます。Spirit LMは、限られたサンプル数で、自動音声認識(ASR)、テキスト音声合成(TTS)、音声分類など、複数のモダリティにわたる新しいタスクを学習できます。
Spirit LMの主な機能
- クロスモーダル言語生成Spirit LMはテキストと音声を生成できるため、シームレスな切り替えが可能です。
- 意味論と表現力これは、テキストモデルの意味論的機能と音声モデルの表現力を組み合わせたものです。
- 少数のサンプルから学ぶ少数のサンプルに基づいて、音声認識(ASR)、音声合成(TTS)、音声分類などの新しいタスクを迅速に学習できる。
- 感情の維持Expressiveは、特定の感情を伴う音声やテキストを理解し、生成することができます。
- マルチモーダルな理解: テキストを音声に変換したり、その逆を行ったりするなど、クロスモーダルコンテンツを理解し、生成する。
Spirit LMの技術原理
- 事前研修と拡張事前学習済みのテキスト言語モデルに基づき、テキストと音声の単位を用いた継続的な学習を通して、モデルの音声処理能力が開発される。
- インターリーブトレーニング単語レベルのインターリーブ法は、音声とテキストのシーケンスを単一のタグセットに接続してトレーニングするために使用され、それによって音声とテキストの整合性を実現します。
- バイモーダルタグ付け:
- 基本バージョン(BASE)音声意味単位(HuberTタグなど)を使用する。
- 表現力豊かなバージョン意味単位に加えて、音高(基本周波数)とスタイル単位を組み合わせることで、音声の表現力を捉えることができる。
- エンコードとデコード:
- エンコーダ音声をトークンに変換し、HuBERTなどのモデルを使用して音声をエンコードします。
- デコーダマーカーを元の形式(テキストまたは音声)に戻します。
- データセットとトレーニング:
- 大規模なテキストおよび音声データセットを使用する。
- 音声データセットとテキストデータセットを整合させた上で、インターリーブ方式の学習が行われます。
スピリットLMプロジェクトの住所
- プロジェクト公式サイト:speechbot.github.io/spiritlm
- GitHubリポジトリ:https://github.com/facebookresearch/spiritlm
- arXiv技術論文:https://arxiv.org/pdf/2402.05755
Spirit LMの応用シナリオ
- 音声アシスタントスマートデバイスに組み込むことで、質問への回答、リマインダーの設定、スマートホームデバイスの操作など、音声による対話機能を提供できます。
- 自動音声認識(ASR)音声をテキストに変換するもので、音声文字起こし、会議議事録、音声コマンドシステムなどに利用されています。
- テキスト読み上げ(TTS)テキスト情報を音声出力に変換するもので、オーディオブック、ニュース放送、ナビゲーションシステムなどに利用できます。
- 感情分析顧客サービス、市場調査、ソーシャルメディアモニタリングなどに活用するため、音声やテキストに含まれる感情的なトーンを分析する。
- 音声翻訳音声入力のリアルタイム翻訳を可能にし、異言語間のコミュニケーションを促進するため、国際会議や観光の場面に適しています。