project
MinMo - アリババ同義研究所が開発した大規模マルチモーダル音声対話モデル
MinMoは、アリババ傘下のTongyi LabのFunAudioLLMチームが開発したマルチモーダル大規模モデルで、シームレスな音声対話の実現に重点を置いています。MinMoは約80億個のパラメータを持ち、140万時間もの多様な音声データを用いた多段階学習によって訓練されています。
MinMoとは何ですか?
アリババ傘下のTongyi LabのFunAudioLLMチームが開発したMinMoは、シームレスな音声対話を実現することに特化したマルチモーダル大規模モデルです。MinMoは約80億個のパラメータを持ち、140万時間もの多様な音声データと幅広い音声タスクに対して多段階トレーニングを実施しています。MinMoは、生成される音声の感情、方言、話し方をユーザーが指示して制御できるほか、特定の音色を模倣することも可能で、90%を超える生成効率を実現しています。MinMoは全二重音声対話に対応しており、音声認識の遅延は約100ミリ秒です。理論上の全二重遅延は約600ミリ秒ですが、実際には約800ミリ秒で、ユーザーとシステム間の双方向通信を同時に可能にし、複数ターンの対話をよりスムーズにします。
MinMoの主な機能
- リアルタイム音声対話ユーザーとリアルタイムで自然かつ流暢な音声会話を行い、音声コマンドを理解し、それに応じた音声応答を生成することができる。
- 多言語対応多言語音声認識と翻訳に対応しており、様々な言語環境のユーザーとの円滑なコミュニケーションを可能にします。
- 感情表現ユーザーの指示に基づいて、特定の感情(喜び、悲しみ、驚きなど)を表現した音声を生成します。
- 方言と話し方特定の方言(四川語、広東語など)や特定の話し方(速い話し方、遅い話し方など)での音声生成をサポートします。
- 音色模倣特定の音色を模倣することで、音声によるやり取りをよりパーソナルで表現豊かなものにすることができる。
- 全二重相互作用ユーザーとシステム双方による同時発話・聴取をサポートし、より自然で効率的な複数ターン対話を実現します。音声認識の遅延は約100ミリ秒、全二重通信の遅延は理論上約600ミリ秒ですが、実際には約800ミリ秒です。
MinMoの技術原則
- マルチモーダル融合アーキテクチャ:
- 音声エンコーダー事前学習済みのSenseVoice-largeエンコーダーモジュールをベースに、強力な音声理解機能を提供し、多言語音声認識、感情認識、音声イベント検出をサポートします。
- プロジェクター入力これは2つのTransformer層と1つのCNN層で構成されており、次元の整列とダウンサンプリングに使用されます。
- 大規模言語モデル複数のベンチマークテストで優れた性能を示したため、事前学習済みのQwen2.5-7B-instructモデルを採用した。
- 出力プロジェクター寸法合わせに使用される単層線形モジュール。
- 音声マークアップ言語モデル音声タグは、事前学習済みのCosyVoice 2 LMモジュールを使用して自己回帰的に生成されます。
- Token2wavシンセサイザー音声トークンをMELスペクトログラムに変換し、さらに波形に変換することで、リアルタイム音声合成をサポートします。
- 全二重予測器単層トランスフォーマーと線形ソフトマックス出力層を用いて、システム応答を継続するか、ユーザー入力の処理を一時停止するかをリアルタイムで予測する。
- 多段階トレーニング戦略:
- 音声認識によるテキストのアライメント大量の音声データとそれに対応するテキスト注釈に基づいて、モデルは音声とテキストのマッピング関係を学習するように訓練され、音声をテキストに正確に変換できるようになり、その後のテキスト理解と生成の基礎が築かれます。
- テキスト読み上げのアライメント目標は、テキストを音声に変換する方法をモデルが学習し、テキストの意味情報や感情的なニュアンスを保持しながら、自然で流暢な音声を生成できるようにすることです。
- 音声間の整合性これにより、モデルの音声理解および音声生成能力がさらに向上し、モデルが音声レベルで直接対話できるようになり、韻律やイントネーションなどの特徴をより適切に処理できるようになります。
- 二重相互作用アライメント実際の全二重通信シナリオをシミュレートし、音声信号の送受信を同時に行う際に音声認識と音声生成を正確に実行できるようにモデルを訓練し、複雑な通信環境におけるモデルのパフォーマンスを最適化する。
MinMoのプロジェクトアドレス
- プロジェクト公式サイト:https://funaudiollm.github.io/minmo/
- arXiv技術論文:https://arxiv.org/pdf/2501.06282
MinMoアプリケーションシナリオ
- インテリジェントな顧客サービス24時間365日の多言語音声サポート、顧客からの質問に対するリアルタイムの対話型回答、感情認識に基づくパーソナライズされたサービス、そして効率性を向上させるための全二重対話のサポートを提供します。
- スマートアシスタントスマートホームデバイスの制御、スケジュールの管理、情報の検索、パーソナライズされたコンテンツの推奨などを行い、生活の利便性と情報アクセスの効率性を向上させます。
- 教育言語学習を支援し、インタラクティブな授業を通して学習意欲を高め、学習進捗状況に基づいた個別学習プランを提供し、生徒の学習を促すための精神的なサポートも提供します。
- 健康管理遠隔医療相談、健康状態のモニタリングに関するリマインダー、リハビリテーション訓練の指導、そして精神的なサポートやカウンセリングは、医療サービスのアクセス性を向上させ、患者の体験を改善します。
- インテリジェントドライビング音声制御車両システムは、リアルタイムの交通情報、緊急時のガイダンス、および全二重通信による対話機能を提供し、運転の安全性と利便性を向上させます。