project
MiDashengLM - Xiaomiのオープンソース、高効率大規模音声認識モデル
MiDashengLMは、Xiaomiがオープンソース化した高効率オーディオ理解モデルであり、具体的にはMiDashengLM-7Bバージョンです。このモデルは、Xiaomi DashengオーディオエンコーダーとQwen2.5-Omni-7B Thinkerデコーダーをベースに構築されています。
MiDashengLMとは何ですか?
MiDashengLMは、Xiaomiがオープンソース化した高効率オーディオ理解モデルで、バージョンはMiDashengLM-7Bです。Xiaomi DashengオーディオエンコーダとQwen2.5-Omni-7B Thinkerデコーダをベースに構築されており、音声、環境音、音楽を統一的に理解するために、汎用的なオーディオ記述アライメント戦略を採用しています。このモデルは、業界をリードするモデルのわずか4分の1という極めて低いレイテンシで、優れたパフォーマンスと高い推論効率を実現し、大規模並列処理にも対応しています。トレーニングデータは完全にオープンソースで、学術用途と商用用途の両方に対応しており、スマートコックピットやスマートホームなどのシナリオに適しており、マルチモーダルなインタラクティブ体験の向上に貢献します。
MiDashengLMの主な機能
- 音声字幕音声コンテンツ(音声、環境音、音楽など)を自然言語による説明に変換することで、ユーザーが音声情報を素早く理解できるようにします。
- 音声分類これは音声中の特定のカテゴリ(音声、環境音、音楽など)を識別し、環境音認識や音楽分類などのシナリオで使用できます。
- 自動音声認識(ASR)音声をテキストに変換する機能があり、複数の言語に対応し、音声アシスタントやスマートコックピットなどの場面で広く利用されている。
- 音声による質問応答入力された音声コンテンツに基づいて関連する質問に答えることができ、スマートコックピットにおける環境音に関する質疑応答や音楽に関する質疑応答などに適用可能です。
- マルチモーダルインタラクション音声と他のモダリティ(テキストや画像など)を組み合わせることで、包括的な理解が可能になり、スマートデバイスのインタラクティブな体験が向上します。
MiDashengLMの技術原則
- モデルアーキテクチャ:
- オーディオエンコーダーXiaomi Dashengオーディオエンコーダをベースに、入力オーディオ信号を高次元の特徴表現に変換する役割を担っています。Dashengエンコーダは音声理解タスクにおいて優れた性能を発揮し、非音声オーディオ(環境音や音楽など)を処理する際に豊富な意味情報を抽出できます。
- デコーダQwen2.5-Omni-7B Thinker自己回帰デコーダをベースとしたこのデコーダは、音声エンコーダによって抽出された特徴量を自然言語による記述に変換する役割を担います。音声解説、音声質問応答、音声認識など、様々なタスクをサポートします。
- トレーニング戦略:
- 音声解説の一般的な整合性このアプローチは、一般的な音声記述アライメント戦略に基づき、従来の音声認識(ASR)文字起こし手法の限界を克服します。非単調なグローバル意味マッピングを通して、モデルに音声シーンにおける深い意味的関連性を学習させ、音声、環境音、音楽を統一的に理解することを可能にします。
- 複数の専門家による分析トレーニングデータは、音声、人間の声、音楽、環境音響のきめ細かなアノテーションを含む、複数の専門家による分析パイプラインに基づいて生成され、その後、DeepSeek-R1推論モデルを使用して統一された記述に合成されます。
- データセットこのデータセットは、音声、環境音、音楽など、複数の分野を網羅する公開データセット(合計100万時間以上)を使用して学習されました。事前学習の段階では、学習データの元のラベルは破棄され、より豊富で詳細なテキスト記述のみが使用されたため、モデルはより豊富で包括的な音響情報を学習することができました。
- 推論効率の最適化:
- 効率的な推論オーディオエンコーダの設計を最適化することで、出力フレームレートをQwen2.5-Omniの25Hzから5Hzに低減し、計算負荷を大幅に軽減して推論効率を向上させた。
- 大規模並列処理より大きなバッチ処理(バッチサイズ=512)をサポートしています。80GBのGPUで30秒の音声を処理し、100個のトークンを生成する場合、MiDashengLMのスループットはQwen2.5-Omni-7Bの20倍以上になります。
MiDashengLMのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/xiaomi-research/dasheng-lm
- ハギングフェイスモデルライブラリ:https://huggingface.co/mispeech/midashenglm-7b
- 技術論文:https://github.com/xiaomi-research/dasheng-lm/blob/main/technical_report/MiDashengLM_techreport.pdf
- オンラインでデモを体験してください:https://huggingface.co/spaces/mispeech/MiDashengLM-7B
MiDashengLMの応用シナリオ
- スマートコックピット音声アシスタントと環境音認識に基づいて、運転の安全性とインタラクティブな体験を向上させます。
- スマートホーム音声制御と環境音モニタリングにより、便利なホームオートメーションを実現します。
- 音声アシスタント多様なユーザーニーズに対応するため、多言語音声認識とインテリジェントな対話機能を提供します。
- 音声コンテンツの作成と注釈音声の説明とタグを自動生成し、コンテンツ作成の効率を向上させます。
- 教育と学習発音に関するフィードバックや理論的なガイダンスを提供することで、ユーザーの言語学習や音楽学習を支援します。