AB
AiBoss
project

Xiaomi-MiMo-Audio - Xiaomiのオープンソースのエンドツーエンド大規模音声モデル

Xiaomi-MiMo-Audioは、Xiaomiがオープンソース化した、Xiaomi初のネイティブなエンドツーエンドの大規模音声モデルです。革新的な事前学習アーキテクチャと数億時間に及ぶ学習データに基づき、このモデルは音声分野で初めてコンテキスト内学習(ICL)を実現しました。

Xiaomi-MiMo-Audioとは何ですか?

Xiaomi-MiMo-Audioは、Xiaomiがオープンソース化した、Xiaomi初のネイティブなエンドツーエンドの大規模音声モデルです。革新的な事前学習アーキテクチャと数億時間に及ぶ学習データに基づき、このモデルは音声分野で初めて、コンテキスト内学習(ICL)に基づく低サンプル汎化能力を実現し、音声分野における大規模ラベル付きデータへの依存というボトルネックを打破しました。Xiaomi-MiMo-Audioは、複数の標準ベンチマークにおいて、同じパラメータ数のオープンソースモデルを大幅に上回り、最高で7Bの性能を達成しました。音声理解ベンチマークMMAUの標準テストセットではGoogleのGemini-2.5-Flashを凌駕し、複雑な音声推論ベンチマークであるBig Bench Audio S2TタスクではOpenAIのGPT-4o-Audio-Previewを上回りました。

Xiaomiは、事前学習済みモデルMiMo-Audio-7B-Baseと、指示の微調整モデルMiMo-Audio-7B-Instruct、さらに12億個のパラメータを持つトークナイザーモデルをオープンソース化し、音声再構築と音声テキスト変換タスクをサポートしています。

Xiaomi MiMo Audioの主な機能

  • 少数のショットで汎化する能力この成果は、インコンテキスト学習(ICL)に基づく少数ショット汎化が音声領域で初めて実装されたことを意味し、新しいタスクへの迅速な適応を可能にし、音声分野における「GPT-3の瞬間」を象徴するものです。
  • クロスモーダルアライメント機能トレーニング後の学習は、知能指数(IQ)、感情指数(EQ)、表現力、安全性といった、複数の感覚モダリティ間の連携能力を刺激し、自然さ、感情表現、対話への適応性といった点で、音声対話における人間らしさを高いレベルで実現する。
  • 音声理解と音声生成このモデルは、一般的な音声理解や対話などの複数の標準ベンチマークにおいて、同じ数のパラメータを持つオープンソースモデルを大幅に上回り、7Bという最高のパフォーマンスを達成し、一部のクローズドソースの音声モデルをも凌駕しています。
  • 音声による複雑な推論複雑な音声推論のベンチマークであるBig Bench Audio S2Tタスクにおいて、非常に優れた性能を発揮し、複雑な音声推論における強力な能力を実証しています。
  • 音声継続能力事前学習済みモデルであるMiMo-Audio-7B-Baseは、現在、音声継続機能を備えた初のオープンソース音声モデルです。
  • 多様な考え方を支持するこれは、思考を音声理解と音声生成の両方のプロセスに同時に組み込んだ、初のオープンソースモデルであり、ハイブリッド思考をサポートする。
  • 音声テキスト変換タスクトークナイザーモデルは、音声からテキストへの変換(A2T)タスクをサポートしており、1,000万時間以上の音声データをカバーしています。

Xiaomi-MiMo-Audioの技術原理

  • 革新的な事前学習アーキテクチャこのモデルは、数億時間分の学習データを用いて学習された革新的な事前学習アーキテクチャを採用しており、音声データをより適切に処理できるようになっています。
  • 少数のショットで汎化する能力音声領域において、コンテキスト内学習(ICL)に基づく少サンプル汎化能力を初めて実現し、少数のサンプルで新しいタスクに迅速に適応できるようになった。
  • クロスモーダルアライメント機能トレーニング後の処理により、モデルのクロスモーダルアライメント機能がさらに強化され、知能、感情的知能、表現力、安全性などが向上し、音声対話において、自然さ、感情表現、インタラクティブな適応性といった点で非常に高いレベルの人間らしさを実現できるようになります。
  • ロスレス圧縮事前トレーニングロスレス音声圧縮を用いた事前学習により、タスク間の汎化が達成され、音声領域における「創発的」な挙動が実証された。
  • トークナイザーモデル本システムは、12億個のパラメータを持つTransformerアーキテクチャのトークナイザーモデルを採用し、1000万時間以上の音声データを対象にゼロから学習を行い、音声再構築タスクと音声テキスト変換(A2T)タスクをサポートします。
  • 軽量のトレーニング後軽量な事後学習(SFT)によってモデルの性能がさらに最適化され、音声理解と音声生成において優れた性能を発揮します。
  • ハイブリッド思考メカニズム音声理解と音声生成の両方のプロセスに思考メカニズムを導入することで、ハイブリッド思考がサポートされ、モデルの複雑な推論能力が向上します。

Xiaomi-MiMo-Audioプロジェクトのアドレス

  • プロジェクト公式サイト:https://xiaomimimo.github.io/MiMo-Audio-Demo/
  • GitHubリポジトリ:https://github.com/XiaomiMiMo/MiMo-Audio
  • ハギングフェイスモデルライブラリ
    • MiMo-Audio-7B-Base:https://huggingface.co/XiaomiMiMo/MiMo-Audio-7B-Base
    • MiMo-Audio-7B-Instruct:https://huggingface.co/XiaomiMiMo/MiMo-Audio-7B-Instruct
    • Tokenizer:https://huggingface.co/XiaomiMiMo/MiMo-Audio-Tokenizer
  • 技術論文:https://github.com/XiaomiMiMo/MiMo-Audio/blob/main/MiMo-Audio-Technical-Report.pdf

Xiaomi-MiMo-Audioのアプリケーションシナリオ

  • 音声対話これは、より自然で知的な音声対話体験を提供するために、インテリジェント音声アシスタントに利用でき、複数の言語や方言での会話をサポートします。
  • 音声生成オーディオブック、音声放送、音声ナビゲーションなどの用途に適した、高品質な音声コンテンツを生成できます。
  • 音声認識音声認識(A2T)タスクをサポートしており、議事録作成、音声入力、音声検索などのシナリオに適用できます。
  • オーディオコンテンツ制作これはコンテンツ制作者が音声スクリプトや音声コンテンツを作成するのに役立ち、制作効率を向上させます。
  • 感情表現音声対話において豊かな感情を表現できるため、感情的なやり取りが求められる場面、例えば感情を共有するコンパニオンロボットや顧客サービスシステムなどに適している。
  • 音声認識と音声理解音声理解のベンチマークテストで優れた性能を発揮し、音声認識や音声コマンド制御などのシナリオで使用できます。