AB
AiBoss
project

Kimi-Audio - Moonshot AIのオープンソースオーディオ基盤モデル

Kimi-Audioは、Moonshot AIが開発したオープンソースの音声基盤モデルで、音声の理解、生成、対話タスクに特化しています。1300万時間以上の多様な音声データで事前学習されており、強力な音声推論機能を備えています。

Kimi-Audioとは何ですか?

Kimi-Audioは、Moonshot AIが開発したオープンソースのオーディオ基盤モデルで、音声の理解、生成、対話タスクに特化しています。1300万時間以上の多様なオーディオデータで事前学習されており、強力な音声推論および言語理解機能を備えています。コアアーキテクチャは、ハイブリッドオーディオ入力(連続的な音響情報と離散的な意味タグ)とLLMベースの設計を組み合わせ、テキストとオーディオタグの並列生成をサポートするとともに、ブロックベースのストリーミングデコーダーによって低遅延のオーディオ生成を実現しています。

Kimi-Audioの主な機能

  • 自動音声認識(ASR)音声信号をテキストコンテンツに変換でき、複数の言語と方言に対応しています。
  • 音声感情認識(SER)これは、音声に含まれる感情情報を分析して、話者の感情状態(喜び、悲しみ、怒りなど)を判断するもので、顧客サービスシステムや感情分析などに利用できます。
  • 音響イベント/シーン分類(SEC/ASC)環境音(車のクラクション、犬の鳴き声、雨音など)や風景(オフィス、街路、森林など)を識別・分類することができます。
  • 音声字幕生成(AAC)音声コンテンツに基づいて字幕を自動生成することで、聴覚障害のある人が音声情報をよりよく理解できるよう支援します。
  • 音声Q&A(AQA)ユーザーの質問に基づいて、対応する音声回答を生成します。
  • エンドツーエンドの音声対話自然で流暢な音声対話コンテンツの生成をサポートします。
  • 複数ターン対話管理複雑な複数ターンの対話タスクを処理し、文脈情報を理解し、一貫性のある音声応答を生成することができる。
  • テキスト読み上げ(TTS)テキストコンテンツを自然で流暢な音声に変換し、多様な音色やイントネーションに対応します。
  • 音声コンテンツ分析これは、音声に含まれる意味、感情、出来事を包括的に分析し、重要な情報を抽出することを含む。
  • 音声品質評価音声処理の基準値として、音声の明瞭度やノイズレベルなどを分析します。

キミオーディオの技術原則

  • 混合音声入力Kimi-Audioは混合音声入力方式を採用しており、入力音声を2つの部分に分割します。
    • 離散的な意味タグ付け音声は、ベクトル量子化技術を用いて、12.5Hzの周波数で離散的な意味タグに変換される。
    • 連続的な音響特性ウィスパーエンコーダーは、連続的な音響特徴を抽出するために使用され、抽出された特徴は12.5Hzにダウンサンプリングされます。このハイブリッド入力アプローチは、離散的な意味情報と連続的な音響情報を組み合わせることで、モデルが音声コンテンツをより包括的に理解し処理することを可能にします。
  • LLMベースのコアアーキテクチャKimi-Audioの中核は、Transformerベースの言語モデル(LLM)であり、Qwen 2.5 7Bなどの事前学習済みテキストLLMから初期化されます。
  • ブロックベースのストリーミング復号Kimi-Audioは、ストリームマッチングに基づくブロックベースのストリーミングデコーダを採用し、低遅延の音声生成をサポートしています。音声データをブロック単位で処理することで、生成プロセス中にリアルタイムで音声を出力でき、遅延を大幅に削減します。また、先読みメカニズムもサポートしており、音声生成の滑らかさと一貫性をさらに最適化します。
  • 大規模な事前トレーニングKimi-Audioは、音声、音楽、さまざまな音など、1300万時間以上の多様な音声データで事前学習されています。これにより、モデルは強力な音声推論および言語理解能力を備え、音声認識、音声による質問応答、感情認識など、さまざまな複雑な音声タスクを処理できます。
  • フローマッチングモデル離散的なマーカーを連続的な音声信号に変換するために使用されます。
  • ボコーダー(BigVGAN)高品質な音声波形を生成するために使用されます。生成される音声の自然さと滑らかさを保証します。

Kimi-Audioのプロジェクトアドレス

キミ・オーディオのパフォーマンス

  • 自動音声認識(ASR)LibriSpeechテストセットにおいて、Kimi-Audioは単語誤り率(WER)[欠損値]を達成しました。 1.28%(テストクリーン) 2.42%(test-other)、他のモデルよりも大幅に低い。AISHELL-1データセットでは、WERはわずか 0.60%彼らは非常に優れたパフォーマンスを見せた。
  • 音声理解音声理解タスクにおいて、Kimi-Audioは複数のデータセットでほぼ最先端の結果を達成しています。例えば、ClothoAQAデータセットでは、テストセットのパフォーマンスは[パフォーマンスレベル不明]に達しました。 73.18%VocalSoundデータセットでは、精度は[欠損率]に達しました。 94.85%
  • 音声Q&A(AQA)音声質問応答タスクにおいて、Kimi-AudioはClothoAQAデータセットの開発セットで[成果]を達成しました。 73.18% その精度は、音声による質疑応答コンテンツを理解し生成する強力な能力を示している。
  • 音声ダイアログ音声対話タスクにおいても、Kimi-Audioは複数のベンチマークで非常に優れたパフォーマンスを発揮します。例えば、VoiceBench AlpacaEvalデータセットでは、そのパフォーマンスは[パフォーマンス目標値欠落]に達します。 75.73%音声会話の流暢さと一貫性という点で、非常に優れた性能を発揮します。
  • 音声生成Kimi-Audioは非音声音声生成において非常に優れた性能を発揮し、Nonspeech7kデータセットで[欠損率]の精度を達成しました。 93.93%これは、高品質な音声コンテンツを生成する能力があることを示している。

Kimi-Audioの応用シナリオ

  • インテリジェント音声アシスタントKimi-Audioは、音声認識、音声合成、複数ターン対話に対応したインテリジェントな音声アシスタントの開発に利用できます。ユーザーの音声コマンドを理解し、自然で流暢な音声応答を生成できます。
  • 音声認識と文字起こしKimi-Audioは、音声信号を効率的にテキストに変換します。複数の言語と方言に対応しているため、議事録、音声メモ、リアルタイム翻訳などの用途に適しています。
  • 音声コンテンツの生成Kimi-Audioは、テキスト読み上げ(TTS)、音声キャプション(AAC)、音声質疑応答(AQA)など、高品質な音声コンテンツを生成できます。テキストコンテンツに基づいて自然で流暢な音声を生成できるだけでなく、質問に対する音声回答も生成できるため、オーディオブック、動画キャプション、インテリジェントな顧客サービスなどに最適です。
  • 感情分析と音声感情認識Kimi-Audioは、音声に含まれる感情情報を分析し、話者の感情状態(喜び、悲しみ、怒りなど)を判断することができます。
  • 教育と学習Kimi-Audioは、英語のスピーキング練習や語学学習支援など、教育分野で様々な用途があります。音声による対話を通じて、発音練習、文法ミスの修正、リアルタイムのフィードバックなどをサポートします。