AB
AiBoss
project

FireRedASR - Xiaohongshuのオープンソース自動音声認識モデル

FireRedASRは、Xiaohongshuが開発したオープンソースの産業グレード自動音声認識(ASR)モデルファミリーです。中国語(北京語)、中国語方言、英語に対応し、中国語ASRベンチマークテストで新たな最先端(SOTA)レベルを達成したほか、歌詞認識においても優れた性能を発揮します。

FireRedASRとは何ですか?

FireRedASRは、小紅書(Xiaohongshu)から生まれたオープンソースの産業グレード自動音声認識(ASR)モデルファミリーです。中国語(北京語)、中国語方言、英語をサポートし、中国語ASRベンチマークテストで新たな最先端(SOTA)レベルを達成、歌詞認識においても非常に優れた性能を発揮します。このモデルファミリーには、主に2つのバージョンがあります。

FireRedASR-LLM:エンコーダー・アダプター・LLMフレームワークを採用し、大規模言語モデル(LLM)の機能を活用することで、最先端(SOTA)のパフォーマンスを実現し、シームレスなエンドツーエンドの音声対話をサポートします。中国語ベンチマークテストでは、平均文字誤り率(CER)は3.05%で、従来のSOTAモデル(3.33%)と比較して8.4%の削減を実現しています。

FireRedASR-AED:アテンションベースのエンコーダー・デコーダー(AED)アーキテクチャを採用し、高いパフォーマンスと計算効率のバランスを取りながら、LLMベースの音声モデルにおける効果的な音声表現モジュールとして機能します。中国語ベンチマークテストでは、平均CERが3.18%を達成し、12個以上のパラメータを持つSeed-ASRを凌駕しています。

FireRedASRの主な機能

  • 高精度音声認識FireRedASRには、FireRedASR-LLMとFireRedASR-AEDの2つのバージョンがあります。そのうち、FireRedASR-LLMはエンコーダー・アダプター・LLMフレームワークを採用し、究極の音声認識精度を追求しています。
  • 効率的な推論FireRedASR-AEDは、11億個のパラメータを持つ古典的なアテンションベースのエンコーダー・デコーダーアーキテクチャに基づいており、高い精度と推論効率のバランスが取れています。
  • マルチシナリオ適応FireRedASRは、ショートビデオ、ライブストリーミング、音声入力、スマートアシスタントなど、さまざまな日常的なシナリオにおいて非常に優れた性能を発揮します。主要なASRサービスプロバイダーやParaformer-Largeと比較して、FireRedASR-LLMはCERを23.7%~40.0%削減します。
  • 歌詞認識機能歌詞認識のシナリオにおいて、FireRedASR-LLMはCERを50.2%から66.7%削減し、極めて高い適応性を示した。
  • 多言語対応FireRedASRは標準中国語をサポートしており、中国語の方言や英語の音声認識において非常に優れた性能を発揮するため、その応用範囲はさらに拡大します。
  • オープンソースとコミュニティサポートFireRedASRのモデルと推論コードはどちらもオープンソースであり、音声認識技術におけるコミュニティ主導の改良と学術研究を促進している。

FireRedASR の技術原則

  • FireRedASR-LLMFireRedASR-LLMは、エンコーダー・アダプター・LLMフレームワークを採用し、大規模言語モデル(LLM)の機能を組み合わせることで、卓越した音声認識精度を実現しています。主な構成要素は以下の3つです。
    • コンフォーマーベーシックエンコーダー音声特徴を抽出し、連続音声表現を生成する役割を担う。
    • 軽量アダプターエンコーダの出力を、LLM意味空間に一致する表現に変換します。
    • 事前学習済みテキストLLMQwen2-7B命令の初期化に基づいて、最終的なテキスト出力を生成するために使用されます。
    • トレーニング戦略トレーニング中、エンコーダとアダプタは学習可能であり、LLMのほとんどのパラメータは固定されたままで、低ランク適応(LoRA)によって微調整されるだけです。これにより、エンコーダとアダプタは、LLMの事前学習機能を維持しながら、音声特徴をLLMの意味空間に効果的にマッピングすることができます。
    • 入力と推論推論時には、入力としてプロンプトと音声が含まれます。LLMは次のトークンを予測して認識されたテキストを生成します。
  • FireRedASR-AEDFireRedASR-AEDは、高性能と計算効率のバランスをとった、古典的なアテンションベースのエンコーダー・デコーダー(AED)アーキテクチャに基づいています。以下のコンポーネントで構成されています。
    • コンフォーマーエンコーダこれはコンフォーマーモデルに基づいて音声特徴を処理し、局所的および全体的な依存関係を同時に捉えることができます。
    • トランスフォーマーデコーダーシーケンス変換には、マルチヘッド自己注意モジュールとフィードフォワードモジュールを含むTransformerアーキテクチャを採用している。
    • 入力機能入力特徴量は80次元のログメルフィルタバンクであり、これらはグローバル平均および分散正規化によって処理される。
    • トレーニングデータトレーニングデータには、約7万時間分の高品質な中国語音声データと、約1万1千時間分の英語音声データが含まれています。

FireRedASRプロジェクトのアドレス

FireRedASRの応用シナリオ

  • インテリジェント音声アシスタントFireRedASRは、スマートホーム制御やインテリジェントな顧客サービスなど、インテリジェントな音声アシスタントの開発に利用できます。高精度な音声認識機能により、ユーザーの音声コマンドを正確に理解し、スムーズな対話体験を提供します。
  • 動画とライブ配信ショートビデオやライブストリーミングの分野において、FireRedASRはリアルタイムで字幕を生成し、視聴者がコンテンツをよりよく理解できるよう支援します。
  • 歌詞認識FireRedASRは歌詞認識の分野で特に優れた性能を発揮し、音楽プラットフォームやカラオケなど幅広い場面で活用できます。
  • 音声入力FireRedASRは、音声入力や音声メモ作成などの音声入力シナリオで使用できます。その効率的な推論能力と高精度な認識により、ユーザーの入力効率が大幅に向上します。