project
FireRedASR2S - Xiaohonshu のオープンソース音声認識モデル
FireRedASR2Sは、XiaohongshuのSuper Intelligence-AudioLabがオープンソース化した産業グレードのエンドツーエンド音声認識モデルであり、ASR、VAD、言語認識、句読点予測という4つの最先端(SOTA)モジュールを統合しています。
FireRedASR2Sとは何ですか?
FireRedASR2Sは、小紅書のSuper Intelligence-AudioLabが開発したオープンソースの産業グレードのエンドツーエンド音声認識モデルです。ASR、VAD、言語認識、句読点予測という4つの最先端(SOTA)モジュールを統合しています。このモデルは、標準中国語と20以上の方言、英語、コードスイッチング、歌詞認識をサポートしています。標準中国語のエラー率は2.89%、方言の平均エラー率は11.55%と低く、Doubao-ASRやQwen3-ASRといった競合製品を大きく上回っています。外部APIを使用せずにワンクリックでローカル展開が可能で、小紅書の音声コメントや音声検索など、高頻度で使用されるシナリオで広く導入されています。
FireRedASR2Sの主な機能
-
音声認識 (FireRedASR2)標準中国語、20種類以上の方言・アクセント、英語、中国語と英語の混合言語、歌詞認識に対応しています。LLMアーキテクチャとAEDアーキテクチャの両方のバージョンを提供しています。AEDバージョンでは、単語レベルのタイムスタンプと信頼度出力に対応しています。
-
音声活動検出(FireRedVAD)このモデルは音声、歌、音楽を検出でき、100以上の言語をサポートし、ストリーミングモードと非ストリーミングモードの両方を提供し、F1スコアは97.57%を達成しています。
-
言語認識 (FireRedLID)100以上の言語と20以上の中国語の方言の認識をサポートしており、精度は97.18%で、Whisperなどのオープンソースソリューションよりも大幅に優れています。
-
句読点予測(FireRedPunc)このモデルは中国語と英語の句読点を自動的に追加し、平均F1スコアは78.90%で、書き起こされたテキストの読みやすさを大幅に向上させます。
FireRedASR2Sの技術的原理
- 音声認識 (FireRedASR2)本モデルは、エンコーダー・アダプターLLMとアテンションベースエンコーダー・デコーダーという2つのアーキテクチャを採用しています。LLMバージョンは、大規模言語モデルの機能を活用してエンドツーエンドの音声理解を実現する一方、AEDバージョンは、エンコーダー・デコーダーフレームワーク内の計算効率を最適化し、アダプター層を介して音声とテキストの表現を融合させ、タイムスタンプと信頼度出力に対応しています。
- 音声活動検出(FireRedVAD)本論文では、深層フィードフォワードシーケンスメモリネットワーク(DFSMN)に基づいて音声の時間的特徴をモデル化する。平滑化ウィンドウと閾値処理を用いて音声の開始点と終了点を特定し、音声、歌唱、音楽などの音声イベントを区別するとともに、リアルタイム要件を満たすためのストリーミング処理をサポートする。
- 言語認識 (FireRedLID)FireRedASR2エンコーダーを再利用して音声表現を抽出し、分類器を訓練して言語ラベルを予測します。大規模な多言語データを用いて事前学習を行い、言語間で共有される表現空間を構築することで、100以上の言語と方言の高精度な認識を実現します。
- 句読点予測(FireRedPunc)BERTアーキテクチャに基づいたこのアルゴリズムは、句読点のないテキストを入力として受け取り、各位置の句読点の種類を予測します。中国語と英語のマルチドメインデータを用いたファインチューニングにより、テキストの意味構造と構文構造を学習し、適切な句読点を自動的に挿入します。
FireRedASR2Sプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/FireRedTeam/FireRedASR2S
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/FireRedTeam/fireredasr2s
FireRed ASR2Sの応用事例
- コンテンツコミュニティの交流小紅書では音声コメントや音声検索などの機能をサポートしており、ユーザーは方言や歌など多様な声を使ってコミュニティ交流に参加できるため、プラットフォームの活気と楽しさが向上します。
- 社会とコミュニケーションこれにより、プライベートな音声メッセージや新年の挨拶といった場面が可能になり、自然で流暢な音声入力とリアルタイムの文字起こしを実現することで、コミュニケーションのハードルを下げ、感情伝達の効率性を向上させます。
- コンテンツの制作とプロデュース音声メモの公開、ライブ配信の字幕生成、動画の自動字幕生成といった制作ツールをサポートしており、クリエイターが効率的にマルチメディアコンテンツを制作するのに役立ちます。
- エンタープライズレベルのサービス会議の文字起こし、高度な顧客サービス、電話分析といったB2Bシナリオに適しています。プライベート展開機能により、金融や医療などの業界におけるデータセキュリティおよびコンプライアンス要件を満たします。