AB
AiBoss
project

Fun-ASR1.5 - Alitongyiが発表したエンドツーエンドの音声認識モデル

Fun-ASR 1.5は、アリ・トンイーチームが開発したエンドツーエンド音声認識モデルの次世代版です。単一のモデルで30言語の高精度認識をサポートし、7つの主要な中国語方言体系と20以上の地域方言を網羅しています。また、中国古典詩に特化した最適化も施されています。

Fun-ASR1.5とは何ですか?

Fun-ASR 1.5は、アリババ同義チームが開発したエンドツーエンド音声認識モデルの次世代バージョンです。単一のモデルで30言語の高精度認識をサポートし、7つの主要な中国語方言体系と20以上の地域アクセントを網羅しています。特に、中国古典詩の朗読認識に最適化されています。このモデルはMoEアーキテクチャに基づいており、事前ラベルを必要とせずに自動言語切り替えを実現します。Fun-ASR 1.5は、後処理でインテリジェントな句読点予測とテキスト正規化を可能にし、音声テキスト変換を実用的であるだけでなく、非常にユーザーフレンドリーなものにしています。

Fun-ASR1.5の主な機能

  • 多言語認識この単一モデルは、中国語、英語、日本語、韓国語、フランス語、ドイツ語、スペイン語、ポルトガル語、ロシア語、アラビア語を含む30言語に対応しています。
  • 自動言語切り替え言語タグを事前に設定する必要はありません。コードスイッチングの場面において、多言語が混在する音声を自動的に認識し、切り替えます。
  • 方言認識本書は7つの主要な方言体系と20以上の地域方言を網羅しており、特に需要の高い15の方言の最適化に重点を置いている。
  • 古代詩の認識:秦以前の時代から現代までの古代中国詩のコーパスを構築し、音声とテキストのアライメントを行い、古典中国語の朗読の正確な転写を支援する。
  • インテリジェントな句読点予測文脈上の意味に基づいて、カンマ、ピリオド、疑問符などの句読点を自動的に挿入します。
  • テキスト正規化音声で読み上げられた数字、日付、金額、電話番号などを自動的に標準的な書き言葉に変換します。

Fun-ASR1.5の技術的原則

  • 教育省建築本システムはハイブリッドエキスパートアーキテクチャを採用しており、特定の言語が聞こえた際に処理に必要な関連部分のみを活性化することで、多言語処理の柔軟性と効率性を向上させている。
  • 段階的かつ体系的な訓練訓練段階では、正確なデータを段階的かつ体系的に使用することで、複雑な現実世界の音声シナリオに対応する能力を向上させる。
  • 方言データ駆動型何十万時間にも及ぶ実際の訛りのある音声データを用いた学習に基づき、平均単語誤り率(CER)は以前のバージョンと比較して56.2%減少しました。
  • 古代中国詩集『詩経』、『楚歌』、李白や杜甫の詩集、蘇軾や辛斉記の詩など、古典作品を網羅した実在の人物による朗読録音のコーパスを構築する。

Fun-ASR1.5の使い方

  • アリババクラウド百精錬プラットフォームAlibaba Cloud Bailianの公式サイトにアクセスし、モデル体験センターの音声セクションに入ってAPIを呼び出してください。
  • Modaコミュニティ:https://modelscope.cn/studios/iic/FunAudio-ASR にアクセスして、オンラインで直接体験してみてください。

Fun-ASR1.5の主要情報と使用要件

  • 製品ポジショニングエンドツーエンドの音声認識大規模モデル。
  • 対応言語30言語(ヨーロッパ、東アジア、東南アジア、南アジア、中東の主要言語を網羅)。
  • 方言のカバー範囲7つの主要な方言体系があり、上海語、広東語、四川語など需要の高い15の方言の最適化に重点を置いている。
  • 古典詩の正確性内部評価セットでは、文字レベルの精度が97%を達成した。
  • 使用方法API呼び出しまたはオンライン体験。
  • プリセットは不要です多言語環境では、事前に言語タグを指定する必要はありません。

Fun-ASR1.5の主な利点

  • 単一モデル多言語対応単一のモデルで30言語間をシームレスに切り替えることができ、複数のモデルの導入および保守コストを削減できます。
  • 方言認識の分野でトップクラスの実績を誇る何十万時間にも及ぶ方言データに基づき、CERは以前のバージョンと比較して56.2%減少しており、本来の方言テキストの復元を支援している。
  • 自動コード切り替えプリセットを一切使用せずに、同一対話内での多言語シナリオに対応できます。
  • 文化シーンの最適化古典中国詩の暗唱に関する専門的な訓練により、文字の正確率が97%に達し、文化遺産の保存に貢献している。
  • インテリジェントな後処理自動句読点処理とテキスト正規化により、会議議事録、法的文書、その他類似文書の事後編集コストを大幅に削減できます。

Fun-ASR1.5と類似の競合製品との比較

寸法 Fun-ASR1.5 Seed-ASR Tencent-ASR
言語対応範囲 30言語、単一モデル対応 多言語対応 多言語対応
方言サポート 7つの主要な方言システム、15の重要な最適化、CERが56.2%削減 基本サポート 基本サポート
Code-Switching タグを事前に設定する必要はなく、自動認識と切り替えが可能です。 サポート サポート
古代詩の認識 特殊な最適化により、文字精度97%を実現。 不明 不明
インテリジェントな後処理 自動句読点変換+テキスト正規化(数字/日付/金額/電話番号) 基本的な句読点のスキル 基本的な句読点のスキル
建築的特徴 MoEハイブリッドエキスパートアーキテクチャ 非公開 非公開
オープンエクスペリエンス Alibaba Cloudの洗練されたAPIと魅力的なコミュニティ 火山エンジン テンセントクラウド

Fun-ASR1.5の応用シナリオ

  • 国際会議多国籍会議の場面において、Fun-ASR1.5は、参加者が言語を事前に設定したり、複数の翻訳ツールを切り替えたりすることなく、多言語が混在する対話をリアルタイムで正確に文字起こしすることができます。
  • スマートスピーカースマートホームや車載音声対話のシナリオにおいて、Fun-ASR1.5は様々な方言のコマンドを正確に認識できるため、スマートスピーカーが真に「地域特有のアクセントを理解する」ことが可能になります。
  • オンライン教育中国の伝統文化のオンライン教育において、Fun-ASR1.5は古代の詩や歌詞の正確な書き起こしをサポートし、97%の文字レベルの精度で伝統文化のデジタル継承に貢献する。
  • ニュースインタビューニュース取材やコンテンツ制作の場面において、Fun-ASR1.5は句読点を自動的に追加し、音声で読み上げられた数字や日付を標準形式に正規化することで、後々の手動編集にかかる時間を大幅に削減できます。