AB
AiBoss
project

オムニリンガルASR - Meta AIが開発した自動音声認識システム

Omnilingual ASRは、Meta AIが開発した自動音声認識システムで、500の低リソース言語を含む1600以上の言語をサポートしています。Omnilingual ASRは、wav2vec 2.0エンコーダを70億パラメータに拡張しています。

オムニリンガルASRとは何ですか?

Meta AIが開発したOmnilingual ASRは、500の低リソース言語を含む1600以上の言語をサポートする自動音声認識システムです。Omnilingual ASRは、wav2vec 2.0エンコーダを70億パラメータに拡張し、2つのデコーダを導入することで優れた性能を実現し、78%の言語で文字エラー率を10%未満に抑えています。Omnilingual ASRフレームワークはコミュニティ主導型であり、ユーザーは少数のサンプルだけで新しい言語に拡張できます。Meta AIは、Omnilingual ASRコーパスデータセットと、新しい自己教師あり大規模多言語音声表現モデルであるOmnilingual wav2vec 2.0をオープンソース化し、グローバルな音声技術の発展に貢献するとともに、言語の平等と文化交流を促進しています。

全言語対応ASRの主な機能

  • 多言語音声文字起こしオムニリンガルASRは、1,600以上の言語で音声をテキストに変換できます。これには、リソースの少ない言語や、これまでAIによって文字起こしされたことのない言語も含まれます。
  • コミュニティ拡張機能ユーザーは、大量の学習データや専門知識を必要とせずに、少数の音声サンプルとテキストサンプルを提供するだけで、モデルを新しい言語に拡張できます。
  • 高性能かつ低エラー率78%の言語において、文字誤り率(CER)は10%未満であり、業界最高水準に達している。
  • 複数のモデルオプション軽量な300Mから堅牢な7Bまで、さまざまなデバイスや用途に適したモデルを取り揃えています。
  • オープンソースとデータ共有: オープンソースの多言語対応wav2vec 2.0モデルと多言語対応ASRコーパスデータセットは、世界中の開発者や研究者によるさらなる開発と研究を支援するために提供されています。

オムニリンガルASRの技術原理

  • wav2vec 2.0拡張機能これはwav2vec 2.0エンコーダーを70億個のパラメータに拡張し、生の音声データから多言語にわたる豊富な意味表現を抽出することを可能にする。
  • デュアルデコーダーアーキテクチャデコーダーは2種類使用されます。1つは従来型のコネクショニスト時間分類(CTC)デコーダー、もう1つはTransformerベースのデコーダーです。後者は大規模言語モデル(LLM)の技術を取り入れることで、ロングテール言語の性能を大幅に向上させています。
  • 文脈学習能力LLMにヒントを得たこのモデルは、大規模な学習データや複雑な調整を必要とせず、少数の文脈サンプルで新しい言語に迅速に適応できる。
  • 大規模多言語データセットトレーニングコーパスは、公開されているデータセットとコミュニティから提供された音声録音を統合しており、リソースの少ない多数の言語を網羅し、モデルのための幅広い言語的基盤を提供します。

多言語対応ASRプロジェクトの住所

  • プロジェクト公式サイト:https://ai.meta.com/blog/omnilingual-asr-advancing-automatic-speech-recognition/
  • GitHubリポジトリ:https://github.com/facebookresearch/omnilingual-asr
  • ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/facebook/omnilingual-asr-corpus
  • 技術論文:https://ai.meta.com/research/publications/omnilingual-asr-open-source-multilingual-speech-recognition-for-1600-languages/

オムニリンガルASRの応用シナリオ

  • 異言語間コミュニケーションこれは、異なる言語背景を持つ人々がリアルタイムでコミュニケーションをとることを助け、言語の壁を取り払い、国際協力と文化交流を促進する。
  • 低リソース言語保護絶滅の危機に瀕している言語や資源の乏しい言語向けに、高品質な音声文字起こしツールを提供し、言語の保存と継承に貢献します。
  • 教育と学習多言語教育における指導を支援したり、生徒の発音練習を助けたり、言語学習者向けに即時音声翻訳を提供したりすることができる。
  • 音声アシスタント拡張機能インテリジェント音声アシスタントの対応言語を増やし、より幅広いユーザー層に対応できるようにする。
  • コンテンツ制作とメディア多言語の動画および音声コンテンツを自動的に文字起こしし、コンテンツ作成効率を向上させ、多言語字幕の生成をサポートします。