Fun-ASR - DingTalkとTongyiが共同で立ち上げた大規模音声認識モデル
Fun-ASRは、DingTalkとTongyi Labsの音声認識チームが共同開発した次世代音声認識モデルです。膨大な量の音声データで学習されており、インターネット、テクノロジー、インテリア、畜産など10以上の業界の専門用語を正確に認識できます。
Fun-ASRとは何ですか?
Fun-ASRは、DingTalkとTongyi Labsの音声チームが共同開発した次世代音声認識モデルです。膨大な量の音声データで学習されており、インターネット、テクノロジー、インテリア、畜産など10以上の業界の専門用語を正確に認識し、業界用語も理解できます。例えば、保険業界では、従来のモデルと比較して精度が18%向上し、インテリアや畜産などの業界では15%~20%の向上を実現しています。このモデルは、DingTalk内の企業情報を組み合わせて推論を最適化し、誤認識の問題を軽減して、より信頼性の高い文字起こし結果を提供します。Fun-ASRは、企業固有のモデル向けにカスタマイズされた学習をサポートしており、実際の企業音声データを使用してアルゴリズムをさらに最適化し、特定の語彙の認識精度を向上させることができます。また、最大1000語以上のホットワードのインポートにも対応しています。
現在、Fun-ASRはDingTalkの会議字幕、インテリジェント議事録、音声アシスタントなど、複数の機能モジュールに統合されており、企業レベルの環境において、安定性、効率性、拡張性に優れた音声認識ソリューションを提供しています。
Tongyi LabsはFun-ASRのコア機能を包括的にアップグレードし、ノイズの多い環境下での認識精度を93%に向上させました。31言語の自由な混合、歌詞やラップの認識に対応し、ストリーミング認識モデルの最初の単語の遅延を160msに短縮することで、複雑な環境下での音声認識性能を大幅に向上させています。さらに、軽量版のFun-ASR-Nano-0.8Bが正式にオープンソース化され、パラメータ総数が0.8Bに圧縮されたことで推論コストが削減されました。ローカル展開とカスタマイズされた微調整にも対応しており、開発者に効率的で柔軟な音声認識ソリューションを提供します。
Fun-ASRの主な機能
-
複数業界共通の用語認識Fun-ASRは、膨大な量の音声データで学習されており、インターネット、テクノロジー、インテリア、畜産、自動車など10以上の業界の専門用語を正確に識別できます。実際のテストでは、保険業界における精度が従来比18%向上し、インテリアや畜産などの業界でも15%~20%向上しました。最大1000語以上のホットワードのインポートに対応し、希少語の認識をさらに最適化します。
-
コンテキスト認識型最適化このモデルは、DingTalk内の企業情報(アドレス帳、カレンダー、ナレッジベースなど)を組み合わせることで最適化でき、大規模モデルで発生する可能性のある錯覚問題を効果的に軽減し、より信頼性の高い文字起こし結果を提供できます。ただし、有効にするには企業の承認が必要です。
-
企業向けカスタマイズ研修Fun-ASRは、効率的なエンドツーエンドのトレーニングアーキテクチャに基づいて、企業から提供される実世界の音声データに基づいてアルゴリズムを最適化することで、ブランド名、プロジェクトコード、製品名、個人名などの独自語の認識精度を向上させることができます。
-
マルチシナリオ統合アプリケーションFun-ASRは、会議の字幕や同時通訳、インテリジェント議事録、音声アシスタントなど、DingTalkの複数の機能モジュールに統合されており、企業レベルの環境において安定性、効率性、拡張性に優れた音声認識基盤を提供し、企業の高い音声認識要件を満たしています。
Fun-ASRの技術原理
-
膨大な量のデータを用いたトレーニングFun-ASRは、数億時間にも及ぶ音声データを用いて学習されており、様々な業界やシナリオを網羅しているため、異なる分野の専門用語を正確に理解することができます。
-
産業共創と最適化複数のDingTalkクライアントからの実際のシナリオを組み合わせることで、このモデルはインターネット、テクノロジー、インテリア、畜産、自動車など10以上の分野で非常に優れた性能を発揮し、専門用語認識の精度を大幅に向上させています。
-
文脈推論の最適化このモデルは、DingTalk内の既存の情報(アドレス帳、カレンダー、知識ベースなど)を組み合わせて推論を最適化することで、大規模モデルで発生する可能性のある錯覚問題を効果的に軽減し、より信頼性の高い文字起こし結果を提供します。
-
エンドツーエンドのトレーニングアーキテクチャFun-ASRは、効率的なエンドツーエンドのトレーニングアーキテクチャに基づいて、企業から提供される実世界の音声データを使用してアルゴリズムをさらに最適化し、特定の単語の認識精度を向上させ、企業固有のモデルのカスタマイズされたトレーニングをサポートすることができます。
-
カスタムホットワードのサポートこの機能により、企業はホットワードをカスタマイズでき、最大1000語以上のホットワードのインポートをサポートし、さらに希少語や独自用語の認識を最適化します。
Fun-ASRのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/FunAudioLLM/Fun-ASR
- ハギングフェイスモデルライブラリ:https://huggingface.co/FunAudioLLM/Fun-ASR-Nano-2512
Fun-ASRの応用シナリオ
-
会議の字幕と同時通訳Fun-ASRは会議の内容をリアルタイムで文字起こしし、正確な字幕と同時通訳サービスを提供することで、参加者が会議の要点をよりよく理解し、記録するのに役立ちます。
-
スマートミニッツこのモデルは、会議議事録を自動的に生成し、重要な情報とアクション項目を抽出することで、手作業による集計時間を節約し、会議の効率を向上させることができます。
-
音声アシスタント音声コマンドと音声対話に対応しており、ユーザーは音声コマンドを通じて情報照会やスケジュール設定などの様々な操作を完了できるため、ユーザーエクスペリエンスが向上します。
-
住宅装飾および畜産業KUKA Homeのような住宅リフォーム会社では、このモデルは「ベルギー産パルスラテックス」といった専門用語を正確に識別できるため、顧客ニーズの分析に確かな基盤を提供できます。畜産業界においても、関連用語を正確に識別できるため、企業の効率的な運営に役立ちます。
-
保険業界Fun-ASRの保険業界における活用は、音声認識の精度を大幅に向上させ、保険会社が顧客からの問い合わせや業務プロセスをより効率的に処理するのに役立っている。