project
Dolphin - 清華大学と海天瑞生が共同開発した大規模音声認識モデル
Dolphinは、清華大学電子工学部音声・オーディオ技術研究所と海天瑞生が共同開発した、東洋言語向けの大規模音声モデルです。中国語の22の方言(…を含む)を含む40の東洋言語の音声認識をサポートしています。
Dolphinとは何ですか?
Dolphinは、清華大学電子工学部音声・オーディオ技術研究所と海天瑞生が共同開発した、東洋言語向けの大規模音声モデルです。中国語(北京語を含む)の22の方言を含む40の東洋言語の音声認識をサポートし、異なる地域の言語特性を正確に識別できます。このモデルは、138,000時間の高品質な独自データと74,000時間のオープンソースデータを含む、合計212,000時間のトレーニングを受けています。パフォーマンス面では、Dolphinの単語誤り率(WER)は、同規模のWhisperモデルよりも大幅に低く、例えば、基本バージョンでは平均WERが63.1%削減され、小型バージョンでは68.2%削減されています。本システムは、E-BranchformerエンコーダとTransformerデコーダを組み合わせたCTC-Attentionアーキテクチャを採用し、重要な音声情報を保持しながら4倍ダウンサンプリング層によって計算を高速化します。
Dolphinの主な機能
- 多言語および方言認識Dolphinは40の東洋言語の音声認識をサポートしており、幅広い言語範囲をカバーし、さまざまな言語環境における音声認識のニーズを満たします。
- 高精度音声認識Dolphinは、音声信号を効率的かつ正確にテキストに変換できます。複数の言語や方言を含む音声認識タスクにおいて高い精度を維持し、音声テキスト変換プロセスにおけるエラーや誤解を効果的に低減します。
- 言語と地域の設定をカスタマイズするユーザーは、実際のニーズに応じて音声認識の言語と地域を柔軟に指定できます。Dolphinは2段階の言語ラベル付けシステムを採用しています。最初のラベルは言語(例:<zh>は中国語)を指定し、2番目のラベルは地域(例:<CN>は中国)を指定します。これにより、モデルは同じ言語内の異なる方言やアクセントの違い、および同じ地域内の異なる言語間の類似性を正確に捉えることができ、特定の言語および地域環境におけるモデルの認識性能を向上させ、汎化能力を高めます。
- オープンソースのサポートと二次開発Dolphinの基本モデルおよび小規模版のモデルと推論コードは完全にオープンソースであり、開発者にとって非常に便利です。このオープンソースの性質により、開発者は特定のアプリケーションシナリオに合わせてモデルを微調整したり、モデルの機能を拡張したりするなど、自身のニーズに応じてモデルをさらに開発および最適化することができ、個々の要件を満たし、音声認識技術のより多くの分野への応用と革新を促進します。
- 便利で素早い使用方法Dolphinは、コマンドライン呼び出しやPython API呼び出しなど、複数の使用方法を提供します。ユーザーは、簡単なコマンドラインコマンドで音声認識タスクを迅速に開始したり、Python環境内で音声処理および分析用のモデルを柔軟に呼び出したりすることで、他のアプリケーションやシステムとの統合を容易にし、開発効率とアプリケーションの柔軟性を向上させることができます。
ドルフィンの技術原理
- CTCアテンションアーキテクチャDolphinは、CTC(Connectionist Temporal Classification)のシーケンスモデリング機能とアテンションメカニズムのコンテキスト捕捉機能を組み合わせたCTC-Attentionアーキテクチャを採用しています。これにより、高い処理速度を維持しながら音声情報の微妙な変化を効果的に捉えることができ、複雑な音声入力を処理する際のモデルの認識精度と効率が向上します。
- E-BranchformerエンコーダE-Branchformerエンコーダは並列分岐構造を採用しており、入力音声信号の局所的および全体的な依存関係をより効果的に捉えます。これにより、モデルはより豊富な特徴表現を得ることができ、音声信号内の複雑なパターンをよりよく理解し、認識精度を向上させることができます。
- トランスフォーマーデコーダーDolphinのデコーダーはTransformerアーキテクチャを採用しています。Transformerはシーケンス・トゥ・シーケンス処理に優れ、高品質なテキスト出力を生成します。自己注意機構により、テキスト内の長距離依存関係を効果的に捉え、最終出力の品質と一貫性を確保します。
- 4倍ダウンサンプリング層トレーニングの効率とパフォーマンスをさらに向上させるため、Dolphinは4倍ダウンサンプリング層を導入しました。これにより、入力特徴量のシーケンス長が短縮され、計算処理が高速化され、重要な音声情報が保持され、モデルの認識性能に影響が出ないことが保証されます。
- 2段階言語タグ付けシステムDolphinは革新的な2段階言語タグ付けシステムを採用しています。最初のタグは言語(例:中国語の場合は<zh>)、2番目のタグは地域(例:中国の場合は<CN>)を指定します。これにより、同一言語内の異なる方言やアクセントの違い、および同一地域内の異なる言語間の類似性をモデルが捉えることが可能になり、近縁の方言を区別する能力と汎化能力が向上します。
ドルフィンのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/DataoceanAI/Dolphin
- ハギングフェイスモデルライブラリ:https://huggingface.co/DataoceanAI
- arXiv技術論文:https://arxiv.org/pdf/2503.20212
Dolphinの応用シナリオ
- 会議議事録会議の音声コンテンツを自動的にテキスト記録に変換し、作業効率を向上させます。
- 音声入力方法スマートデバイスでは、音声でテキストを入力できるため、手動入力の手間が省け、入力速度と利便性が向上します。
- インテリジェント音声アシスタント複数の言語と方言に対応しており、ユーザーの音声コマンドをより正確に理解し、より正確なフィードバックを提供し、方言やアクセントによる誤解を軽減できます。
- スマートホームユーザーは音声コマンドで照明やエアコンなどのスマートホーム機器を操作でき、自宅のインテリジェンスと利便性を向上させることができます。
- ニュースメディアニュースインタビューやポッドキャストなどの音声コンテンツを素早くテキストに変換し、編集や公開を容易にします。
- 言語学習これは複数の言語や方言の認識をサポートしており、学生が発音や言語表現を練習するのに役立ちます。