project
Hy ASR 3.0プレビュー - テンセント・フンユアンの次世代音声認識モデル
Hy ASR 3.0プレビューは、テンセント渾源が発表した次世代音声認識モデルです。Hy3大規模言語モデルをベースに、高精度音声認識と高度な意味理解を統合しています。このモデルは、北京語、英語、広東語、および10の主要方言地域に対応しています。
Hy ASR 3.0プレビューとは何ですか?
Hy ASR 3.0プレビューは、テンセント・フンユアンが発表した次世代音声認識モデルです。Hy3大規模言語モデルをベースに、高精度音声認識と深い意味理解を統合しています。中国語、英語、広東語、および10の主要方言地域に対応し、文脈依存型インテリジェント誤り訂正、ホットワード挿入、高ノイズ/ささやき声などの複雑なシナリオでも堅牢性を発揮します。オープンソース評価セットにおけるWER(Warnings Evidence:警告証拠)は約3%に抑えられており、独自構築の評価セットでは競合製品を総合的に凌駕しています。
Hy ASR 3.0プレビューの主な機能
-
一般的かつ正確な認識: 中国語(北京語)、英語、広東語、および中国語と英語の混合に対応しており、長い音声クリップにおけるタイプミス、省略、エラーの蓄積を軽減します。
-
文脈的意味理解: 文脈を組み合わせることで、ユーザーの文脈を正確に捉え、同音異義語を賢く修正し、意味の曖昧さを排除します。
-
ホットキーワード挿入の適応: ブランド名、人名、業界用語などの人気キーワードの強化をサポートし、ビジネスへのアクセスコストとメンテナンスコストを削減します。
-
複雑な環境下でも堅牢性を発揮: 高騒音、ささやき声、私的な会話といった音響環境向けに最適化されており、安定した認識性能を維持します。
-
方言は広く使われている。 東北方言、広東語、呉語、閩南語など、10の主要な方言地域と20以上の二次的な下位地域をサポートしています。
Hy ASR 3.0プレビューの技術原理
-
アーキテクチャのアップグレード: 本システムはMoEアーキテクチャを採用し、ベースモデルをHy3にアップグレードしています。また、数千万時間分の音声データで学習させた独自の教師なし音声エンコーダを開発し、高品質な音響表現を抽出します。
-
事前学習スケーリング: エンコーダーはLLMと連携してトレーニングされ、数千万時間にも及ぶ多様な音声データ(オーディオブック、対話、ビデオ/放送など)を取り込み、多段階の機能注入を通じて方言理解と文脈モデリングの能力を獲得します。
-
トレーニング後の強化: 複雑な音声、あらゆるコンテキスト、および一般的な機能を網羅する高品質なSFTレシピを構築し、多段階強化学習を通じて、一般的な文字起こし精度、長距離コンテキスト依存性、および複雑なロングテールシナリオにおけるパフォーマンスを最適化します。
Hy ASR 3.0プレビュー版の使い方
Tencent Cloud APIにアクセスするか、Tencent Yuanbaoを開いて音声入力ボタンを長押しすることで、無料で体験できます。
Hy ASR 3.0プレビューの主な利点
-
意味理解の向上: Hy3大規模言語モデルをベースに、高精度音声認識と高度な意味理解を統合し、単語ごとの文字起こしから文脈理解へと進化し、ワンクリックで直接出力します。
-
評価のあらゆる面で主導的な役割を果たす: オープンソースの評価セットのWERは約3%である一方、独自に構築した評価セットは、一般的な状況、方言、文脈、複雑な音響シナリオにおいて、競合製品を上回る性能を発揮する。
-
コンテキストに基づいたインテリジェントなエラー訂正: 文脈を組み合わせて正確な文脈を捉え、同音異義語をインテリジェントに修正し、意味の曖昧さを排除し、長期的な依存関係のモデリングをサポートします。
-
トレンドキーワードに迅速に対応する: ブランド名、人名、業界用語などの一般的なキーワードの挿入をサポートし、専門的な場面におけるビジネスアクセスとメンテナンスのコストを削減します。
-
方言や複雑な環境への対応: 10の主要な方言地域と20以上の二次的な方言地域に対応し、騒音やささやき声などの複雑な音響環境下でも安定した性能を維持します。
Hy ASR 3.0プレビューと競合製品の比較
| 比較対象寸法 | Hy ASR 3.0 プレビュー (テンセント渤源) | Doubao-Seed-ASR 2.0 (バイトダンス) |
|---|---|---|
| 基本モデル | Hy3大規模言語モデルに基づくMoEアーキテクチャ | シード大規模言語モデルに基づく |
| 音声エンコーダー | 当社が独自開発した教師なし音声エンコーダーは、数千万時間分のデータを用いて学習されました。 | 詳細なアーキテクチャは非公開 |
| 中核となる能力 | 文脈的意味理解 + 高精度認識 + ホットワード挿入 | 高精度ユニバーサル認識 |
| 中国語のWER | 3.34% | 3.70% |
| 英語 WER | 2.62% | 5.65% |
| 広東語 WER | 3.12% | 5.25% |
Hy ASR 3.0プレビューのアプリケーションシナリオ
-
インテリジェントな顧客サービス: 電話やオンラインの顧客サービス場面において、Hy ASR 3.0プレビューは、ホットワード挿入によってブランド名やビジネス用語を正確に識別し、リアルタイムの音声文字起こしを可能にすることで、サービス対応の効率を大幅に向上させます。
-
コンテンツ作成: ポッドキャスト、会議、インタビューなどの長尺音声コンテンツの制作において、このモデルは文脈的な意味理解を組み合わせることで、曖昧さを巧みに排除し、一貫性があり読みやすい高品質のテキストをワンクリックで出力し、ポストエディットのコストを削減します。
-
音声検索: ユーザーが方言を使って質問できるようにし、騒がしい環境でも音声コマンドを正確に認識することで、複数の言語やアクセントを持つユーザーの入力ハードルを効果的に低減します。
-
オフィスでのコラボレーション: リアルタイムの会議議事録の書き起こしシナリオにおいて、このモデルはささやき声や私的な会話といった低音量の入力に対しても安定した認識を維持し、チームの効率的なコミュニケーションと情報保持を支援します。
-
スマート端末: 車載ナビゲーションやスマートホームなどのIoTデバイスとの連携において、このモデルは特に高ノイズ環境向けに最適化されており、複雑なシナリオでも堅牢な音声認識と優れたユーザーエクスペリエンスを保証します。