AB
AiBoss
project

Nemotron Speech ASR - NVIDIAのオープンソース音声認識モデル

Nemotron Speech ASRは、NVIDIAが開発したオープンソースの音声認識モデルで、低遅延かつリアルタイムのストリーミング音声認識に特化しています。キャッシュ対応アーキテクチャを採用し、処理済みの音声特徴量をキャッシュすることで、新しい音声フレームに対してのみ計算を実行し、単一文の文字起こしを実現します。

Nemotron音声認識(ASR)とは何ですか?

Nemotron Speech ASRは、NVIDIAが提供するオープンソースの音声認識モデルで、低遅延かつリアルタイムなストリーミング音声認識に特化しています。キャッシュ対応アーキテクチャを採用し、処理済みの音声特徴量をキャッシュして新しい音声フレームに対してのみ計算することで、1文の文字起こしをわずか24ミリ秒で完了させます。これにより、従来のストリーミングモデルにおける長時間の音声認識における累積遅延の問題を効果的に解決します。このモデルは、複数の遅延モード(80ms、160ms、560ms、1.12秒)をサポートしており、再学習なしでアプリケーションシナリオに応じて柔軟に調整できます。ゲーム音声、リアルタイム翻訳、会議録音など、さまざまなシナリオに適しています。エンドツーエンドの遅延を500ミリ秒以内に抑え、高いスループットと低い運用コストを実現し、句読点と大文字小文字の区別をネイティブにサポートしています。

Nemotron Speech ASRの主な機能

  • 低遅延リアルタイム認識低遅延のリアルタイムストリーミングシナリオ向けに特別に設計されたこの技術は、1文の文字起こしロックにかかる時間がわずか24ミリ秒で、人間の神経応答速度とほぼ同等であるため、極めて高いリアルタイム性が求められる音声対話シナリオに適しています。
  • キャッシュ対応アーキテクチャキャッシュを考慮した設計を採用し、処理済みの音声特徴量を直接キャッシュし、新しい音声フレームの増分部分のみを計算することで、繰り返し計算を回避し、長時間の音声認識における累積遅延の問題を効果的に解決します。
  • 複数の遅延モード80ms、160ms、560ms、1.12秒など、複数のレイテンシモードをサポートしており、モデルを再学習することなく、さまざまなアプリケーションシナリオに応じて柔軟に調整できるため、極めて高速な処理から高精度な処理まで、多様なニーズに対応できます。
  • 高い処理能力と低い運用コスト従来のストリーミングモデルと比較して、スループットが高く、同じGPUメモリの制約内でより多くの並列ストリームを処理でき、本番環境における運用コストを大幅に削減します。
  • エンドツーエンドの低遅延エンドツーエンドの遅延は500ミリ秒以内に抑えられており、音声によるやり取りのスムーズさと即時性を確保しています。
  • 句読点と大文字のネイティブサポートこのモデルは句読点と大文字小文字をネイティブにサポートしており、認識結果の読みやすさと使いやすさを向上させています。
  • 統合型音声インテリジェントエージェントソリューションNemotron Speech ASRは単体モデルではなく、完全な音声エージェントソリューションに統合されています。Nemotron 3 Nano 30B(LLM)およびMagpie(TTS)と連携して動作し、真の音声エージェント構築のための包括的なサポートを提供します。

Nemotron音声認識の技術原理

  • キャッシュを考慮した設計エンコーダーの状態キャッシュを保持することで、処理済みの音声特徴量が保存されます。新しい音声フレームが到着すると、キャッシュが直接呼び出され、現在の増分のみが計算されるため、繰り返し計算が回避され、極めて低遅延のリアルタイム処理が実現します。
  • 増分計算メカニズム従来のストリーミングモデルとは異なり、Nemotron Speech ASRは過去のデータを再エンコードしません。代わりに、キャッシュされたアクティベーション値に基づいて増分計算を実行することで、長時間の音声認識における累積遅延の問題を効果的に解決します。
  • 動的遅延調整複数のレイテンシモード(80ms、160ms、560ms、1.12秒など)をサポートしており、モデルを再学習することなく推論フェーズ中にレイテンシを柔軟に調整できるため、さまざまなシナリオのレイテンシ要件に対応できます。
  • 高効率並列処理最適化されたアーキテクチャにより、同じGPUメモリの制約下でより多くの並列ストリームを処理できるため、スループットが大幅に向上し、本番環境における運用コストが削減されます。
  • エンドツーエンドの最適化音声入力からテキスト出力までの全プロセスが最適化され、エンドツーエンドの遅延が500ミリ秒以内に抑えられ、リアルタイムの音声対話のニーズを満たしています。
  • コンテキスト認識デコード: 構成可能なコンテキスト サイズ パラメータ (例:att_context_sizeこのモデルは、認識精度と遅延時間のバランスをさらに最適化するために、文脈情報の利用方法を動的に調整します。

Nemotron Speech ASRプロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/NVIDIA-NeMo/NeMo
  • ハギングフェイスモデルライブラリ:https://huggingface.co/nvidia/nemotron-speech-streaming-en-0.6b

Nemotron音声認識の応用シナリオ

  • リアルタイム音声アシスタントこれは、インテリジェント音声アシスタント向けに低遅延の音声認識機能を提供し、ユーザーの音声コマンドに即座に応答することを可能にし、インタラクティブな体験を向上させます。
  • ゲーム音声インタラクションゲームシナリオにおいては、低遅延の音声チャットとコマンド認識をサポートし、プレイヤー間のリアルタイムなコミュニケーションとインタラクションを強化します。
  • リアルタイム翻訳これは、多言語環境におけるリアルタイム音声翻訳に使用され、ある言語の音声コンテンツを別の言語のテキストまたは音声に迅速に変換することで、異言語間のコミュニケーションを促進します。
  • 会議議事録会議の場面では、高精度な音声認識機能を提供し、議事録をリアルタイムで生成することで、会議の効率性を向上させます。
  • ライブインタラクションライブ配信中は、視聴者の参加意識とインタラクティブな体験を高めるために、リアルタイムの字幕が提供されます。
  • 顧客サービスシステムカスタマーサービスにおいては、ユーザーからの音声による問題を迅速に特定し、即座に対応することで、カスタマーサービスの効率性とユーザー満足度を向上させる。