project
Parakeet TDT 0.6B - NVIDIAのオープンソース自動音声認識モデル
Parakeet TDT 0.6Bは、NVIDIAがリリースしたオープンソースの自動音声認識(ASR)モデルです。FastConformerエンコーダとTDTデコーダのアーキテクチャを採用し、テキストタグとその継続時間を予測することで推論を高速化し、計算の複雑さを軽減します。
Parakeet TDT 0.6Bとは何ですか?
Parakeet TDT 0.6Bは、NVIDIAが提供するオープンソースの自動音声認識(ASR)モデルです。FastConformerエンコーダとTDTデコーダのアーキテクチャを採用し、テキストタグとその継続時間を予測することで推論を高速化し、計算オーバーヘッドを削減します。このモデルは、60分間の音声を1秒で文字起こしでき、リアルタイムファクター(RTFx)は3386、平均単語誤り率(WER)はわずか6.05%です。LibriSpeech-cleanデータセットでは、WERは1.69%と低く、Hugging Face Open ASRリーダーボードで1位を獲得しています。
Parakeet TDT 0.6Bの主な機能
- 迅速な転写1秒で60分間の音声を処理でき、これは既存の主流のオープンソースASRモデルよりも50倍高速です。
- 高精度転写Hugging FaceのOpen ASRリーダーボードにおいて、その単語誤り率(WER)はわずか6.05%であり、オープンソースモデルの中でもトップクラスにランクインしている。
- 歌詞の書き起こし同社は、楽曲を歌詞に変換する機能を先駆的に開発し、音楽業界やメディア業界に応用した。
- テキストの書式設定デジタル形式とタイムスタンプ形式に対応しており、会議議事録、法的文書、医療記録などの読みやすさを向上させます。
- 句読点の復元句読点や大文字・小文字を自動的に生成できるため、読みやすくなり、自然言語処理にも役立ちます。
- 高いリアルタイム性NVIDIAのTensorRTとFP8量子化技術を活用することで、リアルタイムレート(RTF)は3386に達する。
インコTDT 0.6Bの技術原理
- エンコーダこのシステムは、Transformerのグローバルアテンションメカニズムと畳み込みネットワークのローカルモデリング機能を組み合わせたFastConformerアーキテクチャを採用しており、長文音声を効率的に処理できます。
- デコーダこれはTDT(Transducer Decoder Transformer)アーキテクチャを採用しており、ストリーミング音声認識における従来のトランスデューサの効率性と、言語理解におけるトランスフォーマーの利点を組み合わせている。
- 全体構造このモデルは、6億個のパラメータを持つエンコーダ・デコーダ構造を採用しており、推論効率を向上させるために量子化カーネルと融合カーネルをサポートしています。
- トレーニングデータこのデータセットは、Granaryと呼ばれるマルチソース音声コーパスで学習されており、約12万時間の英語音声が含まれています。これには、手動で注釈が付けられたデータ1万時間と、高品質の擬似ラベル付き音声11万時間が含まれています。
- 推論最適化NVIDIAハードウェア向けに最適化されており、TensorRTとFP8量子化技術を組み合わせることで、リアルタイムレート(RTF)3386という極めて高い高速化を実現しています。
Parakeet TDT 0.6B プロジェクトアドレス
- ハギングフェイスモデルライブラリ:https://huggingface.co/nvidia/parakeet-tdt-0.6b-v2
Parakeet TDT 0.6B の応用シナリオ
- コールセンター顧客との会話をリアルタイムで文字起こしすることで、作業指示書の要約が生成され、顧客サービスの効率が向上します。
- 会議議事録タイムスタンプ付きの議事録を自動生成するため、参加者は議事録を素早く確認・整理できます。
- 法律および医療記録訴訟記録や医療記録を正確に書き起こし、文書の読みやすさと正確性を向上させます。
- 字幕生成動画コンテンツに字幕をすばやく追加して、視聴体験を向上させましょう。
- 音楽インデックス楽曲の内容を歌詞に変換することで、音楽やメディアプラットフォームに適した形式にし、音楽コンテンツのインデックス作成と分析を拡大する。
- 教育テクノロジー言語学習アプリの発音評価機能をサポートし、学生がより効果的に言語を学習できるよう支援します。