project
Granite-4.0-1b-speech - IBMのオープンソース多言語音声モデル
Granite-4.0-1b-speech は、IBM が提供するオープンソースの 10 億パラメータの多言語音声モデルです。英語、フランス語、ドイツ語、スペイン語、ポルトガル語、日本語の音声認識に加え、英語との双方向翻訳にも対応しています。また、英語から日本語への翻訳もサポートしています。
Granite-4.0-1b-speechとは何ですか?
Granite-4.0-1b-speechは、IBMが開発したオープンソースの10億パラメータ多言語音声モデルです。英語、フランス語、ドイツ語、スペイン語、ポルトガル語、日本語の音声認識に加え、英語との双方向翻訳にも対応しています。また、英語からイタリア語、英語から中国語への一方向翻訳もサポートしています。このモデルは、16層のコンフォーマーエンコーダとQフォーマー投影層アーキテクチャに基づいており、HuggingFace Open ASR Leaderboardで平均単語誤り率わずか5.52%を達成しています。推論を高速化する投機的デコードをサポートし、エンタープライズレベルの音声文字起こしやエッジデバイスへの展開にも十分なコンパクトさを備えています。
Granite-4.0-1b-speech の主な機能
- 多言語音声認識英語、フランス語、ドイツ語、スペイン語、ポルトガル語、日本語の6言語で自動音声認識をサポートし、音声入力を対応するテキスト出力に変換できます。
- 双方向音声翻訳このモデルは、英語と上記6言語間の双方向自動音声翻訳を可能にし、ユーザーが異なる言語間でのリアルタイムの音声翻訳とコミュニケーションを行うことを可能にします。
- 一方通行の音声翻訳このモデルは、英語からイタリア語、および英語から中国語(北京語)への一方向の音声翻訳をサポートしています。
- キーワードバイアスの特定このモデルはキーワードを提案する機能を備えており、ユーザーは提案された単語の末尾に特定の用語を追加することで、名前、地名、専門用語の略語の認識精度を高めることができます。
- セキュリティ保護メカニズム馴染みのない形式や異常な形式の音声プロンプトを受信した場合、モデルは自動的にデフォルトの文字起こしモードに戻り、敵対的な入力攻撃によって生じるセキュリティリスクを効果的に低減します。
- 高効率な推論処理の高速化このモデルは投機的復号技術をサポートしており、最適化されたコンフォーマーエンコーダーのトレーニングにより、280倍のリアルタイム性で高速推論を実現します。
- エッジデバイスへの適応わずか10億個のパラメータを持つコンパクトなアーキテクチャのおかげで、このモデルはリソースが限られたエッジデバイス上で効率的に展開および実行できます。
Granite-4.0-1b-speech の重要な情報と使用要件
- 開発者:IBM 。
- 中核となる能力英語、フランス語、ドイツ語、スペイン語、ポルトガル語、日本語の6言語の認識に対応しており、英語との双方向翻訳も可能です。また、英語からイタリア語、中国語への翻訳にも対応しています。
- 環境要件: Transformers ≥ 4.52.1、torchaudio、soundfile。CUDAおよびApple Siliconをサポート。
- 音声要件モノラル、16kHzサンプリングレート、
<|audio|>タグが導入されました。 - 安全に関する推奨事項Granite Guardianと併用して、危険なコンテンツを検出するために使用されます。
Granite-4.0-1b-speech の主な利点と価値
- 究極の効率性わずか10億個のパラメータという軽量アーキテクチャにより、リアルタイム処理の280倍の推論速度を実現し、優れた認識性能を維持しながら計算リソースの消費量を大幅に削減するため、エッジデバイスやリソース制約のある環境での展開・運用に特に適しています。
- 正確な識別このモデルは、HuggingFace Open ASR Leaderboardベンチマークにおいて平均単語誤り率5.52%を達成し、Librispeech Cleanデータセットでは1.42%という優れた性能を示し、より多くのパラメータを持つ同様のモデルに匹敵する精度を実現しました。
- 多言語対応単一のモデルで、英語、フランス語、ドイツ語、スペイン語、ポルトガル語、日本語の6言語での音声認識を同時にサポートするとともに、これらの言語と英語間の双方向音声翻訳も実現し、多国籍企業のグローバル事業における多言語処理ニーズに対応します。
- エンタープライズセキュリティこのモデルには、見慣れない入力や異常な入力プロンプトを検出すると自動的にデフォルトの文字起こしモードに戻るセキュリティ保護メカニズムが組み込まれており、悪意のある攻撃のリスクを効果的に回避します。Apache 2.0オープンソースライセンスと組み合わせることで、企業での商用利用における法的保護も提供されます。
- 柔軟で使いやすいこのモデルは、Transformers、vLLM、MLXなどの複数の主要な推論フレームワークをネイティブにサポートしており、キーワードリストバイアス機能を提供することで、ユーザーがプロンプトをカスタマイズし、特定の用語、名前、略語の認識精度を高め、多様なビジネスシナリオに対応できるようにしています。
Granite-4.0-1b-speech の使い方
- 依存関係をインストールします:埋め込む
pip install transformers torchaudio soundfileApple Siliconを使用する場合は、必要なライブラリをインストールしてください。mlx-audio。 - モデル:合格
AutoProcessor.from_pretrainedそしてAutoModelForSpeechSeq2Seq.from_pretrainedプロセッサとモデルを別々にロードし、それぞれ設定してください。torch_dtype=torch.bfloat16効率的な推論を可能にする。 - 音声を準備するオーディオの寸法がモデルの入力要件を満たしていることを確認するために、サンプリングレート16kHzのモノラルオーディオファイルを読み込みます。
- 組み立てのヒント:使用
<|audio|>音声導入のためのマーキング、apply_chat_template対話形式のプロンプトを生成し、最後にキーワードリストを追加してバイアス認識を実現します。 - 実行理由プロセッサは、キューとオーディオをモデル入力に変換するために呼び出されます。
model.generate出力を生成し、それをデコードして、最終的なテキスト結果を取得します。 - 展開方法高並行性サービス展開にはvLLMを選択するか、Apple Siliconデバイス上でMLXをローカルで実行してください。
Granite-4.0-1b-speech のプロジェクトアドレス
- ハギングフェイスモデルライブラリ:https://huggingface.co/ibm-granite/granite-4.0-1b-speech#granite-40-1b-speech
Granite-4.0-1b-speechと類似の競合製品との比較
| 寸法 | Granite-4.0-1b-speech | OpenAI Whisper |
|---|---|---|
| 言語サポート | 入力言語は6種類で、ヨーロッパ、アメリカ、アジアの主要言語を中心に構成されています。 | 99言語に対応しており、中国語の認識を含む幅広い言語範囲を提供します。 |
| モデルサイズ | 10億個のパラメータ、軽量かつ効率的 | パラメータの範囲は非常に小さいものから大きいものまで多岐にわたる。 |
| 特別な機能 | キーワードバイアス、加速された推測的解読 | 非常に汎用性が高く、エンドツーエンドでマルチタスクを実行可能 |
| オープンソースライセンス | Apache 2.0、商用利用にも適しています | MITライセンスもオープンソースです。 |
| 適用可能なシナリオ | エンタープライズグレードのエッジ展開、リアルタイム翻訳 | 多言語による普遍的な認識、研究、探査 |
Granite-4.0-1b-speechの応用シナリオ
- 会議議事録の書き起こしこのモデルは、多言語の会議音声をリアルタイムでテキスト記録に変換でき、英語、フランス語、ドイツ語、スペイン語、ポルトガル語、日本語の6言語での参加者の音声認識をサポートし、構造化された会議議事録を自動的に生成します。
- 国境を越えた顧客サービスサポート多言語での顧客対応をサポートし、リアルタイムの音声テキスト変換と英語との双方向翻訳を可能にすることで、カスタマーサービス担当者がさまざまな言語での顧客ニーズを理解し、正確に対応できるよう支援します。
- 動画字幕生成多言語動画コンテンツ向けに正確な字幕を自動的に生成し、キーワードバイアスによって専門用語、人名、地名を正確に認識することで、字幕の品質を向上させます。
- リアルタイム同時通訳国際会議やビジネス交渉において、リアルタイムの音声通訳支援を提供し、6つの言語と英語間の相互通訳をサポートすることで、言語間のコミュニケーションにおける障壁を低減します。