AB
AiBoss
project

OmniAudio-2.6B - Nexa AIが発表したエッジサイド型マルチモーダル音声言語モデル

OmniAudio-2.6Bは、Nexa AIが開発した音声言語モデルで、エッジ環境への展開を想定して設計されており、高速かつ効率的な音声テキスト変換処理を実現します。OmniAudio-2.6Bは、2億6000万個のパラメータを持つマルチモーダルモデルで、Gemma-2-2と融合されています。

OmniAudio-2.6Bとは何ですか?

OmniAudio-2.6Bは、Nexa AIが提供する音声言語モデルで、エッジ環境への展開を想定して設計されており、高速かつ効率的な音声テキスト処理を実現します。OmniAudio-2.6Bは、2億6000万個のパラメータを持つマルチモーダルモデルで、Gemma-2-2b、Whisper Turbo、およびカスタム投影モジュールを統合し、自動音声認識と言語モデルの統合を最適化することで、レイテンシとリソース消費を削減します。2024 Mac Mini M4 Pro上では、OmniAudio-2.6BはQwen2-Audio-7B-Instructよりも5.5~10.3倍高速なデコード速度を実現しました。OmniAudio-2.6Bは、音声による質問応答、対話、クリエイティブコンテンツ生成など、さまざまなシナリオに適しています。Nexa SDKをベースとしたローカルデバイス上で動作し、強力なエッジAIソリューションをユーザーに提供します。

OmniAudio-2.6Bの主な機能

  • 音声認識と文字起こし音声入力をテキストに変換する機能で、会議議事録や音声メモなどの用途に適しています。
  • 音声Q&Aユーザーは音声でモデルに質問し、モデルはその質問を理解してテキストで回答を提供する。
  • 音声ダイアログこのモデルは音声対話に参加し、音声入力を理解し、それに対応するテキスト応答を生成することができる。
  • クリエイティブコンテンツの生成ユーザーは、音声入力に基づいて、詩や物語などの創造的なコンテンツを生成するようモデルに要求することができる。
  • 音声要約このモデルは、長期間にわたる音声録音を理解して要約し、重要な情報を要約して提供することができる。

OmniAudio-2.6Bの技術原理

  • 統合アーキテクチャGemma-2-2b、Whisper Turbo、およびカスタム投影モジュールを統合することで、従来のASRモデルとLLMモデルを連結することによって生じる遅延とリソース消費を削減します。
  • スパース性の利用言語モデルの埋め込み空間の疎性に基づいて、投影モジュールはWhisperの音声トークンをGemmaのテキスト埋め込みと整合したシーケンスにマッピングし、音声とテキストの効果的な融合を実現します。
  • 3段階のトレーニングプロセス
    • 事前トレーニングMLS English 10kの文字起こしデータセットを使用し、文字起こしタスクと完了タスクを区別するための特別なトークンを導入した。
    • 教師ありファインチューニング(SFT): 指示の調整のために、文字起こしデータセットに基づいて合成データセットを作成し、モデルが対話音声入力を理解して処理できるようにします。
    • 直接選好最適化(DPO)モデルの出力はGPT-4o APIに基づいて評価され、モデルの精度を向上させるためにエラー応答が特定され、最適化されます。
  • 高効率推論エンジンNexa SDKは、GGMLをベースとしたC++推論エンジンであり、エッジデバイスへの音声言語モデルの展開に特化して設計されており、効率的な音声言語モデルの推論を可能にします。
  • 定量化と最適化このモデルはFP16およびQ4_K_M量子化バージョンをサポートしており、メモリとストレージの要件を削減し、リソースに制約のあるエッジデバイスにも対応します。

OmniAudio-2.6Bのプロジェクトアドレス

OmniAudio-2.6Bの応用事例

  • スマートアシスタントとバーチャルアシスタントこれはスマートフォンやスマートホーム機器における音声対話の中核を成し、高速応答の音声認識機能と自然言語理解機能を提供する。
  • 車載システム音声制御、ナビゲーション、エンターテインメントシステムの操作などの機能を提供するために車に統合することができ、それによって運転の安全性と利便性を向上させることができる。
  • 会議議事録および議事録の書き起こしビジネスミーティング中に会議内容を自動的に録音・文字起こしし、会議の要約を作成して、業務効率を向上させます。
  • 教育と学習音声認識とフィードバックを提供することで、学習者の発音や言語能力の向上を支援し、言語学習をサポートします。
  • 健康管理医療現場では、音声コマンドは医療機器の制御や、患者への音声対話サービスの提供に用いられる。