AB
AiBoss
project

LLaMA-Omni - 中国科学院が開発した、低遅延・高音質の音声対話モデル

LLaMA-Omniは、中国科学院計算技術研究所および中国科学院大学の研究者によって開発された、大規模言語モデル(LLM)を用いた低遅延かつ高品質な音声対話を実現するための新しいモデルアーキテクチャです。これは、事前学習済みのモデルを統合し、...

LLaMA-Omniとは何ですか?

LLaMA-Omniは、中国科学院計算技術研究所と中国科学院大学の研究者によって開発された、大規模言語モデル(LLM)を用いた低遅延かつ高品質な音声対話を実現する革新的なモデルアーキテクチャです。事前学習済みの音声エンコーダ、音声アダプタ、LLM、リアルタイム音声デコーダを統合することで、音声コマンドからテキストと音声による応答を直接かつ迅速に生成し、従来の音声テキスト変換の手順を不要にすることで応答速度を向上させています。このモデルは最新のLLaMA-3.1-8B-Instructモデルをベースに構築され、独自に開発したInstructS2S-200Kデータセットを用いて学習されており、わずか226ミリ秒という低遅延で応答を迅速に生成します。さらに、LLaMA-Omniは高い学習効率を誇り、4台のGPUで3日以内に学習を完了できるため、最新のLLMに基づいた将来の音声対話モデルの効率的な開発の基盤となります。

LLaMA-Omniの主な機能

  • 低遅延音声認識音声コマンドから迅速に応答を生成し、待ち時間を短縮します。
  • 音声認識によるテキスト変換音声をテキストに書き起こすことなく、直接テキスト応答を生成します。
  • 高品質な音声合成テキスト応答を生成すると同時に、対応する音声出力も生成できる。
  • 効率的な研修プロセストレーニングは、より少ないコンピューティングリソース(例えば4つのGPU)で、より短い時間(3日未満)で完了できます。
  • ストリーミングオーディオのデコードリアルタイム音声合成は、非自己回帰型ストリーミングTransformerモデルに基づいて実現される。
  • マルチモーダルな相互作用テキストモードと音声モードを組み合わせることで、より自然で人間らしい対話体験を提供します。

LLaMA-Omniの技術原理

  • 音声エンコーダー事前学習済みのWhisper-large-v3モデルを音声エンコーダーとして使用し、ユーザーの音声コマンドから特徴表現を抽出します。
  • 音声アダプタこれは、音声エンコーダの出力を大規模言語モデル(LLM)の埋め込み空間にマッピングするものです。ダウンサンプリングによってシーケンス長が短縮され、モデルが音声入力を処理できるようになります。
  • 大規模言語モデル(LLM)LLM(言語学習モジュール)としてLlama-3.1-8B-Instructをベースにしており、強力なテキスト生成機能を誇ります。音声コマンドから直接テキスト応答を生成するため、音声認識によるテキスト変換といった中間的な処理が不要になります。
  • ストリーミング音声デコーダー非自己回帰型(NAR)ストリーミングTransformerアーキテクチャを採用する。音声応答に対応する離散単位シーケンスを予測するために、接続性時間分類(CTC)を用いる。
  • 2段階トレーニング戦略フェーズ1:音声コマンドから直接テキスト応答を生成するようにモデルをトレーニングする。フェーズ2:音声応答を生成するようにモデルをトレーニングする。
  • データセット構築(InstructS2S-200K)20万件の音声コマンドと、それに対応するテキストと音声応答が含まれています。このモデルは、音声対話のシナリオに適応するように訓練されています。

LLaMA-Omniプロジェクトの住所

LLaMA-Omniの応用シナリオ

  • スマートアシスタントとバーチャルアシスタントスマートフォン、スマートホーム機器、およびパーソナルコンピュータ上で音声対話サービスを提供する。
  • 顧客サービスコールセンターやカスタマーサポートシステムでは、音声認識と音声応答が顧客からの問い合わせや問題への対応に利用されている。
  • 教育と訓練言語学習、コース説明、インタラクティブな授業など、インタラクティブな学習体験を提供します。
  • 医療相談遠隔医療や健康相談では、音声によるやり取りを用いて医療情報やアドバイスを提供する。
  • 自動車産業車両システムに統合することで、音声制御によるナビゲーション、エンターテイメント、通信機能を提供できる。
  • アクセシビリティと支援技術視覚障害者や運動機能障害者が音声操作を用いて機器やサービスを操作できるよう支援する。