AB
AiBoss
project

OSUM - 西北工業大学が開発したオープンソースの音声理解モデル

OSUM(Open Speech Understanding Model)は、西北工業大学コンピュータサイエンス学部の音声・言語処理研究グループによって開発されたオープンソースの音声理解モデルです。OSUMは、WhisperエンコーダとQwen2 LLMを組み合わせています。

OSUMとは何ですか?

OSUM(Open Speech Understanding Model)は、西北工業大学コンピュータサイエンス学部音声・言語処理研究グループが開発したオープンソースの音声理解モデルです。WhisperエンコーダとQwen2 LLMを組み合わせたOSUMは、自動音声認識(ASR)、音声感情認識(SER)、話者性別分類(SGC)など、さまざまな音声タスクに対応しています。OSUMは「ASR+X」マルチタスク学習戦略に基づいており、モダリティアライメントとターゲットタスク最適化を用いて、効率的かつ安定した学習を実現しています。約5万時間分の多様な音声データで学習されたOSUMは、複数のタスクで優れた性能を発揮し、特に中国語ASRとマルチタスク汎化において卓越した性能を示しています。

OSUMの主な機能

  • 音声認識音声をテキストに変換し、複数の言語と方言に対応しています。
  • タイムスタンプ付き音声認識音声の内容を認識しながら、各単語またはフレーズの開始時刻と終了時刻を出力する。
  • 音声イベント検出:音声中の特定の出来事(笑い声、咳、背景雑音など)を認識する。
  • 音声感情認識: 会話における感情状態(喜び、悲しみ、怒りなど)を分析する。
  • 音声スタイルの認識話し手のスタイル(ニュース放送、顧客対応の会話、日常会話など)を特定する。
  • 話者の性別分類話者の性別(男性または女性)を判断します。
  • 話者の年齢予測話者の年齢層を予測してください(例:子供、大人、高齢者)。
  • 音声テキストチャット音声入力を対話システムで使用するための自然言語応答に変換する。

OSUMの技術原則

  • Speech Encoderウィスパー・ミディアムモデル(7億6900万個のパラメータ)を用いて、音声信号を特徴ベクトルにエンコードします。
  • Adaptorこれは、3つの畳み込み層と4つのトランスフォーマー層で構成されており、音声の特徴を言語モデルへの入力に適合させるために使用されます。
  • LLM(言語モデル)Qwen2-7B-Instructをベースに、LoRA(低ランク適応)を用いてマルチタスクの要件に適応するように微調整されている。
  • マルチタスクトレーニング戦略
    • ASR+Xトレーニングパラダイム音声認識(ASR)タスクと、SER、SGCなどの追加タスクを同時に学習させます。共通の特徴と最適化目標に基づいて、モデルの汎化能力と安定性を向上させます。
    • 自然言語プロンプトLLMに様々な自然言語による指示を与えることで、モデルは様々なタスクを実行するように誘導される。
  • データ処理とトレーニングWhisperモデルは、マルチタスク学習のために約5万時間分の多様な音声データを用いて学習されました。データセットには、オープンソースデータと社内で処理されたデータの両方が含まれています。学習は2つのフェーズに分かれており、まずWhisperモデルをマルチタスク学習用に微調整し、次にLLMと組み合わせてさらに教師あり学習を行いました。

OSUMプロジェクトの住所

OSUMの適用シナリオ

  • インテリジェントな顧客サービス音声認識と感情分析に基づいて、顧客のニーズを自動的に理解し、パーソナライズされたサービスを提供します。
  • スマートホーム音声コマンドとバックグラウンドイベントを認識し、音声インタラクション体験を最適化します。
  • 教育ツール生徒の発話を分析し、個別の学習フィードバックを提供する。
  • メンタルヘルスモニタリング: 発話における感情の変化を検出し、精神状態の評価を支援する。
  • マルチメディアコンテンツ制作動画編集を支援するために、字幕とタグを自動生成します。