project
SALMONN-2 - 清華大学などがオープンソース化した汎用音声言語モデル。
SALMONN-2は、清華大学、上海人工知能研究所、ケンブリッジ大学が共同でオープンソース化した汎用音声言語モデルです。ByteDanceのSPEAR統合自己教師あり音声エンコーダと多層特徴融合アダプタをベースに構築されており、...
SALMONN-2とは何ですか?
SALMONN-2は、清華大学、上海人工知能研究所、ケンブリッジ大学が共同でオープンソース化した汎用音声言語モデルです。ByteDanceのSPEAR統合自己教師あり音声エンコーダと多層特徴融合アダプタを基盤とし、テキストベースとしてQwen3を使用しています。約18,000時間の教師ありデータを用いて、MMAU-Pro、MMAR、MMSUという3つの主要な総合ベンチマークにおいて、同規模のオープンソースモデルの中で最高の性能を達成しました。汎用ALLMとしては初めて、音声イベント検出、音声偽造検出、音声品質評価、マルチモーダル文脈音声認識といった高度な機能を実現しています。
SALMONN-2の主な機能
-
オーディオに関する一般的な知識音声認識、音声解説、音楽理解、感情認識、話者照合など、複数の分野にまたがるタスクをサポートします。
-
音響イベント検出(SED)犬の鳴き声や足音などの環境音イベントの開始時刻と終了時刻を特定し、出力することができます。
-
音声ディープフェイク検出音声の信憑性を判断し、合成または編集された疑いのある部分が存在する時間帯を特定する。
-
音声品質評価(SQA)ノイズ、歪み、明瞭度といった低レベルの音響特性を感知し、品質スコアと説明を提供する。
-
マルチモーダル文脈音声認識(MICL)テキストのスペルと参照音声の発音を組み合わせることで、珍しい単語や稀な人名の認識精度を向上させることができる。
SALMONN-2の技術原理
- 統合型自己監視型オーディオエンコーダーSALMONN-2は、単一のオーディオフロントエンドとしてSPEARを使用します。エンコーダーは、自己教師あり学習によって大規模なラベルなしオーディオデータでトレーニングされ、意味、発音、音色、話者、音響環境情報を同時に取得できます。従来のWhisper+BEATSデュアルエンコーダーソリューションに代わり、アーキテクチャを簡素化しながら、よりバランスの取れたクロスドメイン機能を維持します。
- 多層フィーチャー融合(MLF)アダプタSPEARは、異なるレベルで情報をエンコードします。浅い層は音響/発音の詳細を保持し、中間層は音色/話者情報を伝達し、深い層は意味概念を蓄積します。MLFアダプタは、まず各層の隠れ状態に対して層正規化とスプライシングを実行し、次に学習可能なダウンプロジェクションとフレームグループ化圧縮を実行し、最後に融合された階層的表現を言語モデルの埋め込み空間にマッピングします。これにより、モデルはタスクの要件に応じて、異なるレベルの音響キューを柔軟に呼び出すことができます。
- タイムスタンプ挿入メカニズムこのモデルはタイムスタンプを自然言語テキスト(例:...)に変換します。
<2.0 seconds>音声シーケンスは、音声埋め込みと直接言語モデルに挿入され、インターリーブされるため、追加の専用タイムスタンプ埋め込みレイヤーを必要とせずに、統一された生成フレームワーク内で時間位置特定タスクを完了できます。 - マルチモーダルコンテキスト学習(MICL)トレーニング文脈依存型音声認識タスクでは、モデルはテキストバイアス語彙を受け取るだけでなく、これらの単語の参照発音音声をマルチモーダルな文脈として同時に取得します。トレーニング中は、干渉語とターゲット語をランダムに破棄する戦略を導入することで、過度のバイアスを防ぎ、音響的証拠のサポートを受けて文脈の手がかりを適切に利用することをモデルが学習できるようにします。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
SALMONN-2の使い方
- リポジトリにアクセスしてコードをクローンするGitHubリポジトリにアクセスする
https://github.com/bytedance/SALMONN/tree/salmonn2、使用git cloneコードをローカルマシンにダウンロードしてください。 - 実行環境を作成する:埋め込む
conda create -n salmonn2 python=3.10仮想環境を作成してアクティブ化し、pip、setuptools、およびwheelをアップグレードします。 - 依存関係とプロジェクトをインストールしますリポジトリのルートディレクトリで実行してください。
pip install -r requirements.txtそしてpip install -e . --no-depsSALMONN-2とそのランタイム依存関係のインストールを完了してください。 - 事前学習済み重みをダウンロードするHuggingFace CLI を介してモデルチェックポイントをダウンロードします。
hf download marcoyang/SALMONN-2-8B --repo-type model --local-dir /path/to/salmonn-2-hf。 - モデルと推論をロードする:使用
AutoProcessorそしてAutoModelForCausalLMローカルの重みを読み込み、音声ファイルと指示テキストを渡して、呼び出します...model.generate()音声理解の結果を得ることができます。
SALMONN-2の主な利点
-
データ効率約18,000時間分の教師ありデータを使用することで、同規模の競合他社が一般的に使用する数十万時間から数百万時間というデータ量よりもはるかに少ない量で、アノテーションコストを大幅に削減できます。
-
統一されたフロントエンドは、よりバランスの取れたアプローチを提供する。SPEARの自己教師ありエンコーダーを1つ使用することで、2つのエンコーダーを置き換えることができ、音声、環境音、音楽、および非言語的タスク全体でよりバランスの取れたパフォーマンスを実現します。
-
階層情報の完全な活用MLFアダプタは、エンコーダーのすべての層の機能を統合し、最後の層のみを使用することで失われる重要な音響/音色のディテールを回避します。
-
音声分析機能の拡張ALLM全般において初めて、このシステムは、SED、偽造検出、SQAなど、これまで軽視されてきた音声分析タスクをサポートする。
-
拡張可能テキストベースを8Bから30B-A3Bに拡張した後も、3つの総合ベンチマークのスコアは向上し続け、このアーキテクチャが優れた拡張性を持っていることが実証された。
SALMONN-2プロジェクトの住所
- GitHubリポジトリ:https://github.com/bytedance/SALMONN/tree/salmonn2
- ハギングフェイスモデルライブラリ:https://huggingface.co/marcoyang/SALMONN-2-8B
- arXiv技術論文:https://arxiv.org/pdf/2607.17079
SALMONN-2と類似の競合製品との比較
| 比較対象寸法 | SALMONN-2 | MOSS-Audio |
|---|---|---|
| モデルサイズ | 9B(Qwen3-8Bベース) | 9B |
| 教師ありトレーニングデータ | 約18,000時間 | 100万時間以上 |
| オーディオエンコーダー | SPEAR統合自己監視エンコーダー + MLF | 監視型シングルエンコーダ |
| MMAU-Pro | 58.5 | 57.5 |
| MMAR | 64.5 | 64.4 |
| MMSU | 69.5 | 66.4 |
| SED / 偽造品検出 / SQA | ネイティブサポート | システムではサポートされていません |
| マルチモーダルコンテキストASR | (音声+テキストのオフセット)に対応 | サポートされていません |
| オープンソースライセンス | オープンソース(GitHub + HuggingFace) | オープンソース |
SALMONN-2の応用シナリオ
-
スマートミーティングアシスタント会議の内容をリアルタイムで文字起こしできるだけでなく、参加者の発音例を組み合わせることで、外国語の名前や専門用語を正確に識別することもできます。
-
音声コンテンツレビューライブ配信やポッドキャストにおける異常な音声イベントを自動的に検知し、ディープフェイク音声を識別することで不正行為を防止します。
-
音声品質モニタリング顧客サービス通話とスタジオ録画映像の品質を自動的に評価し、ノイズや歪みのある部分を特定する。
-
マルチメディアアーカイブ検索過去の音声番組やラジオ番組について、タイムスタンプ付きのイベント説明を生成し、コンテンツに基づいた正確な検索を可能にする。
-
聴覚障害者向け補助機器このシステムは、聴覚障害のあるユーザーに対し、周囲の音(ドアベルやアラームなど)に関するリアルタイムの通知を、テキストとタイムスタンプの形式で提供します。