project
MuScriptor - KyutaiとMireloによるオープンソースのマルチ楽器音楽楽譜作成モデル
MuScriptorは、KyutaiとMireloが共同開発したオープンソースのマルチ楽器音楽文字起こしモデルで、様々なジャンルの実際の音楽オーディオを自動的にMIDIに変換することができます。
MuScriptorとは何ですか?
MuScriptorは、KyutaiとMireloが共同開発したオープンソースのマルチ楽器音楽トランスクリプションモデルです。様々なジャンルの実際の音楽オーディオを自動的にMIDIに変換できます。MuScriptorは、17万曲もの楽曲を含む大規模な実世界データセットで学習された、この種のモデルとしては初のものです。純粋なデコーダーTransformerアーキテクチャを採用し、60Mから1.4Bまでの4つのパラメータスケールを提供し、楽器条件制御をサポートしています。また、コードはMITライセンスの下でオープンソースとして公開されています。
MuScriptorの主な機能
- 複数楽器の音声文字起こし複数の楽器を含む実際の音楽オーディオを、ピアノ、ギター、ドラム、ベースなど36種類の楽器に対応した標準MIDIフォーマットに自動的に変換します。
- マルチジャンル音楽対応ポップ、クラシック、ロック、ヘヴィメタルなど、さまざまな音楽ジャンルに対応しており、複雑な実際のミキシング作業にも適しています。
- 計器状態制御この機能により、ユーザーは文字起こしの対象となる楽器セットを指定でき、カスタマイズされた出力と、セグメント全体にわたる安定した楽器認識の一貫性を実現できます。
- 複数仕様モデルの選択本製品は、60M、103M、307M、1.4Bの4つのパラメータスケールを提供し、軽量展開と高精度要求の両方に対応します。
- エンドツーエンドの自動処理このモデルは、5秒間の音声スライスを入力として使用し、フレーム分割、特徴抽出、音符検出、MIDI生成といった一連のプロセスを自動的に完了します。
MuScriptorの技術的原則
- 純粋なデコーダー トランスフォーマーアーキテクチャこのモデルは、5秒間の音声スライスを入力として受け取り、16kHzのモノラル音声をメルスペクトログラムに変換し、自己回帰によってMIDIのようなトークンシーケンスを予測することで、エンドツーエンドの複数楽器の文字起こしを実現します。
- 3段階のトレーニング戦略このモデルは、まず150万個の合成MIDIデータで事前学習され、次に17万個の実際の音楽トラックで微調整され、最後にGRPOスタイルの強化学習を通じて300個の高品質なラベル付きデータトラックで事後学習され、高品質な出力と一致するように調整されました。
- 計器状態制御このモデルは、接頭辞埋め込みによる対象楽器セットの指定をサポートしており、ユーザーは転写する楽器の種類をカスタマイズできるとともに、分類器を使用しないガイダンスを使用して、断片全体にわたる楽器割り当ての一貫性を安定させることができます。
- データ合成および強化パイプライン事前学習段階では、動的な合成プロセスを採用し、ピッチシフト、テンポ変更、楽器のランダム化など、MIDIデータに対してシンボルレベルの処理を行います。250種類以上のサウンドフォントを使用して音声を合成し、ランダムなデチューンを加えることで汎化性能を向上させます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
MuScriptorの使い方
- 環境準備GitHubリポジトリをクローンし、依存関係をインストールして、システムがPythonやPyTorchなどの深層学習フレームワークをサポートするようにしてください。
- ダウンロード重量公式チャンネルから、対応するパラメータサイズ(103M、307M、または1.4B)のモデル重みファイルを入手してください。
- モデル提供された推論コードを使用してモデルを初期化します。機器の状態制御を有効にするかどうかを選択できます。
- 入力音声文字起こし対象の音声ファイル(複数のフォーマットに対応)をモデルに入力すると、モデルは自動的に処理のために5秒ごとのセグメントに分割します。
- MIDIを取得するこのモデルは標準的なMIDIファイルを出力するため、DAWや楽譜作成ソフトに直接インポートして編集することができます。
MuScriptorの主な利点
- 現実世界における最も強力な一般化能力合成データ(MT3など)で学習させたモデルと比較して、MuScriptorは17万曲もの実際のマルチ楽器楽曲で学習させたため、複雑でリアルなミキシング環境において、エラー率が著しく低くなっています。公式の説明では、現時点で最高のオープンソース・マルチ楽器楽譜作成モデルであると謳われています。
- 強化学習は高品質な出力を整合させるトレーニング後の段階でGRPOスタイルの強化学習を行うことにより、モデルは音符の開始、終了、およびフレームレベルでF1スコアをさらに向上させ、偽陰性および偽陽性を低減します。
- 柔軟な計器状態制御ユーザーは、文字起こしする楽器の種類を指定できるため、出力が効率化され、音声セグメント全体で楽器認識の一貫性が維持され、セグメント間の楽器割り当ての変動を回避できます。
- マルチ仕様のオープンソース本製品は、60Mから1.4Bまでの4つのモデルサイズを提供し、エッジデバイスへの展開と高精度要件の両方に対応します。コードはMITオープンソースであり、重みデータはCC BY-NC 4.0ライセンスで利用可能です。
MuScriptorのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/muscriptor/muscriptor
- ハギングフェイスモデルライブラリ:https://huggingface.co/MuScriptor
- arXiv技術論文:https://arxiv.org/pdf/2607.08168v1
MuScriptorと類似の競合製品との比較
| 比較対象寸法 | MuScriptor | YourMT3+ |
|---|---|---|
| 出版社 | Kyutai / Mirelo | 学術研究チーム |
| 建築 | 純粋なデコーダートランスフォーマー | 階層型アテンショントランスフォーマー + MoE |
| トレーニングデータ | 150万の合成MIDIトラック + 17万の実際の音楽トラック + 300のRLトラック | 小規模な合成データ+限られた実データ |
| コア戦略 | 強化学習後の実データによる微調整とトレーニング | アーキテクチャの改善+データセット間の機能強化 |
| 計器制御 | 明示的な楽器条件制御をサポートする | サポートされていません |
| オープンソースライセンス | コード MIT / 重み付け CC BY-NC 4.0 | 部分的にオープンソース |
| リアルなオーディオパフォーマンス | マルチF1スコアは約41.6で、F1スコアを大幅に上回ります。 | 基準値としては、それを上回った。 |
| 強度情報 | 単語分割機能は現在サポートされていません。 | 具体的な実装方法によって異なる |
MuScriptorの応用事例
- 音楽制作アシスタントプロデューサーは、MIDI情報を含まない既存のオーディオを、アレンジ、ミキシング、サンプリングが可能な編集可能なMIDIトラックに素早く変換できます。
- 自動楽譜生成音楽教育機関や出版社は、録音を自動的に楽譜に変換できるため、手作業による楽譜作成のコストを削減できる。
- 音楽情報検索これは、コード認識、調性分析、スタイル分類などの下流タスク向けに、高品質な記号入力を提供する。
- 生成型音楽モデリングこれは、音楽生成モデルのための大規模かつ高品質なMIDIトレーニングデータを提供し、記号音楽生成に関する研究を促進する。
- 音楽考古学とアーカイブ歴史的な録音やライブパフォーマンスなどの非構造化オーディオを構造化されたMIDIデータに変換することで、デジタル保存や分析を容易にします。