project
MuCodec - 清華大学、テンセントAI、香港中文大学が共同開発した、超低ビットレートの音楽コーデック。
MuCodecは、清華大学深圳国際大学院、テンセントAIラボ、香港中文大学の研究者らが共同開発した超低ビットレート音楽コーデックです。効率的な音楽圧縮と高忠実度再生を実現します。MuCodecは…
MuCodecとは何ですか?
MuCodecは、清華大学深圳国際大学院、テンセントAIラボ、香港中文大学の研究者らが共同開発した超低ビットレート音楽コーデックです。効率的な音楽圧縮と高忠実度な復元を実現します。MuCodecは、MuEncoderを使用して音楽から音響的特徴と意味的特徴を抽出し、RVQ技術を用いてこれらの特徴を離散化し、ストリームマッチングに基づいてMel-VAE特徴を再構築します。最後に、事前学習済みのMel-VAEデコーダとHiFi-GANを使用して再構築された音楽を生成し、0.35kbpsから1.35kbpsのビットレートで業界最高水準の圧縮効率と音質を実現します。
MuCodecの主な機能
- 音楽圧縮MuCodecは、極めて低いビットレートでも効果的に音楽を圧縮することができ、最小ビットレートは0.35kbpsです。
- 音楽復元超低ビットレートで高音質音楽を再現できる。
- 特徴抽出MuEncoderは、音楽の音響的特徴と意味的特徴を抽出し、その本質的な特性を捉えるために使用されます。
- 離散化抽出された特徴量は、RVQ(残差ベクトル量子化)技術に基づいて離散化され、圧縮が容易になる。
- ストリームマッチング再構成ストリームマッチング手法を用いてMel-VAEの特徴を再構築し、より精緻な音声再構築を実現する。
- ダブルビットレート対応低ビットレート(0.35kbps)と高ビットレート(1.35kbps)の両方で動作可能で、柔軟なアプリケーションオプションを提供します。
MuCodecの技術原理
- MuEncoderMuEncoderを特徴抽出器として使用することで、音楽の2つの重要な側面、すなわちボーカルとBGMに基づいて、音響的特徴と意味的特徴が抽出されます。
- 2段階トレーニング:
- フェーズ1MuEncoderは、マスクされた言語モデルを用いてマスクされた領域を学習および予測するように制約されています。マスクされていない音声信号に基づいて、文脈情報を認識し、表現能力を向上させることができます。
- フェーズ2メルスペクトログラムとCQT(Constant-Q Transform)特徴の再構築、および抽出された特徴に意味情報が含まれることを保証する歌詞認識など、再構築と歌詞認識のための制約を導入します。
- RVQ(Residual Vector Quantization): RVQはMuEncoderの特徴を離散化するために選択され、表現は残差処理に基づいて圧縮され、連結されたコードブックによってより洗練された近似が提供されます。
- ストリームマッチング再構成はフローマッチングに基づく手法を用いて行われます。この手法はGAN(敵対的生成ネットワーク)手法よりも学習が安定しており、超低ビットレートの再構成タスクにおいて、より少ない学習ステップでより良い結果が得られます。フローマッチングでは、離散化されたMuEncoder表現を条件として使用し、拡散トランスフォーマーに基づいてきめ細かい再構成が行われます。
- Mel-VAEデコーダとHiFi-GAN再構築されたメルスペクトログラムは、事前学習済みのMel-VAEデコーダーによって復元され、最終的に、事前学習済みのHiFi-GANを使用して再構築された音楽が生成される。
MuCodecのプロジェクトアドレス
- プロジェクト公式サイト:xuyaoxun.github.io/MuCodec_demo
- GitHubリポジトリ:https://github.com/xuyaoxun/MuCodec
- arXiv技術論文:https://arxiv.org/pdf/2409.13216
MuCodecの応用シナリオ
- オンライン音楽ストリーミングサービス音楽ファイルのサイズを大幅に縮小しつつ音質を維持することで、オンライン音楽ストリーミングサービスプロバイダーはストレージと帯域幅のコストを削減できる。
- 音楽ダウンロードユーザーはより小さな音楽ファイルをダウンロードできるため、モバイルデバイスのストレージ容量を節約し、データ消費量を削減できます。
- 言語モデルの構築短い音楽データシーケンスを必要とする言語モデルを構築する場合、音楽データを効果的に圧縮することで処理効率が向上する。
- 音声編集および処理ソフトウェアこの音声編集ソフトウェアは、音声圧縮および再構成ツールとしてMuCodecを統合しており、より効率的な音声処理機能を提供します。
- モバイルデバイスおよび組み込みシステムストレージ容量や処理能力が限られているモバイル機器や組み込みシステムにおいて、音質を維持しながらリソース消費量を削減する。