project
Khala - 中央音楽学院と清華大学が共同開発したオープンソースのAI音楽モデル。
Khalaは、中央音楽学院と清華大学が共同開発したオープンソースのAI音楽モデルで、高忠実度な楽曲生成を目的としています。このモデルは64層の深層音響トークン階層を採用し、テキストによる説明や歌詞に基づいた楽曲生成をサポートしています。
カーラとは何ですか?
Khalaは、中央音楽学院と清華大学が共同開発したオープンソースのAI音楽モデルで、高忠実度な楽曲生成を目的としています。このモデルは64層の深層音響トークン階層を採用し、テキストによる説明や歌詞に基づいて楽曲全体を生成できます。ボーカルの明瞭度、楽器の分離、歌詞のリズムの一致において、オープンソースとしては最高レベルの性能を実現しています。プロジェクトでは、コード、モデルの重み、および導入手順を公開しています。ローカル環境での動作には24GBの専用ビデオメモリが必要となるため、現状ではオープンソースプラットフォームとして技術系ユーザー向けとなっています。
カーラの主な機能
-
テキスト生成ソングテキストで説明を入力すると、ボーカルと伴奏を含む完全な楽曲が生成されます。
-
歌詞の条件付き生成オリジナルの歌詞に基づいてメロディーやボーカルを生成し、歌詞と音楽の同期を実現する機能をサポートしています。
-
高忠実度オーディオ出力生成された音声は、過渡特性、倍音、楽器の音色といった点で、オリジナル音声の品質により近いものとなっている。
-
ボーカルと伴奏は別々に生成されています音響トークン階層モデリングを用いることで、人間の声と楽器の音が混ざり合って不明瞭になる問題を軽減できる。
-
時間軸合わせ制御歌詞と声の特徴とのタイミングの一致を強化し、不明瞭な単語、逆再生された単語、リズムのずれを軽減します。
カーラの技術原則
- 音響トークン言語モデルKhalaは音響トークン言語モデルに基づいています。このモデルは音を非常に細かい離散的な音響単位に分解し、これらの単位間の構成や順序関係を学習できるようにします。
- 64層の深い階層構造このモデルは64層の音響トークン階層を採用しており、音を微細なレベルで分解します。このきめ細かな表現により、楽器の過渡特性や倍音のディテールをより容易に保持でき、オーディオ全体の質感の明瞭度が向上します。
- 歌詞と音声のタイミング同期メカニズムトレーニングと楽曲制作の過程で、カーラは歌詞と音響要素の時間的な整合性の制約を強化する。歌詞、ビート、ボーカルのバリエーションを同じ時間軸に固定することで、歌詞のずれやアクセントのずれを軽減し、パフォーマンスの自然さを高める。
Khalaの使い方
-
プロジェクトリポジトリにアクセスするコードとモデルの重みを取得するには、GitHubまたはHugging FaceでKhalaプロジェクトのホームページを検索してください。
-
ハードウェア環境の準備少なくとも24GBのビデオメモリを搭載したローカルGPU(RTX 4090推奨)を用意してください。
-
依存関係をインストールしますリポジトリに記載されているデプロイ手順に従って、Python環境と関連する依存関係を設定してください。
-
モデルの重みを読み込んでいます事前学習済みのモデルの重みをダウンロードし、ローカル環境にロードしてください。
-
入力条件生成このモデルは、テキストプロンプトまたは歌詞ファイルを入力として使用して、完全な楽曲を生成します。
-
エクスポートと後処理生成された音声をエクスポートして、ミキシングやマスタリングを行い、最終製品の品質を向上させてください。
Khalaの主な利点
-
オープンソースで無料コードとモデルの重みは完全にオープンソースであり、ローカル環境にデプロイできるため、著作権やデータセキュリティのリスクを回避できます。
-
はっきりとした声従来のオープンソースモデルと比較すると、発音がより安定しており、AIの音が目立ちにくく、実際の人が歌っているようなリスニング体験が得られます。
-
高い機器分離64層のアコースティックトークン構造により、各楽器の過渡音と倍音がより明瞭になり、混濁しにくくなります。
-
歌詞のリズムが一致しているタイムライン調整メカニズムにより、文字の欠落、文字の反転、リズムのずれといった問題が大幅に軽減されます。
-
学術的な推薦中央音楽学院と清華大学が共同開発したこのシステムは、音楽の専門知識と工学的な能力を融合させたものである。
カーラのプロジェクト住所
- GitHubリポジトリ:https://github.com/Khala-Music-AI/Khala
- ハギングフェイスモデルライブラリ:https://huggingface.co/liujiafeng/Khala-MusicGeneration-v1.0
- arXiv技術論文:https://arxiv.org/pdf/2605.01790
Khalaの競合製品比較
| 比較対象寸法 | Khala | MRT2 |
|---|---|---|
| 研究開発機関 | 中央音楽学院 + 清華大学 | Google Magenta |
| テクニカルルート | 音響トークン言語モデル(64層構造) | コーデックLM + フレームレベル自己回帰(SpectroStream) |
| 生成モード | オフラインでフルソング生成 | リアルタイムストリーミング生成(200msの遅延) |
| 人間の声のサポート | はい、歌詞の同期再生に対応しています。 | はい、リアルタイム音声合成に対応しています。 |
| 歌詞の配置 | 強力なタイムライン調整メカニズム | 中くらい |
| パラメータサイズ | 非公開 | 2.4B(Base)/ 230M(Small) |
| ハードウェア要件 | RTX 4090(24GB VRAM) | Apple Silicon(M1以降) |
| 出力音質 | 高音質、クリアなボーカル | 48kHzステレオリアルタイム出力 |
| 中核的な利点 | ボーカルの明瞭さと歌詞のリズムの同期 | リアルタイムインタラクション+MIDIコントロール |
Khalaのアプリケーションシナリオ
-
音楽プロトタイプミュージシャンはこのモデルを使って、デモ音源を素早く作成し、メロディーと歌詞を一致させた効果を検証することができる。
-
学術研究音楽技術やオーディオAI分野の研究者は、アルゴリズム実験や論文の複製にこれを利用できる。
-
独立系開発者との連携開発者はオープンソースコードに基づいて二次開発を行い、独自の音楽制作ツールやプラットフォームを組み込むことができる。
-
著作権に配慮したシナリオ企業や組織は、商用プラットフォーム上での著作権紛争を回避するために、オンプレミスでプライベートに展開することができる。
-
音楽教育これは、大学や高等教育機関の教員や学生が、AI支援作曲や音響モデリングの原理に関する教育デモンストレーションや研究に利用できる。