AB
AiBoss
project

Qinyueビッグモデル - テンセントのAI音楽制作ビッグモデル

QinYue Big Modelは、Tencent AI LabとTencent TME Tianqin Labが共同開発したAI搭載の音楽制作モデルです。このモデルは、中国語または英語のキーワード、説明的なフレーズ、または音声を入力することで、ステレオ音声などを直接生成できます。

秦楽ビッグモデルとは何ですか?

Qinyue Big Modelは、Tencent AI LabとTencent TME Tianqin Labが共同開発したAI搭載の音楽制作モデルです。このモデルは、中国語と英語のキーワード、説明的なフレーズ、または音声を入力することで、ステレオ音声やマルチトラックの楽譜を直接生成できます。Qinyue Big Modelは、指定されたトラックや小節の継続や再生成、楽器の種類やリズムの変更など、自動編集機能をサポートしています。現在、Qinyue Big Model技術はTencent MusicのQimingxingプラットフォームで利用可能で、ユーザーは無料で登録して体験できます。研究チームは今後、音楽制作のニーズにより良く応えるため、ボーカル、歌詞、その他の要素を生成する機能をモデルに追加する予定です。

秦楽大型モデルの特徴

  • 音楽世代このモデルは、ユーザーが指定したキーワード、説明的なフレーズ、または音声入力に基づいて、インテリジェントに音楽を生成できます。この生成はテキストによる説明だけでなく、音声コンテンツも理解するため、自動的な音楽制作が可能になります。
  • 楽譜生成「Qinyue Big Model」は音声生成に加えて、メロディー、コード、伴奏、パーカッションなど複数のトラックを含む詳細な楽譜も生成でき、ユーザーに豊かな音楽構造を提供します。
  • 自動編集このモデルは、生成された楽譜に対して、楽譜の続きの作成、特定のトラックや小節の再生成、オーケストレーションの調整、楽器の種類やリズムの変更など、一連の自動編集操作をサポートしており、作成の柔軟性と効率性を大幅に向上させます。
  • 音声テキストの配置対照学習技術を用いることで、このモデルは共有特徴空間を構築し、音声タグやテキスト説明を音声自体と整合させ、生成モデルに条件付き制御信号を提供し、音楽生成の関連性と精度を向上させる。
  • 楽譜/音声表現の抽出このモデルは、楽譜や音声を、大規模な言語モデルによる予測の基礎となる一連の離散的な特徴(トークン)シーケンスに変換することができる。
  • 大規模言語モデル予測デコーダーのみの構造を使用することで、モデルは特徴予測(次のトークンの予測)によって学習され、予測されたシーケンスを楽譜や音声に変換することで、テキストから音楽への変換を実現します。
  • 音声復元ストリームマッチングとボコーダー技術を用いることで、このモデルは予測された音声表現シーケンスから可聴音声を復元することができ、音声のリアリティと品質を向上させる。
  • 音楽理論は音楽生成の過程において、「秦岳ビッグモデル」は音楽理論に従い、メロディー、コード、リズムといった要素が音楽的な論理と人間の美意識に合致するように設計されている。

Qinyue大型モデルを体験して使用する方法

  1. 登録とログインTencent Music Rising Star Platform にアクセス (https://y.qq.com/venus/#/venus/aigc/ai_compose()、アカウントを登録するか、既存のアカウントを使用してログインしてください。
  2. 入力生成条件エクスペリエンスページで、音楽のキーワード、フレーズ、または説明を入力してください。これらは、モデルが音楽を生成する際の基礎となります。
  3. 音楽モデルを選択現在選択可能なのは、琴音楽生成大型モデルv1.0のみです。
  4. 音楽の長さを選択してください音楽の長さは10秒から30秒まで選択できます。
  5. 音楽を生成する「生成開始」をクリックし、音楽が生成されるまで約1分お待ちください。生成された音楽は再生およびダウンロードできます。

大型ピアノモデルの技術原理

  • 音声テキストアライメントモデルこのモジュールは、対照学習を用いて、音声ラベルまたはテキスト記述と音声との間に共通の特徴空間を構築します。これにより、モデルはテキストと音声間の意味的な関係を理解し、生成プロセス中にこの情報を条件付き制御信号として利用することができます。
  • 楽譜/音声表現の抽出このモデルは、楽譜や音声を、MIDI属性の表現、あるいは事前学習済みの音声スペクトルのエンコードおよび圧縮表現である、離散的な特徴シーケンスに変換します。
  • 大規模言語モデルこの手法では、デコーダのみの構造を持つ大規模な言語モデルを用いて、次のトークンの予測を学習します。このモデルは、入力された特徴シーケンスに基づいて次の特徴を予測できるため、連続した音楽要素を生成できます。
  • ストリームマッチングとボコーダー技術音声生成プロセスにおいて、このモデルはストリームマッチング技術とボコーダーモジュールを使用して、予測された音声表現シーケンスを可聴音声に変換し、音声のリアリティを高めます。
  • 複数モジュールによる共同作業「音楽生成モデル」は、複数のモジュールが連携して目的の音楽生成効果を実現するように構成されている。例えば、音声とテキストのアライメントモデルは、学習時には条件付き制御信号を提供し、推論時にはテキスト表現を制御信号として使用する。
  • 音楽理論は音楽を生成する過程において、モデルはメロディー、コード、リズムといった要素の合理性を含む音楽理論に従う必要があり、生成された音楽が人間の聴覚習慣や美的基準に適合するようにしなければならない。
  • 自動編集と調整このモデルは、生成された楽譜の自動編集をサポートしており、曲の続き、指定されたトラックや小節の再生成、楽器の種類やリズムの変更などが可能になるため、音楽制作プロセスがより柔軟になります。
  • エンドツーエンドの生成プロセステキスト入力から音声出力まで、「Qinyue Big Model」はエンドツーエンドの生成プロセスを実現し、手作業による介入を減らし、音楽制作の効率を向上させます。
  • 大規模二重盲検聴力検査このモデルの生成品質は、大規模な二重盲検法による聴取テストによって検証され、その多次元的な主観評価スコアは業界標準を上回った。