AB
AiBoss
project

ACE-Step 1.5 - ACE StudioがStepFunと共同開発した音楽生成モデル。

ACE-Step 1.5は、ACE StudioとStepFunが共同開発したオープンソースの音楽生成モデルであり、民生用ハードウェア上で商用レベルの音楽生成を可能にします。このモデルはハイブリッドアーキテクチャを採用しており、言語モデルがプランナーとして機能し、ユーザーのプロンプトを組み込みます。

ACEステップ1.5とは何ですか?

ACE-Step 1.5は、ACE StudioとStepFunが共同開発したオープンソースの音楽生成モデルで、コンシューマー向けハードウェア上で商用レベルの音楽生成を可能にします。このモデルはハイブリッドアーキテクチャを採用しており、言語モデルがプランナーとして機能し、ユーザーのプロンプトを楽曲の設計図に変換します。一方、拡散トランスフォーマーが音響レンダリングを処理します。4~8段階の蒸留推論により、A100ではわずか2秒、RTX 3090では約10秒で4分間の楽曲を生成し、VRAM要件は4GB未満です。ACE-Step 1.5は50以上の言語に対応し、正確なスタイル制御、カバー、再描画、ボーカルから楽器への変換などの編集機能をサポートしています。ユーザーは少数の楽曲でLoRAをトレーニングすることで、パーソナライズされたスタイル転送を実現できます。

ACE-Step 1.5の主な機能

  • 音楽世代テキストプロンプトから完全な楽曲を生成する機能をサポートしており、歌詞は50以上の言語に対応しています。また、10秒の短いループから10分間の長編作品まで、あらゆる長さの楽曲に柔軟に対応できます。
  • 編集機能オーディオの再レンダリング、カバー曲の生成、ボーカルから伴奏への変換、トラックの分離、レイヤードアレンジ、継続補完という6つの主要な編集機能を提供し、既存のオーディオを高度に制御および再作成することを可能にします。
  • スタイルコントロール専門的な音楽用語を含む複雑なキューワードを正確に解析・実行し、サンプルを一切使用しない音色複製と厳密なスタイル遵守を実現します。
  • パーソナライゼーションユーザーは、いくつかの参考曲を提供するだけで、最小限の微調整でLoRAを通じて独自のパーソナルスタイルを捉えたカスタマイズモデルを迅速に学習させることができます。
  • 効率特性このモデルは、4GB未満のビデオメモリを搭載した一般消費者向けGPU上でローカルに実行でき、1秒未満の高速生成を実現するとともに、バッチ並列サンプリングをサポートすることで、多様なクリエイティブ候補を探索できます。

ACEステップ1.5の技術的原則

  • ハイブリッド推論拡散アーキテクチャACE-Step 1.5は、音楽生成を計画段階とレンダリング段階の2段階に分離する、2つのコンポーネントからなる協調アーキテクチャを採用しています。言語モデル(Qwen3-0.6Bに基づく)は「作曲家エージェント」として機能し、思考連鎖推論を用いて、ユーザーのプロンプトをBPM、調性、持続時間、歌詞、音響記述を含むYAML形式の設計図に変換します。拡散トランスフォーマー(約20億個のパラメータ)は音響レンダラーとして機能し、標準化された条件を受け取り、高忠実度オーディオの生成に特化します。この分業により、DiTは意味理解の負担から解放され、LMのマルチタスク学習によって50以上の言語間で堅牢な整合性が確保されます。
  • 効率的な推論最適化コンシューマー向けハードウェア上でリアルタイム生成を実現するため、チームは敵対的動的オフセット蒸留技術を導入しました。この技術は、Decoupled DMD2をベースに、GANターゲットと潜在空間識別器を導入しています。オフセットパラメータを{1,2,3}からランダムにサンプリングすることで、モデルは多様なノイズ除去状態にさらされ、固定ステップサイズによる過学習を回避します。このアプローチにより、推論ステップが50から4~8に圧縮され、A100上で240秒のオーディオトラックを約1秒で生成し、200倍の高速化を実現しました。さらに、敵対的フィードバックにより、生徒モデルは教師モデルよりも優れた音質性能を発揮します。
  • 内在的強化学習のアライメントこのシステムは、外部バイアスを回避するために統一された内部強化学習フレームワークを確立します。DiT では、アテンションアライメントスコア (AAS) が内在報酬として提案されています。動的時間伸縮法を使用して、歌詞トークンのカバレッジ、アテンションの単調性、およびパスの信頼度を測定します。最適化後、歌詞と音声の同期と人間の判断との相関は 95% を超えます。LM では、GRPO アルゴリズムが採用され、ポイント相互情報を使用して報酬モデルが構築されます。LM は、「作曲家」と「リスナー」の二重の役割とみなされます。PMI は、一般的な説明にペナルティを与え、特定の注釈に報酬を与えるために使用されます。最終的な報酬は、スタイルと雰囲気 (50%)、歌詞の内容 (30%)、およびメタデータ制約 (20%) によって動的に重み付けされます。
  • 統一マスク生成フレームワーク有限スカラー量子化 (FSQ) は、連続オーディオ潜在変数を 5Hz コードブック表現に離散化し、柔軟なマスク生成パラダイムを構築します。ソース潜在変数とマスク構成を操作することで、単一のモデルで、テキストから音楽への変換、カバー曲、再レンダリング、トラック抽出、レイヤリング、補完の 6 つのモダリティをサポートできます。FSQ は、アテンション プーリングによって 25Hz の潜在空間を構造化されたソース潜在変数に圧縮します。ノイズターゲットとマスクとの連結後、構造化された表現は patchify レイヤーによって処理され、マルチタスクのトレーニングが簡素化されます。潜在変数を量子化することで、変換プロセス中にメロディーとリズム要素の忠実度が確実に保持されます。

ACE-Step 1.5のプロジェクトアドレス

  • プロジェクト公式サイト:https://ace-step.github.io/ace-step-v1.5.github.io/
  • GitHubリポジトリ:https://github.com/ace-step/ACE-Step-1.5
  • arXiv技術論文:https://arxiv.org/pdf/2602.00744
  • オンラインでデモを体験してください:https://huggingface.co/spaces/ACE-Step/Ace-Step-v1.5

ACE-Step 1.5の適用シナリオ

  • 音楽作曲および制作ミュージシャンやプロデューサーは、ACE-Step 1.5をインスピレーション生成ツールとして活用することで、テキストによる説明を素早く完成された楽曲の草稿に変換し、創作上の行き詰まりを打破することができます。
  • パーソナライズされたコンテンツ作成コンテンツ制作者は、LoRAを使用して自身のスタイルモデルを微調整し、ビデオ、ポッドキャスト、ゲームなどのプロジェクト向けにカスタマイズされたBGMを一括生成することで、異なる作品間で音色の一貫性を維持することができます。
  • 多言語音楽制作このモデルは50以上の言語で正確な歌詞生成と歌唱をサポートしており、グローバルな音楽配信、異文化協力プロジェクト、そしてあまり話されていない言語の音楽市場におけるコンテンツ制作に適しています。
  • 教育と学習音楽学習者は、専門用語(特定の旋法やコード進行など)を入力することで、モデルが生成した結果を観察することができ、それによって音楽理論の概念を直感的に理解することができる。