project
Stable Audio 3 - Stability AIによるオープンソースの音声生成モデルシリーズ
Stable Audio 3 は、Stability AI による次世代のオープンソース音声生成モデルです。ストリームマッチング潜在空間拡散アーキテクチャに基づいており、テキストから音楽や効果音への変換、音声編集、および継続をサポートしています。Stable Audio 3 は Sma...
Stable Audio 3とは何ですか?
Stable Audio 3は、Stability AIが提供する次世代のオープンソース音声生成モデルです。ストリームマッチング潜在空間拡散アーキテクチャに基づき、テキストから音楽や効果音への変換、音声編集、音声継続をサポートしています。Stable Audio 3は、Small、Medium、Largeの3つのモデルを提供しています。SmallバージョンはMacBook Pro上でローカルに実行でき、最大2分間の音声を生成できます。一方、MediumおよびLargeモデルは、6分を超える高品質な音声生成に対応しています。すべてのモデルは、ライセンス済みのデータを使用して学習されており、SmallおよびMediumモデルはオープンな重みを持ち、LoRAファインチューニングにも対応しているため、2秒未満で高速な推論が可能です。
Stable Audio 3の主な特徴
-
テキスト音声生成このシステムは、英語のテキストでユーザーに指示を与えることで、インストゥルメンタル音楽や環境音を生成でき、出力時間は秒単位で正確に制御できる。
-
可変長オーディオ合成このモデルは、リクエスト期間の割合に応じて潜在空間のシーケンス長を割り当てることで、固定された最大長によって引き起こされる計算およびメモリの無駄を回避します。
-
部分的な音声編集と修復この機能により、単一または複数のマスキングセグメントを使用して音声を部分的に修復し、元のセグメントを保持したまま対象領域を置き換えることができます。
-
音声インテリジェント継続拡張機能因果マスキング機構を用いることで、既存の音声を首尾一貫して継続させ、短い録音を6分を超える完全な作品へと拡張する。
-
LoRAスタイルの微調整LoRAのトレーニング資料と、小・中程度の重み付けデータが初めて利用可能になり、ユーザーは自身のオーディオライブラリを使用して、カスタムスタイルを効率的に調整できるようになりました。
-
エンドツーエンドのローカル展開バージョン3.0 Smallは、MacBook Proなどの一般消費者向けデバイスで完全オフライン動作をサポートしており、ネットワーク接続なしでプライバシーを保護したコンテンツ作成を可能にします。
Stable Audio 3の技術原理
-
セマンティック音響オートエンコーダーSAMEアーキテクチャに基づき、44.1kHzステレオは4096倍のダウンサンプリングを経て256次元の潜在空間にマッピングされ、高忠実度な再構成と意味構造の符号化のバランスが取られています。
-
フローマッチング潜時空間拡散フローマッチングトレーニングパラダイムは、コンパクトな潜在空間で拡散生成を実行するために使用され、トレーニングの安定性と効率を向上させるために、小バッチの最適な輸送結合が組み合わされています。
-
競技後のトレーニング加速事前学習とODE蒸留のウォームアップの後、敵対的事後学習を導入することで推論ステップ数を極めて低いレベルまで圧縮し、H200上で2秒未満で長尺の音声を生成できるようにします。
-
差分注意トランスフォーマー拡散トランスフォーマーは、差分アテンション、適応型レイヤー正規化条件付き注入、およびメモリ埋め込みを統合することで、長い音声シーケンスのモデリング精度を向上させます。
-
可変長推論メカニズムこの技術は、従来の拡散モデルにおける固定シーケンス長の制限を打破し、潜在空間の長さを実際の要求時間に比例させることで、短い音声生成のコストを大幅に削減します。
Stable Audio 3 の使い方
-
モデルの重みを取得するHugging Face Stability-AI/stable-audio-3リポジトリにアクセスし、3.0 Small、Small SFX、またはMediumウェイトのファイルをダウンロードしてください。
-
ランタイム環境を構成するstable-audio-toolsのコードリポジトリをクローンし、依存関係をインストールします。その際、PyTorchとCUDAまたはApple Metalのバックエンドが正しく構成されていることを確認してください。
-
モデルとエンコーダーの読み込みスクリプト内で、SAMEオートエンコーダーと対応するスケーリング拡散トランスフォーマーをインスタンス化し、事前学習済みの重みをGPUメモリにロードします。
-
プロンプトを作成して生成する目標とするオーディオスタイル、楽器、雰囲気などを説明する英語のプロンプトを入力し、正確な出力時間(秒単位)を設定します。
-
実行推論の生成モデル生成インターフェースを呼び出します。モデルは、期間パラメータに基づいて可変長推論を実行し、44.1kHzのステレオWAVファイルを出力します。
Stable Audio 3の主な利点
-
完全なライセンスを取得しており、商業的にも適しています。モデル全体は、ライセンスデータとクリエイティブ・コモンズデータを用いて学習されています。コミュニティライセンスにより、ユーザーはコンテンツを自由に所有し、商業的に利用することができます。
-
コンシューマー向けハードウェアのネイティブサポート: 3.0 軽量でオープンウェイトを備え、MacBook Pro M4 でオフラインで実行可能で、ローカルでのフルソング作曲をサポートする初の軽量モデルです。
-
超長時間高品質生成ミディアムモデルとラージモデルは、6分を超える高品質オーディオの生成をサポートしており、前世代のStable Audio Openの47秒という制限を大幅に上回っています。
-
究極の推論効率敵対的学習と最適化の後、ラージモデルはH200 GPU上で2秒未満で6分20秒の音声を生成し、MacBook Pro上ではわずか数秒で生成します。
-
注釈なしの柔軟な編集追加のトレーニングデータによるラベル付けなしに、単一セグメントおよび複数セグメントの編集と継続を実現でき、ランダムマスクと因果マスクを介して実際のクリエイティブワークフローに直接統合できます。
Stable Audio 3 のプロジェクトアドレス
- プロジェクト公式サイト:https://stability.ai/news-updates/meet-stable-audio-3-the-model-family-built-for-artistic-experimentation-with-open-weight-models
- GitHubリポジトリ:https://github.com/Stability-AI/stable-audio-3
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/stabilityai/stable-audio-3
- arXiv技術論文:https://arxiv.org/pdf/2605.17991
Stable Audio 3と類似製品との比較
| 比較対象寸法 | Stable Audio 3 | Stable Audio Open | MusicGen |
|---|---|---|---|
| 開発チーム | Stability AI | Stability AI | Meta (FAIR) |
| モデルアーキテクチャ | フローマッチング潜時空間拡散 | 潜在空間拡散 | 自己回帰 + EnCodec |
| 最大発電時間 | 6分20秒 | 47秒 | 約2分 |
| 可変長サポート | ネイティブな第2レベル制御 | 固定長はサポートされていません。 | 限定的なサポート |
| 消費者向けローカルオペレーション | SmallはMacBookで動作します | 専用GPUが必要です | 専用GPUが必要です |
| 重量範囲は自由です | Small / Medium / Small SFX | Small | Small / Medium / Large |
| 音声編集機能 | 単一段落/複数段落/続き | サポートされていません | サポートされていません |
| 推論速度 | 2秒未満(H200、6分20秒) | もっとゆっくり | 中くらい |
Stable Audio 3の応用シナリオ
-
ゲームや映画の効果音インタラクティブな効果音、環境音、BGMを素早く生成でき、ローカル編集によってシーンのリズムや感情的なニーズに正確に合わせることができます。
-
ショートビデオと広告音楽正確な長さのカスタマイズされたインストゥルメンタルクリップを生成するため、手動でのトリミングが不要になり、短いビデオ、プロモーションビデオ、ポッドキャストのトランジションに直接対応します。
-
音楽制作支援これは、ミュージシャンが意欲を高めるアイデアを生み出したり、未完成の草稿を拡張したり、曲の一部を置き換えたりするのに役立ち、アレンジの反復サイクルを大幅に加速させます。
-
地域に根ざしたプライバシーに配慮した作品バージョン3.0 Smallは完全オフライン動作をサポートしており、映画スタジオや独立系ミュージシャンが求めるデータプライバシーとネットワーク分離に関する厳しい要件を満たしています。
-
パーソナライズされたブランドボイスLoRAを使用して自社独自のオーディオアセットを微調整することで、一貫性のあるUI効果音、ブランド通知音、独自の音楽スタイルを作成できます。