AB
AiBoss
project

Step-Audio-EditX - Step-Starのオープンソース音声編集プラットフォーム

Step-Audio-EditXは、StepStarがオープンソース化した世界初のLLMレベルの音声編集モデルです。感情、話し方、非言語的要素という3つの軸にわたるきめ細かな反復制御が可能で、怒り、喜び、悲しみといった感情の強さを自在にコントロールできます。

Step-Audio-EditXとは何ですか?

Step-Audio-EditXは、StepStarがオープンソース化した世界初のLLMレベルの音声編集モデルです。感情、話し方、副言語の3つの軸にわたるきめ細かな反復制御が特徴です。怒り、喜び、悲しみなどの感情の強度を任意に増減させたり、媚び、ささやき、老人の話し方などの複数のスタイルを重ね合わせたり、字幕のように呼吸、笑い、ため息などの10種類の自然な副言語トークンを挿入したりできます。ゼロサンプルTTS、対象話者の声を必要とせずに音声をクローンする機能、テキストの前に「[四川語]」や「[広東語]」などのタグを追加することで方言を瞬時に切り替えられる機能も備えています。このモデルは、大規模間隔の合成データに対して実行されるSFT+PPOに完全に基づいており、トレーニング後の段階で追加のエンコーダやアダプタを必要とせずに属性の分離と反復制御を実現しています。

Step-Audio-EditXの主な機能

  • 感情エディター怒り、喜び、悲しみ、興奮、恐怖、驚き、嫌悪感など、数十種類のタグを使用して、感情の強さを繰り返し調整したり、増減させたりすることができます。
  • スタイルエディター媚びた話し方、ささやき声、老人風、子供っぽい話し方、真面目な話し方、寛大な話し方、誇張した話し方など、10種類以上の話し方が用意されており、重ね合わせや微調整にも対応しています。
  • サブ言語の挿入呼吸、笑い、ため息、驚き(あー)、確認(えん)、不満(んん)、疑問(えい)、うーん(あー)など、10種類の自然なトークンを正確に挿入してください。
  • ゼロサンプルTTS対象者の声を必要とせずに音声を複製でき、テキストの前に「4川方言」や「広東語」などのタグを追加することで方言を直接切り替えることができます。
  • 反復制御同じ音声を繰り返し編集でき、属性は相互干渉を避けるために分離され、効果は段階的に強化されます。
  • オープンソースで軽量8ビット量子化バージョンを提供し、8GBのビデオメモリを搭載したシングルカードで動作し、4×A800/H800で最高の音質を実現します。推論/トレーニングコード、Gradoデモ、HF Spaceが含まれています。

Step-Audio-EditXの技術的原理

  • デュアルコードブック音声単語分割16.7 Hz/1024の「言語コードブック」と25 Hz/4096の「意味コードブック」を2:3のずらしたスライスで並列処理することにより、あらゆる音声を感情情報や韻律情報を保持しながら個別のトークンに変換し、後続のLLM直接操作のための「音声語彙」を提供する。
  • 3BオーディオLLM3Bモデルはテキストデータで事前学習され、その後ウォームアップされます。テキストトークンとデュアルコードブックオーディオトークンはチャット形式に従って入力に連結され、オーディオトークンのみが出力されます。トレーニングデータはテキスト:オーディオ=1:1であり、既存のテキストLLMエコシステムを事後学習に最大限活用します。
  • 大規模区間合成データ駆動型SFT+PPOは、追加のエンコーダーやアダプタを導入することなく、「同じテキストだが属性(感情/スタイル/サブ言語)が異なる」ペアデータのみを使用して実行されます。大きなギャップにより、モデルは属性の分離を学習せざるを得なくなり、反復的な強度の増減と複数属性の重ね合わせが可能になります。
  • ストリームマッチング + BigVGANv2デコードオーディオLLMによって出力されるデュアルコードブックトークンは、DiTストリームマッチングモジュールによってメルスペクトルを生成するために使用され、その後、BigVGANv2ボコーダーによって波形が復元されます。20万時間の高品質なトレーニングにより、発音の正確さと音色の類似性が保証されます。
  • 統一フレームワーク同じ「単語分割→LLM→デコード」パイプラインで、タスク固有のモジュールを必要とせずに、ゼロサンプルTTS、感情/スタイル/パラ言語編集、音声速度調整、ノイズ低減を同時にサポートできるため、システムの複雑さと推論コストを大幅に削減できます。

Step-Audio-EditXプロジェクトのアドレス

  • プロジェクト公式サイト:https://stepaudiollm.github.io/step-audio-editx/
  • GitHubリポジトリ:https://github.com/stepfun-ai/Step-Audio-EditX
  • ハギングフェイスモデルライブラリ:https://huggingface.co/stepfun-ai/Step-Audio-EditX
  • arXiv技術論文:https://arxiv.org/pdf/2511.03601

Step-Audio-EditXの応用シナリオ

  • 音声コンテンツのアップグレードオーディオブック、ポッドキャスト、ニュース朗読などに、「嬉しい/悲しい/ささやき声」といった感情やスタイルをワンクリックで重ね合わせることができ、再録音することなく複数のバージョンの音声を素早く生成できるため、没入感を高めることができます。
  • 動画や広告のナレーション短い動画、アニメーション、コマーシャルでは、サンプルを一切使用せずにキャラクターの声を複製し、その後、「媚びた」「誇張した」「真面目な」といったスタイルを追加することで、低コストで複数のキャラクターと複数の感情に対応した自動吹き替えを実現できます。
  • ゲーム/バーチャルアイドルNPC、バーチャルアンカー、VTuberの場合、基準となる音声ラインを使用して音声を複製し、その後、笑い声、呼吸音、ため息、その他の副言語音をリアルタイムで挿入することで、より鮮やかで持続性のあるインタラクティブなキャラクターボイスを作成します。
  • インテリジェントな顧客サービスと音声アシスタントカスタマーサービスロボットは、既存のTTS(テキスト読み上げ)メッセージを編集して、味気ない応答を温かく安心感のあるものに変えることで、ユーザーエクスペリエンスを向上させることができます。また、地域ごとのサービスニーズに対応するため、方言タグもサポートしています。
  • 教育/語学学習オンラインコースや語学アプリは、「高齢者向け/子供向け/ささやき声」といったスタイルを用いて年齢に応じた発音を生成したり、標準中国語から広東語や四川語に瞬時に切り替えたりすることで、生徒が発音を理解し真似しやすくし、教師の録音コストを削減することができる。
  • 会議議事録とアクセシビリティノイズや過度に長い沈黙が含まれている会議録音の場合は、まず「ノイズ除去+ミュート部分削除」編集を行い、必要に応じて話す速度を上げたり、感情表現を加えたりして、明瞭で読みやすい議事録音声を作成してください。