project
StepAudio 2.5 TTS - StepAudioが開発した、文脈認識型の音声生成モデル。
StepAudio 2.5 TTSは、StepAudioが発表したコンテキスト認識型音声合成モデル(Context-Aware Speech Synthesis Model)であり、音声生成プロセス全体に初めてコンテキスト理解機能を導入したものです。
StepAudio 2.5 TTSとは何ですか?
StepAudio 2.5 TTSは、StepAudioが発表したコンテキスト認識型音声合成モデル(Context-Aware Speech Synthesis Model)であり、音声生成プロセス全体に初めてコンテキスト理解機能を導入しました。このモデルは、グローバルコンテキストによって各段落のトーンとリズムを設定し、インラインコンテキストによって文ごとに感情的な間を細かく制御する二段階制御システムを採用しています。ゼロショット音声複製と組み合わせることで、わずか3秒の参照音声だけで従来のラベルを自然言語による説明に置き換えることができ、AIは「テキストを読む」だけでなく「テキストを演じる」能力へと進化します。
StepAudio 2.5 TTSの主な機能
-
グローバルコンテキスト制御音声全体の感情的なトーン、登場人物の状態、場面の雰囲気などを自然言語で記述することをサポートしており(例えば、「抑えた悲しみ、すすり泣きなし、かすかな震え」など)、表現の一貫性と整合性を高めます。
-
テキスト内のコンテキスト制御テキスト内で括弧を使用する
()感情、声のトーン、リズム、間、呼吸、アクセントの変化といった細部を細かくコントロールするために、文中に指示を挿入してください。括弧内の内容は指示のみであり、読み上げられることはありません。 -
ゼロショット音色再現わずか3秒間の参照音声で目的の音色を複製でき、複製された音色は固定のサウンドライブラリに制限されることなく、グローバルおよびコンテキスト制御機能を完全に継承します。
-
非ストリーミング音声合成:合格
POST /v1/audio/speechこのインターフェースは、音質を最優先に、完全なオーディオファイルを一度に合成します。レイテンシーが大きな問題にならないシナリオに適しています。 -
ストリーミング音声合成:合格
WebSocket /v1/realtime/audio低遅延ストリーミングが可能になるため、対話やリアルタイム再生のシナリオに適しています。 -
再発売プレビュー:合格
/v1/audio/voices/previewこのインターフェースでは、合成されたリファレンスオーディオを素早くプレビューすることができ、合成処理に対してのみ料金が発生し、公式のサウンドアセットを作成するわけではありません。 -
音色のコンテキストを完全に制御複製された音色とオリジナルの音色の両方について、自然言語コマンドを通じて感情、スタイル、表現の面で柔軟に調整することができ、「同じ音でも、感じ方が違う」という演奏効果を実現できます。
StepAudio 2.5 TTS の使い方
- アクセスを取得するStepfun Open Platform(https://platform.stepfun.com/docs/zh/guides/models/stepaudio-2.5-tts)にアクセスしてアカウントを登録し、コンソールからAPIキーを取得してください。
- アクセス方法を選択してください:
- オンライン体験試してみたい場合は、https://www.stepfun.com/studio/audio のエクスペリエンスセンター、または https://stepaudiollm.github.io/step-audio-2.5-tts/ のデモページにアクセスしてください。
- API呼び出し状況に応じて、非ストリーミング(品質重視)インターフェースまたはストリーミング(低遅延)インターフェースのいずれかを選択してください。
- コンテキスト指示を記述する:
- 設定
instruction(グローバルな状況)文章全体の雰囲気を自然な言葉で表現してください。例えば、「声は極めて緊張しており、話し方は速く途切れ途切れで、明らかに抑圧されている様子がうかがえた。」など。 - 編集
inputテキスト(文脈)厳密な制御が必要な文には括弧を挿入してください。()「(声を低くして)ねえ…僕の携帯を見て。(短く息を吸い込む)」のように、雰囲気や間合いに注目してください。
- 設定
- API呼び出し
- 非流動:に向かって
https://api.stepfun.com/v1/audio/speechモデル、音声、入力、および指示のパラメータを含むPOSTリクエストを送信します。 - フローサイトメトリーWebSocket経由で接続
wss://api.stepfun.com/v1/realtime/audioまず送信してくださいtts.createセッションを確立し、tts.text.delta括弧付きの指示を含むテキストストリームをプッシュします
- 非流動:に向かって
- 音声再生(オプション)音声を複製するには、対象の音声の参照音声ファイルを少なくとも3秒間用意し、次に...
/v1/audio/voices/preview音声サンプルを聴いて、確認が取れたら、公式のサウンドアセットを作成してください。
StepAudio 2.5 TTSの主要情報と使用要件
- モデルの基本
-
このモデルタイプは、コンテキスト認識型音声合成(Context-Aware Speech Synthesis)であり、自然言語理解に基づいて音声性能を実現し、グローバルコンテキスト(全体的なトーン)とテキストコンテキスト(文内詳細)の両方の制御をサポートします。
-
セッションあたりの最大入力文字数は1000文字、最大指示文字数(全体的な文脈に応じた自然言語ガイダンス)は200文字です。
-
- 価格基準
-
文脈に応じたテキスト読み上げ:5.8元/10,000文字
-
音声複製/生成:9.9元/音声(リスニングインターフェースでは合成のみ料金が発生し、複製が成功した時点で即座に支払いが行われます)。
-
- アクセス方法
-
非ストリーミング音声合成: POST /v1/audio/speech は、完全な音声ファイルを一度に合成します。
-
ストリーミング音声合成:WebSocket /v1/realtime/audio、対話シナリオに適した低遅延ストリーミング応答。
-
リマスター版プレビュー: POST /v1/audio/voices/preview、公式サウンドアセットを作成せずにクイックプレビュー。
-
- 使用制限
-
括弧は、テキスト内の文脈を制御するために使用されます。
()同封の指示書(括弧内の内容)は、指示書としてのみ扱われ、直接読み上げられることはありません。 -
ゼロショットトーン複製では、わずか3秒間の基準音声のみが必要で、複製されたトーンは音のニュアンスを制御する能力を完全に継承します。
-
Step PlanおよびStep Planオープンプラットフォームは完全に稼働しており、ユーザーはAPIを直接呼び出したり、オンラインでサービスを利用したりできるようになりました。
-
StepAudio 2.5 TTSの主な利点
-
自然言語代替タグ付けシステム「悲しみ/怒り」といった従来の固定的なラベルを捨て、「抑えた悲しみ、泣き声なし、かすかな震え」といった複雑な自然言語を用いた正確なトーン描写をサポートすることで、感情調整のハードルを大幅に下げています。
-
二段階のコンテキストに応じた精密制御グローバルコンテキストは全体的な感情的なトーンとキャラクターの状態を制御し、インラインコンテキストは...
()括弧は、各文のリズム、間、呼吸を微調整するために使用され、マクロからミクロの視点へと導く立体的なサウンドを実現します。 -
ゼロショット完全制御レプリカわずか3秒の参照音声だけであらゆる音色を複製でき、複製された音色はコンテキスト制御機能を完全に継承するため、固定音源ライブラリの限界を克服します。同じ声で多様な感情表現が可能になります。
-
パフォーマンスレベルのボーカルクオリティこのシステムは、休止、強調、イントネーションの切り替えといったリズム面の大幅な改善に加え、音声の質の向上も実現しています。従来の音声合成(TTS)につきものの「プラスチックのような」「AIのような」印象を払拭し、「すべての言葉が表情豊かに」聞こえる、まるで生きているかのようなパフォーマンス効果を実現しています。
-
参入障壁が低く、柔軟性が高い専門的なオーディオ知識は一切不要です。「自分のニーズを声に出して伝える」だけで、複雑な感情表現を自在にコントロールできます。また、ストリーミングなし(高音質)モードとストリーミングあり(低遅延)モードの両方に対応しており、コンテンツ制作からリアルタイムの対話まで、あらゆる用途に適応します。
StepAudio 2.5 TTSの競合製品比較
| 寸法 | StepAudio 2.5 TTS | ElevenLabs | Fish Audio |
|---|---|---|---|
| 価格基準 | 1万文字あたり5.8元(約0.08ドル/千文字) | Flash版:1,000文字あたり約0.06ドル、多言語版v2:1,000文字あたり約0.12~0.18ドル(約0.87~1.3元) | 約15ドル/100万文字(約0.015ドル/千文字、0.11元/千文字) |
| 無料割り当て | 具体的な規定については、公式サイトをご確認ください。 | 月間10,000文字(無料プラン) | 1回あたり500文字、1ヶ月あたり7分間のS1生成 |
| 音響再生 | ゼロショット、3秒間の音声、9.9元/音声、完全なコンテキスト制御に対応。 | インスタントクローン(有料)+プロフェッショナルボイスクローン(高忠実度、クリエイタープランから利用可能) | 音声クローン機能に対応しています(Plusプラン以上で利用可能)。 |
| コンテキスト制御 | デュアルモード制御:グローバルコンテキスト+インラインコンテキスト(インライン括弧命令) | SSMLタグと速度/スタイル制御に基づき、v3モデルは感情表現をサポートしています。 | 基本パラメーター(速度、感情など)の調整 |
| レイテンシー性能 | ストリーミングなし(品質重視)とWebSocketストリーミング(低遅延)の両方をサポートします。 | Flash v2.5: ~75ms;Turbo v2.5: ~250-300ms | 標準発電速度(無料)、高速発電速度(Plus+) |
| 言語サポート | 主に中国語向けに最適化されていますが、複数の言語に対応しています。 | 29以上の言語に対応、高度な多言語最適化 | 多言語対応 |
| 入力制限 | 一度に入力できる文字数は最大1000文字で、命令の最大文字数は200文字です。 | トランザクションあたりの最大文字数は10,000文字です(API)。 | 無料:1回あたり500文字、プラス:1回あたり15,000文字、プロ:1回あたり30,000文字 |
| 中核的な利点 | ラベル置換、パフォーマンスレベルの感情制御、および精密な二段階コンテキスト制御を備えた自然言語記述。 | その音声の自然さは業界最高水準(9.5/10)で、豊かな感情表現と高度に発達したエコシステムを備えている。 | 最低価格、利用可能なオープンソースモデル、高いコストパフォーマンス |
| 適用可能なシナリオ | 映画やテレビ番組の吹き替え、オーディオブック、ゲームキャラクター、中国語コンテンツの制作。 | オーディオブック、ポッドキャスト、国際的な多言語コンテンツ、リアルタイム対話型AI | 大規模なプログラム生成、予算重視のプロジェクト、開発者 |
StepAudio 2.5 TTSの応用シナリオ
-
映画とアニメーションの吹き替え全体的な文脈の中でキャラクターの感情的なトーンを設定し、テキストのトーンや間を細かく調整することで、プロレベルのキャラクター吹き替えが実現し、キャラクターの声に深みとリアリティが生まれます。
-
オーディオブックとポッドキャストの制作二段階のコンテキスト制御機能を活用することで、異なるキャラクターにそれぞれ独自の声の個性を与えることができ、没入感のある複数人によるオーディオコンテンツを作成したり、プロフェッショナルなオーディオ制作へのハードルを下げることができます。
-
ゲーム音声生成ゲームキャラクターの完全な音声キャラクタープロファイルを作成し、声質から性格まで包括的なカスタマイズを実現することで、NPCがシーンの雰囲気に合った生き生きとした表情を持つことを可能にします。
-
インテリジェント音声アシスタントストリーミング音声合成の低遅延性を活用することで、インテリジェントな顧客サービスやAIアシスタントに自然な会話能力を与え、ユーザーの感情に合わせてリアルタイムで文脈を調整することを可能にします。
-
広告およびマーケティングコンテンツゼロショット音源複製技術を用いてブランド固有のサウンドを素早く複製し、これをコンテキスト制御と組み合わせることで、一貫性のあるスタイルと豊かな感情表現を備えたマーケティング用オーディオ素材を生成できます。