AB
AiBoss
project

Qwen-Audio-3.0-TTS - Alitongyi Qianwen氏が発表した音声合成モデル

Qwen-Audio-3.0-TTSは、アリババ傘下の同義千文が開発した大規模音声合成モデルで、リアルタイム対話向けのFlash版と、高品質な音声生成を実現するPlus版が用意されています。

Qwen-Audio-3.0-TTSとは何ですか?

Qwen-Audio-3.0-TTSは、アリババ傘下の同義千文が開発した大規模音声合成モデルで、リアルタイム対話型のFlash版と高音質生成型のPlus版があります。このモデルは、人工知能分析グローバルTTSランキングで優勝し、きめ細かなラベル制御、自然言語コマンドによる音声スタイル定義に対応、16言語と20の中国語方言をカバー、音声出力は48kHzのスタジオ品質録音に向上、最大1回の合成時間は3分です。

Qwen-Audio-3.0-TTSの主な機能

  • きめ細かなラベル管理テキストに埋め込まれています [gasp][giggles][angry] 構造化タグを使用することで、声のトーン、感情表現、呼吸の細部まで正確に制御できます。
  • 自由なコマンド制御この機能を使えば、登場人物、感情、場面、話し方の速さなどを自然言語で表現でき、専門的な音響知識がなくても自分の声のスタイルを定義できます。
  • 多言語主義と方言中国語、英語、日本語、韓国語、ドイツ語を含む16言語に対応し、広東語、重慶語、東北語、上海語など20の中国語方言をサポートしており、10言語において最高レベルのエラー率(SOTA)を実現しています。
  • 複雑な音響的堅牢性ネイティブに内蔵された音声強調機能により、騒音や残響の多い環境でも音色を正確に再現します。
  • プレミアムサウンドライブラリコマンドスタイルの音色、方言の音色、きめ細かな制御音色、そして14種類以上の少数言語の音色が用意されており、すべて箱から出してすぐに使用できます。
  • 48kHz高音質出力サンプリングレートが24kHzから48kHzにアップグレードされ、最大単一シンセシス時間は3分になりました。

Qwen-Audio-3.0-TTSの技術的原理

  • デュアルトラックハイブリッドストリーミング生成アーキテクチャ本製品は、ストリーミング生成と非ストリーミング生成の両方を単一モデルでサポートするデュアルトラックLMアーキテクチャを採用しています。1文字を入力するとすぐに最初の音声パケットを出力でき、エンドツーエンドの合成遅延はわずか97msです。
  • 離散型マルチコードブック言語モデル離散型マルチコードブックLMに基づき、完全な情報を用いたエンドツーエンドの音声モデリングを実現し、従来のLM+DiT方式における情報ボトルネックや連鎖エラーを完全に回避し、汎化能力と生成効率を大幅に向上させます。
  • デュアルワードセグメンター設計
    • 25Hzワードセグメンテーションセマンティックコンテンツを重視し、Qwen-Audioとシームレスに統合し、ブロックレベルのDiTによってストリーミング波形の再構築を実現するシングルコードブックコーデック。高品質な非ストリーミングシナリオに適しています。
    • 12Hzワードセグメンテーション12.5Hz、16層のマルチコードブック設計により、極めて高いビットレート圧縮が可能となり、軽量な因果関係に基づく畳み込みニューラルネットワーク(ConvNet)が超低遅延のストリーミング再構築を実現するため、リアルタイムのインタラクションに適しています。
  • 大規模な多言語研修10言語を網羅する500万時間以上の音声データで学習されており、超高速3秒の音声クローン作成とテキストベースの音声デザインをサポートしています。
  • コマンド駆動型音響制御音声制御を言語モデリングのタスクとして扱い、ChatML形式の自然言語コマンドを使用することで、音色、感情、話速、役割といった多次元的な音響属性を柔軟に操作し、私たちが聞いていると思うものを実現できます。

Qwen-Audio-3.0-TTS の使い方

  • バージョンを選択
    • プラスバージョン最高の音質と表現力を追求したこの製品は、映画やテレビの吹き替え、オーディオブックなど、様々な用途に適しています。
    • フラッシュ版低遅延でリアルタイムなインタラクションを目指しており、ライブストリーミングやチャットボットなどのシナリオに適しています。
  • アクセスプラットフォームAlibaba Cloud Refinementコンソールにアクセスし、検索して有効化してください。 qwen-audio-3.0-tts-plus または qwen-audio-3.0-tts-flash 仕える。
  • API呼び出し標準APIを介してテキストを渡すと、構造化タグや自然言語による指示を添付して、48kHzの合成音声を取得できます。
  • 音色を選択 プレミアムトーンライブラリからプリセットトーンを選択するか、参照オーディオファイルをアップロードしてトーンを複製してください。

Qwen-Audio-3.0-TTSの主な利点

  • リストでトップのパフォーマンス人工音声合成(TTS)のグローバルランキングでトップに立ち、16言語(プラスバージョン)にわたる話者類似性評価で比類のない結果を達成し、10言語で最先端の単語誤り率を誇った。
  • デュアルバージョンはあらゆるシナリオに対応しますFlash版は最初のパケットの遅延が97msで、リアルタイムのやり取りに必要な要件を満たしています。Plus版は48KHzの出力で、映画やテレビの画質に必要な要件を満たしています。
  • きめ細やかな表現力:サポート [angry][gasp] 構造化されたタグと自由形式の自然言語コマンドにより、感情、呼吸、話速、役割を正確に制御できます。
  • 多言語主義と方言16の言語と20の中国語方言を網羅し、専門的な訓練を通して「方言の特徴の弱体化」という問題を緩和し、ネイティブスピーカー本来の発音を取り戻す。
  • 音響的な堅牢性音声強調機能をネイティブに内蔵しており、静かな録音環境を必要とせず、騒音や残響の多い環境でも音色を正確に再現します。
  • 迅速クローニングわずか3秒の参照音声で音声クローンを作成でき、テキストベースの音声デザインにも対応しています。

Qwen-Audio-3.0-TTSプロジェクトのアドレス

  • プロジェクト公式サイト:https://funaudiollm.github.io/qwen-audio-3.0-tts/

Qwen-Audio-3.0-TTSと類似の競合製品との比較

寸法 Qwen-Audio-3.0-TTS-Plus ElevenLabs v3
ランキング 人工分析 パート1 トップ3には入っていない
サンプリングレート 48KHz 通常44.1kHz
タグ制御 構造化タグのネイティブサポート プロンプトを介した間接的な制御が必要です。
方言サポート 中国語の20の方言 限定
多言語SOTA 10言語における最適な単語誤り率 一部の言語ではリードしています
ノイズ耐性 ネイティブ音声強調 クリーンなリファレンスオーディオに依存します
API価格設定 100万文字あたり27.6ドル 約11ドル/100万文字

Qwen-Audio-3.0-TTSの応用シナリオ

  • 映画やゲームの吹き替え構造化されたタグを通して感情の変動や呼吸のリズムを精密に制御することで、キャラクターレベルの演技力を持つ音声合成を実現し、アニメーション、映画、テレビドラマ、ゲームキャラクターの高い表現力要求を満たします。
  • オーディオブックとポッドキャスト自然言語コマンドを使用してナレーションのスタイルとペースを定義できます。1セッションあたり最大3分間の高品質な48kHz出力に対応し、長時間のオーディオコンテンツの一括生成もサポートしています。
  • インテリジェントな顧客サービスとアシスタントFlash版は、97msという超低遅延の初回パケット遅延を実現し、20種類の言語に対応しているため、自然でスムーズなリアルタイム音声対話が可能となり、ユーザーサービス体験を大幅に向上させます。
  • オンライン教育教師の声を複製し、それに話速や感情制御を組み合わせることで、個々の教師に合わせた音声を生成し、多言語コースコンテンツの音声制作のローカライズをサポートします。
  • ライブストリーミングとリアルタイムインタラクションFlash版の低遅延機能は、リアルタイムの音声フィードバックが必要なシナリオ、例えばリアルタイムの画面読み上げ、バーチャルアンカーによる放送、ライブeコマースなどに適しています。