AB
AiBoss
project

Step-Audio-AQAA - StepFunのエンドツーエンドの大規模音声言語モデル

Step-Audio-AQAAは、StepFunチームが開発したエンドツーエンドの大規模音声言語モデルで、特に音声クエリ音声応答(AQAA)タスク向けに設計されています。音声入力を直接処理して、自然で正確な音声応答を生成できます。

Step-Audio-AQAAとは何ですか?

Step-Audio-AQAAは、StepFunチームが開発したエンドツーエンドの大規模音声言語モデルで、特に音声クエリ音声応答(AQAA)タスク向けに設計されています。従来の自動音声認識(ASR)モジュールやテキスト音声合成(TTS)モジュールに頼ることなく、音声入力を直接処理して自然で正確な音声応答を生成するため、システムアーキテクチャが簡素化され、連鎖的なエラーが排除されます。Step-Audio-AQAAのトレーニングプロセスには、マルチモーダル事前トレーニング、教師ありファインチューニング(SFT)、直接選好最適化(DPO)、およびモデルマージが含まれます。これらの手法により、このモデルは音声感情制御、ロールプレイング、論理推論などの複雑なタスクで非常に優れたパフォーマンスを発揮します。StepEval-Audio-360ベンチマークでは、Step-Audio-AQAAは複数の主要な側面で既存のLALMモデルを上回り、エンドツーエンドの音声インタラクションにおける強力な可能性を示しています。

Step-Audio-AQAAの主な機能

  • 直接音声入力処理従来の自動音声認識(ASR)モジュールやテキスト音声合成(TTS)モジュールに頼ることなく、生の音声入力から直接音声応答を生成できる。
  • シームレスな音声インタラクション音声対音声の対話に対応しており、ユーザーが音声で質問すると、モデルが直接音声で回答するため、対話の自然さと流暢さが向上します。
  • 感情的なトーンの調整文レベルで声の感情的なトーンを調整する機能をサポートしており、喜び、悲しみ、真剣さといった感情を表現することができます。
  • 音声速度制御ユーザーは、状況に応じたニーズに合わせて音声応答の速度を調整できます。
  • 音色とピッチのコントロールユーザーの指示に応じて声の音色やトーンを調整し、さまざまな役割や状況に適応させることができます。
  • 多言語でのやり取り中国語、英語、日本語など複数の言語に対応しており、様々なユーザーの言語ニーズを満たします。
  • 方言サポート四川語や広東語などの中国語方言も網羅しており、特定の地域におけるモデルの適用性を向上させている。
  • 声の感情制御状況やユーザーの指示に基づいて、特定の感情を込めた音声応答を生成できる。
  • ロールプレイ顧客サービス担当者、教師、友人など、会話における特定の役割を演じることをサポートし、その役割の特徴に合った音声応答を生成します。
  • 論理的思考力と知識に関するクイズ複雑な論理推論タスクや知識ベースの質問応答を処理し、正確な音声応答を生成できる。
  • 高品質な音声出力ニューラルボコーダーを通して、高忠実度で自然かつ流暢な音声波形を生成し、ユーザーエクスペリエンスを向上させます。
  • 音声の一貫性長い文章や段落を作成する際に、発話の一貫性と整合性を維持し、中断や急激な発話の変化を避ける。
  • テキストと音声が交互に出力される音声とテキストの出力を交互に行うことをサポートしており、ユーザーは必要に応じて音声応答またはテキスト応答を選択できます。
  • マルチモーダル入力の理解音声とテキストが混在する入力を理解し、それに対応する音声応答を生成できる。

Step-Audio-AQAAの技術原理

  • デュアルコードブック音声単語分割器この関数は、入力音声信号を構造化されたトークンシーケンスに変換します。2つのセグメンテーション機能を備えています。1つは言語セグメンテーションで、16.7Hzのサンプリングレートと1024のコードブックサイズで音声から音素と言語属性を抽出します。もう1つは意味セグメンテーションで、25Hzのサンプリングレートと4096のコードブックサイズで音声の感情やイントネーションなどの音響的特徴を捉えます。これにより、音声に含まれる複雑な情報をより正確に捉えることができます。
  • バックボーンLLM我々は、テキスト、音声、画像といったモダリティを網羅する事前学習済みデータを用いた、1300億個のパラメータを持つ事前学習済みマルチモーダルLLM(Step-Omni)を使用します。デュアルコードブックのオーディオタグを統一されたベクトル空間に埋め込み、複数のTransformerブロックを通して深い意味理解と特徴抽出を行います。
  • ニューラルボコーダーこの手法は、生成された音声タグを自然で高品質な音声波形に合成します。U-NetアーキテクチャをResNet-1DレイヤーとTransformerブロックと組み合わせることで、離散的な音声タグを連続的な音声波形に効率的に変換します。

Step-Audio-AQAAプロジェクトのアドレス

  • ハギングフェイスモデルライブラリ:https://huggingface.co/stepfun-ai/Step-Audio-AQAA
  • arXiv技術論文:https://arxiv.org/pdf/2506.08967

Step-Audio-AQAAの応用シナリオ

  • 感情を共有するコンパニオンロボットユーザーの感情に基づいて応答のトーンを自動的に調整し、感情的なサポートと共感を提供する。
  • 多言語対応のインテリジェントカスタマーサービス方言による音声クエリを直接処理でき、中国語、英語、日本語など複数の言語をサポートしています。
  • ゲーム内のNPCとのインタラクションリアルタイムで感情の変化を伴う音声フィードバックを生成します。これにより、一回の会話の中で感情や発話速度を動的に切り替えることが可能になります。
  • インテリジェント音声アシスタント音声による問い合わせと回答に対応しており、リアルタイムの情報照会やスケジュールリマインダーなどのサービスを提供します。
  • 教育とエンターテイメント音声による授業、物語の作成、詩の朗読など、教育現場で活用されています。ユーザーのニーズに応じて、音声とテキストによる応答を柔軟に切り替えることができます。