AB
AiBoss
project

Qwen-Audio-3.0-Realtime - アリババが発表したリアルタイム音声対話モデル。

Qwen-Audio-3.0-Realtimeは、Alibaba Tongyiチームが開発したリアルタイム音声対話モデルで、Plus版とFlash版の両方を提供しています。このモデルは、高い推論深度を維持しながらミリ秒レベルの応答時間を実現し、インストラクショナルエージェントをサポートします。

Qwen-Audio-3.0-Realtimeとは何ですか?

Qwen-Audio-3.0-Realtimeは、アリババのTongyiチームが開発したリアルタイム音声対話モデルで、PlusバージョンとFlashバージョンの両方を提供しています。このモデルは、高い推論深度を維持しながらミリ秒レベルの応答時間を実現し、コマンドレスエージェントツールの自己起動、動的な感情とトーンの調整、双方向対話をサポートしています。Qwen-Audio-3.0-Realtimeは、オンポリシー蒸留とマルチティーチャー蒸留技術を活用し、大規模テキストモデルの機能を音声モデルに転送します。このモデルは、アリババクラウドのBailianプラットフォームで利用可能で、インテリジェントな顧客サービス、教育・研修、感情サポートなどのシナリオに適しています。

Qwen-Audio-3.0-Realtimeの主な機能

  • デュアルバージョンアーキテクチャさまざまなシナリオやニーズに合わせて、Plus版とFlash版の2種類を提供しています。
  • ミリ秒単位の応答推論プロセス全体が完了するのを待つことなく、日常会話のような時間的制約のあるシナリオに対して直接応答を生成できる。
  • 指示なしで呼び出すユーザーが明示的に「XXを開く」と指示する必要なく、モデルは外部ツールを自動的に特定して呼び出し、その結果は自動的に複数ラウンドのメモリに組み込まれます。
  • ダイナミックな感情表現状況に応じて声のトーン、リズム、ピッチ、感情を調整し、笑いやため息などの非言語的合図をサポートする。
  • 双方向対話マルチモーダル知覚二重制御サブモデルが内蔵されており、同時発話と同時聴取が可能で、いつでも割り込みや間投詞を行うことができます。
  • 音声認証ロックaudio_promptフィールドを使用して音声サンプルをアップロードすると、特定の話し手を特定し、会話に焦点を当てることができます。

Qwen-Audio-3.0-Realtimeの技術原理

  • On-Policy Distillation大規模テキストモデルの完全な推論能力は音声モデルに凝縮され、大規模テキストモデルは回答を生成する際に音声モデルをリアルタイムで修正する。
  • 複数の教師による抽出話し言葉、一般言語、主体性言語、音声理解の4つの教師が導入され、それぞれ話し言葉による表現力、基本的な推論力、道具の使い方、音声による意味理解力を確実に身につけられるようにした。
  • デュプレックス制御サブモデル音声信号、意味内容、話者の声紋の特徴を分析して会話のリズムを判断し、ノイズ干渉耐性と複数話者切り替えを実現します。
  • エンドツーエンドアーキテクチャ音声理解、推論、音声生成を統合することで、従来のカスケード型ソリューションにおける情報損失を回避する。
  • 関数呼び出しプロトコル標準プロトコルに基づき、MCP、API、知識ベースのシームレスな統合、およびコンテキストメモリの融合を実現します。

Qwen-Audio-3.0-Realtime の使い方

  • アクセスプラットフォームAlibaba Cloud Refinementコンソールにログインし、モデルプラザに入ります。
  • モデルを選択ニーズに応じて、Qwen-Audio-3.0-Realtime-Plus または Flash バージョンのいずれかを選択してください。
  • 許可の取得モデルサービスを有効化し、APIキーを取得するには、指示に従ってください。
  • アクセスアプリケーションAPIまたはSDKを介して、モデルを独自のアプリケーションまたはエージェントに統合します。
  • 設定ツールFunctionCallプロトコルに基づいて、MCP、API、またはナレッジベースにアクセスします。
  • カスタマイズされた音声データ特定の話し手を特定するには、audio_prompt フィールドを使用して音声サンプルをアップロードしてください。

Qwen-Audio-3.0-Realtimeの主な利点

  • 推論力とスピードの両方を実現するPlus版はVoiceBenchの音声言語プロンプトで90.5のスコアを維持している一方、Flash版は複数ターンの音声会話中に音声言語能力がわずか5.5ポイント低下するだけで、知能を低下させることなくミリ秒レベルの応答性を実現している。
  • リーダーシップのベンチマークプレビュー版は、音声推論と対話の流暢さの両方において、人工知能分析チャートでトップに立ち、それぞれ97.6%と97.8%のスコアを獲得しました。プラス版もVStyle中国語チャートで1位タイとなりました。
  • シームレスなツール呼び出し明示的なトリガーワードなしでMCP、API、知識ベースを自動的に呼び出すことができ、呼び出し結果は自動的に複数ラウンドのメモリに統合され、後続の質問で直接再利用できます。
  • 現実の人間に対する共感文脈に応じて声のトーン、リズム、ピッチを動的に調整し、笑いやため息などの非言語的信号を通して自然な感情表現を実現する。
  • 耐干渉二重対話内蔵されたマルチモーダル知覚双方向制御サブモデルにより、騒がしい環境でも途切れることのない通信が保証され、複数人での会話中も主要な会話相手に確実に接続します。
  • 音声指紋の焦点合わせ機能オーディオプロンプトを介して音声サンプルをアップロードし、特定の話者の音声パターンにロックすることで、複数話者が存在する状況でも正確なフォーカスが可能になります。

Qwen-Audio-3.0-Realtimeと類似の競合製品との比較

寸法 Qwen-Audio-3.0-Realtime GPT-4o Realtime
推論性能 VoiceBenchの英語音声スコア:90.5、音声減衰はわずか2.0。 優れた論理的思考力と、会話場面への高い適応力
ツール呼び出し 明示的な自己呼び出し命令は不要です。MCP/APIをサポートしています。 ツール呼び出しのサポートには、通常、明示的なトリガーまたはテキストによる確認が必要です。
感情表現 VStyle 4.22 SOTA、動的なムードとパラ言語的シグナル その声は非常に自然で、幅広い感情を表現できる。
二重相互作用 内蔵マルチモード二重制御、ノイズ低減、およびメインオブジェクトのロック リアルタイムの全二重対話に対応し、スムーズな割り込み処理を実現します。
オープンアクセス Alibaba CloudのHundred-Refined APIは、サードパーティ製アプリケーションの統合をサポートしています。 OpenAI APIエコシステムは、マルチプラットフォームアクセスをサポートしています。

Qwen-Audio-3.0-Realtimeのアプリケーションシナリオ

  • インテリジェントな顧客サービスユーザーからの問い合わせに対してミリ秒単位で応答し、注文照会ツールやアフターサービスツールを自動的に起動することで、クローズドループサービスを実現します。
  • 教育と訓練リアルタイムでの英会話練習と誤り訂正、学習者を励ますための声調の動的な調整、複数ラウンドの対話練習のサポート。
  • 感情的な繋がり笑いやため息といった非言語的な合図による共感的な反応は、自然な感情的な支えと対人関係の交流をもたらす。
  • オフィスミーティングメインスピーカーの声の特徴を捉え、重要なポイントをリアルタイムで記録し、カレンダーやメールツールを使って同期的に実行します。
  • エンターテイメントと交流討論やロールプレイングといった没入型のシナリオをサポートし、いつでも中断できるため、ゲームやライブストリーミングの体験が向上します。