project
Seeduplex - ByteDanceのネイティブ全二重音声ビッグモデル
Seeduplexは、ByteDanceのSeedチームが開発したネイティブの全二重音声モデルで、同時音声認識によるリアルタイムの対話を可能にします。このモデルは、ノイズの多い環境下でも、高精度な干渉防止機能(誤割り込み率を50%削減)と動的な停止検出機能(割り込み率を40%削減)を備えています。
Seeduplexとは何ですか?
Seeduplexは、ByteDanceのSeedチームが開発したネイティブの全二重音声モデルで、リアルタイムの「聞く・話す」インタラクションを実現します。このモデルは、高精度な干渉防止機能(誤割り込み率を50%削減)と動的な通話終了機能(割り込み率を40%削減)を備え、騒がしい環境や複数のユーザーが関わる複雑なシナリオでも、自然でスムーズなパフォーマンスを提供します。SeeduplexはDoubaoアプリで本格的にリリースされ、数億人のユーザーに高品質な音声通話体験を提供しており、全二重音声技術の初の本格的な商用展開となっています。
Seeduplexの主な機能
- 全二重リアルタイム通信これにより、「同時的な聞き取りと発話」が可能になり、従来の「質問と回答」という順番制の制約を打ち破り、真のリアルタイム双方向音声通信をサポートする。
- 精密な干渉防止周囲の音響環境を継続的に認識し、車内やカフェなどの騒がしい環境でも主要ユーザーの声を正確に特定することで、誤応答率と誤割り込み率を50%削減します。
- 動的停止音声と意味の特徴を組み合わせることで対話のリズムをインテリジェントに判断します。ユーザーが考えているときは辛抱強く聞き、ユーザーが話し終えたらすぐに応答し、中断の割合を40%削減し、ポーズの遅延を250ms削減します。
- アジャイルな割り込み対応ユーザーからの割り込みコマンド(「ちょっと待ってください」など)にリアルタイムで応答できるため、割り込み応答の遅延を300ms短縮し、スムーズな切り替えを実現します。
- 環境認識の関連性周囲の環境音(放送音やナビゲーション音など)を自動的に分析し、推論の文脈に組み込むことで、環境情報を組み合わせることにより、積極的に対応します。
- 複雑な式の理解ユーザーが考えながら修正できる断片的な表現(例えば、注文要件を繰り返し調整するなど)をサポートし、最終的な意図を正確に捉えます。
Seeduplexの使い方
-
Doubaoアプリをダウンロード/アップデートDoubaoアプリを最新バージョンにアップデートしてください。
-
音声通話を開始するダイアログボックスの「電話をかける」アイコンを選択すると、音声通話インターフェースに入り、その機能を体験できます。
Seeduplexの重要な情報と使用要件
- 製品名:Seeduplex(Seed-Full-Duplex)
- 開発チームByteDance Seedチーム
- 技術タイプネイティブ全二重音声大型モデル
- コアブレークスルーこれにより、「聞くことと話すこと」を同時に行うリアルタイムのやり取りが可能になり、従来の「質問と回答」という順番制の制約を打破します。
- 主要指標:
-
誤割り込みと誤応答の発生率が50%減少しました。
-
他人の話を遮る頻度は40%減少した。
-
停止遅延が約250ms短縮されました
-
割り込み応答の遅延が約300ms短縮されました。
-
ユーザーの通話満足度は、絶対値で8.34%向上した。
-
- オンラインステータスDoubaoアプリ上で本格的にサービスが開始され、業界初の全二重音声通信モデルとして大規模展開を実現した。
- プラットフォームの制限Doubaoアプリ経由でのみサポートされています。
Seeduplexの主な利点
- ネイティブ全二重アーキテクチャ業界初となる大規模展開型の「聞く・話す」音声モデルは、従来の「質問と回答」というターン制の制約を打ち破り、まるで人間同士の会話のように自然なやり取りを実現します。
- 高精度な干渉防止機能周囲の音響環境を感知することで、騒がしい場所(車内、カフェなど)でもメインユーザーの声を正確に特定でき、誤応答率と誤割り込み率を50%削減します。
- インテリジェントな動的停止判断このシステムは、音声と意味の特徴を組み合わせて会話のリズムをリアルタイムで判断し、ユーザーが考えている間は辛抱強く耳を傾け、ユーザーが話し終えるとすぐに応答する(遅延を250ミリ秒削減)ことで、会話の中断率を40%削減します。
- 超低遅延応答割り込み応答の遅延が300ms短縮され、いつでも割り込みに対応できるため、真にスムーズなリアルタイム双方向通信が可能になります。
Seeduplexの類似競合製品の比較
| 比較対象寸法 | Seeduplex (バイトダンス) |
GPT-Realtime (OpenAI) |
Step-Audio (星空へと足を踏み入れる) |
|---|---|---|---|
| 技術アーキテクチャ | エンドツーエンド音声大規模モデル ネイティブ全二重アーキテクチャ |
エンドツーエンドの音声間通信 リアルタイムストリーミング配信 |
エンドツーエンドの統合モデリング オープンソースの全二重アーキテクチャ |
| 中核的な利点 | 精密な干渉防止(誤割り込み率↓50%) 動的停止(インターセプト率が40%減少) 超低遅延応答 |
マルチモーダル融合(画像入力に対応) 感情認識(笑い声/声のトーン) ツール利用エコシステムの改善 |
感情のコントロール(文中の感情の動的な変化) 方言サポート(広東語、四川語など) 音声ネイティブツール呼び出し |
| レイテンシー性能 | 停止の遅延 ↓250ms 割り込み応答↓300ms |
リアルタイムストリーミング、具体的な数値は非公開。 SIP電話プロトコルへのアクセスをサポートします |
低遅延、具体的な最適化値は非公開。 |
| 耐干渉機能 | 強力(騒がしい環境下で人間の声を正確に特定する) (誤回答率が50%減少) |
中程度(エンドツーエンドの汎化能力に依存) | 難易度:中程度(オープンソースモデルは、特定のシナリオに合わせてユーザーによる最適化が必要となる)。 |
| オープンさ | 非公開ソースDoubaoアプリ内蔵 現在は完全にオンラインで利用できるため、申請は不要です。 |
API料金支払い済み(Realtime API) サードパーティ統合開発のサポート |
オープンソース(GitHub/HuggingFace) ローカル展開とカスタマイズをサポート |
| シーンフォーカス | 複雑な音響環境(車内/ショッピングモール内) 高頻度インタラクティブゲーム(フライングフラワーオーダー) 複数人による対話シナリオ |
カスタマーサポートエージェント 教育指導 マルチモーダルなリアルタイムインタラクション |
スマートコックピット音声制御 医療相談(30の医療用語に対応) 方言地域における顧客サービス |
Seeduplexの応用事例
- 騒がしい環境下での音声対話車内(ナビゲーションやラジオ放送が混在している)、カフェ、ショッピングモールなどの騒音の多い環境でも、周囲の雑音を正確に分離し、メインユーザーの声を拾い上げます。
- 複数人による対話シナリオユーザーが他のユーザーと会話する際(例えば、配達員や友人からの割り込みに対応する場合など)、システムはAIに向けられたコマンドを識別し、意図しない起動を回避します。複数のユーザーとの会話が重なる場合でも、AIに向けられた発言と他のユーザーからの何気ない発言を正確に区別できます。
- 断片的/ためらいがちな表現ユーザーが注文時にリクエストを繰り返し調整するなど、複雑な表現を考えながら修正していくことをサポートします(「アイスでお願いします…いや、ホットで…シロップをあと2プッシュ追加してください」)。
- 高頻度インタラクティブゲーム素早い質疑応答や言葉遊びなど、迅速な対応が求められる場面では、シームレスで低遅延(約250ms短縮)の応答を実現し、スムーズな競争的な対話をサポートします。