AB
AiBoss
project

Doubao Voice 2.0 - ByteDanceが発表した、アップグレードされたAI音声モデル。

Doubao Voice 2.0 は ByteDance がリリースしたアップグレードされた AI 音声モデルで、Doubao Voice Recognition Model 2.0 (Doubao-Seed-ASR-2.0)、Doubao Voice Synthesis Model 2.0 (Doubao-Seed-TTS 2.... の 3 つのコア モデルで構成されています。

Doubao Voice 2.0とは何ですか?

Doubao Voice 2.0は、ByteDanceが発表したAI音声モデルのアップグレード版で、Doubao-Seed ASR-2.0(Doubao-Seed音声認識モデル2.0)、Doubao-Seed TTS 2.0(Doubao-Seed音声合成モデル2.0)、Doubao-Seed ICL 2.0(Doubao-Seed音声複製モデル2.0)の3つのコアモデルで構成されています。音声認識モデルは推論能力が向上し、深い文脈理解によって正確な認識を実現し、文脈キーワードの想起率が全体で20%向上しています。また、マルチモーダルな画像認識をサポートしており、「単語の理解」だけでなく「画像の理解」も可能で、単一および複数の画像入力によるテキスト認識の精度が向上しています。さらに、日本語、韓国語、ドイツ語、フランス語を含む13の海外言語の正確な認識にも対応しています。音声合成モデル2.0は、会話合成をサポートし、意味や感情を正確に理解することで、複雑な数式を最大90%の精度で読み上げることができます。音声複製モデル2.0は、わずか5秒で音声を複製でき、多言語に対応し、対話における感情表現や、複数の役割を演じ分けることができます。どちらも「~のように話す」ことから「正しく話す」へと進化し、音声対話の理解力と表現力を向上させ、教育、小説の吹き替えなど幅広い場面で活用されています。Doubao Voice 2.0は、Volcano Engine音声制御コンソール体験センターで正式にリリースされました。

Doubao Voice 2.0の主な機能

  • Doubao音声認識モデル2.0(Doubao-Seed-ASR-2.0):
    • 推論能力の向上PPO強化学習アプローチにより、このモデルは文脈を深く理解し、歴史的語彙に頼ることなく固有名詞や多声文字などを正確に識別することができ、キーワードの想起率を20%向上させる。
    • マルチモーダル視覚認識新しい画像認識機能は、画像コンテンツ(単一画像/複数画像など)と組み合わせることで、音声認識を支援し、「slippery chicken」と「funny」のように混同しやすい単語の誤りを減らすことができます。
    • 多言語対応中国語と英語における高い精度を維持しながら、日本語、韓国語、ドイツ語、フランス語を含む13の新しい言語を正確に認識できるようになりました。
    • 複雑なシナリオへの対応歴史上の人物に関する議論(例:「雲州」という地名の特定)や画像作成(例:「馬の頭」と「埠頭」の区別)といったシナリオでは、論理的推論と視覚分析によって精度が向上します。
    • 技術基盤Seedハイブリッドエキスパート大規模言語モデルアーキテクチャをベースとし、20億パラメータのオーディオエンコーダの利点を継承しつつ、動的なインタラクティブシナリオへの適応に重点を置いています。
  • Doubao-Seed-TTS 2.0 (Doubao-Seed-TTS 2.0)
    • 対話合成括弧コマンド、音声コマンド、および文脈情報を通じて、音声の感情、トーン、イントネーションを正確に制御し、複数ターンの対話の文脈を理解し、自然で流暢な感情表現を実現します。
    • 複雑な数式を読むこのシステムは教育現場向けに特化して最適化されており、小学校から高校までの全教科の公式を網羅し、平均正答率は最大90%に達し、教科別の学習支援における読解の困難を解決します。
    • マルチシナリオアプリケーション教育支援、感情的な支え、コンテンツの吹き替えなど、幅広い分野で活用されており、音声をよりインタラクティブで人間らしいものにしている。
  • Doubao音声レプリカモデル2.0(Doubao-Seed-ICL 2.0)
    • 高速トーン複製わずか5秒でユーザーの声を再現でき、中国語、英語、日本語、スペイン語、ポルトガル語など複数の言語に対応し、「音の類似性」を容易に実現します。
    • 感情表現力複製された音声は、より強い感情表現力を持ち、対話の文脈に合った感情を伝えることができ、複数の役割を演じることもできる。
    • マルチシナリオアプリケーション音声対話、小説の吹き替え、ポッドキャストの会話といった場面に適しており、ユーザーに鮮やかで自然な音声体験を提供します。

Doubao Voice 2.0のパフォーマンス

Doubao Voice 2.0は、専門的な最適化により、教育指導における複雑な数式や記号の読み取りという課題を克服し、平均正答率を90%に向上させました。これは従来のモデルの50%を大幅に上回る数値であり、教育現場において厳密かつ効率的な音声対話体験を提供します。

Doubao Voice 2.0のプロジェクトアドレス

  • プロジェクト公式サイト:https://console.volcengine.com/speech/

Doubao Voice 2.0の応用シナリオ

  • 教育指導小学校から高校までの全教科に対応し、平均精度は最大90%に達し、生徒と教師に高精度な音声アシスタントツールを提供します。
  • 感情的な繋がり文脈や指示に基づいて感情を正確に表現するため、音声によるやり取りがよりリアルで自然になり、感情的な交流の場面に適しています。
  • コンテンツの吹き替えテキストの内容に基づいて声のトーンやイントネーションを調整する技術で、動画、広告、オーディオブックなどの吹き替えに広く用いられています。
  • 斬新な解釈文脈に応じて様々な登場人物の感情を伝えることができるため、小説の吹き替えや物語に命を吹き込むのに適している。
  • ポッドキャストの会話このモデルは、複数ターンの対話の文脈を理解することができ、自然で流暢な音声インタラクションをサポートし、ポッドキャスト番組の対話やインタラクティブなセグメントに適しています。