AB
AiBoss
project

AudioStory - Tencent ARCが立ち上げた音声生成モデル

AudioStoryは、Tencent ARC Labsが開発した音声生成技術で、自然言語による説明に基づいて高品質な長編ナラティブ音声を生成できます。複雑なナラティブ要求を順序付けられたサブタスクに分割し、その後…という分割統治戦略を採用しています。

AudioStoryとは何ですか?

AudioStoryは、Tencent ARC Labsが開発した音声生成技術で、自然言語による記述に基づいて高品質な長編ナラティブ音声を生成できます。分割統治戦略を採用し、複雑なナラティブ要求を順序付けられたサブタスクに分解し、デカップリングブリッジングメカニズムを通じて、意味と音響効果の詳細を正確に調整します。エンドツーエンドのトレーニングによりモデルの相乗効果が強化され、時間的な論理と感情的な深みを備えた音声が実現します。

AudioStoryの主な機能

  • 自動ビデオ吹き替えユーザーは無音の動画をアップロードし、効果音のスタイルを説明できます。AudioStoryは動画コンテンツを自動的に分析し、動画と同期した一貫性のあるスタイルのBGMトラックを生成します。
  • 音声インテリジェント継続AudioStoryは、音声クリップが与えられると、その後のシーンをインテリジェントに推測し、バスケットボールのトレーニング中にコーチの声に基づいて選手の足音やバスケットボールを叩く音などを追加するなど、適切な音声を自動的に補完することができます。
  • オーディオブック制作このシステムは、オーディオブック向けに高品質な音声コンテンツを提供し、テキストの説明に基づいて時系列的な論理と感情的なレイヤーを備えた音声を生成することで、リスナーが物語に深く没入できるようにします。
  • ゲーム効果音制作ゲーム向けに臨場感あふれる効果音を生成し、ゲームシーンの説明に基づいて適切な音声を制作することで、プレイヤーのゲーム体験を向上させます。
  • スマートポッドキャストトピックの説明に基づいて対応する音声セグメントを生成することで、ポッドキャスト制作者が音声コンテンツを迅速に作成できるように支援し、制作効率を向上させます。

AudioStoryの技術的原理

  • 分割統治戦略複雑なナレーションのリクエストは、それぞれ対応する音声セグメントを生成する一連のサブタスクに分解され、それらがタイムラインに沿って正確に配置されることで、音声全体の整合性と論理性が確保されます。
  • デカップリングブリッジング機構大規模言語モデルと音声生成器の連携は、ブリッジクエリと残差クエリという2つの要素に分解されます。これらはそれぞれ、イベント内の意味的整合性とイベント間の一貫性の維持に使用され、生成効果を向上させます。
  • エンドツーエンドのトレーニング我々は統一された学習方法を採用し、指示理解と音声生成の両方を最適化することで、モデルの各部分間の相乗効果を高め、全体的なパフォーマンスを向上させます。
  • 意味トークンと残余トークンのデュアルチャネルメカニズムマクロな物語とミクロな音響効果の詳細をそれぞれ処理するために2つのチャンネルを使用することで、両者の関係が正確に調整され、生成される音声は全体的な物語の論理に合致するだけでなく、豊かなディテール表現も実現する。
  • 3段階の段階的トレーニング単一音の生成から音声コラボレーション、そして長編物語へと段階的に進むにつれて、モデルの性能と適応性が向上し、複雑な長編物語の音声生成タスクにより適切に対応できるようになる。

Audio Storyプロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/TencentARC/AudioStory。
  • 紙の住所:https://arxiv.org/pdf/2508.20088。

AudioStoryの応用事例

  • 動画吹き替えユーザーが提供する無音動画と効果音のスタイルの説明に基づいて、動画コンテンツを自動的に分析し、それに合った背景音声トラックを生成します。
  • 音声続き与えられた音声セグメントに基づいて、後続のシーンを推測し、バスケットボールのトレーニング音声に選手の足音を追加するなど、適切な音声の続編を補足する。
  • オーディオブック制作テキストの説明に基づいて、時間的な論理と感情的なレイヤーを備えた音声を生成し、オーディオブックのリスニング体験を向上させます。
  • ゲーム効果音生成ゲームシーンの説明に基づいて臨場感あふれる効果音を生成し、プレイヤーのゲーム体験を向上させます。