AB
AiBoss
project

StoryTeller - ByteDance、上海交通大学、北京大学が共同で開発した、完全自動化された長尺動画の説明文生成および一貫性システム。

StoryTellerは、ByteDance、上海交通大学、北京大学が共同開発したシステムです。音声と映像の文字認識技術に基づき、長尺動画の説明文の質と一貫性を向上させます。このシステムは、低レベルの視覚概念と高レベルの物語性を組み合わせたものです。

StoryTellerとは何ですか?

ByteDance、上海交通大学、北京大学が共同開発したシステム「StoryTeller」は、音声・映像文字認識技術に基づき、長尺動画の説明文の質と一貫性を向上させます。このシステムは、低レベルの視覚的概念と高レベルのナラティブ情報を組み合わせ、詳細かつ一貫性のある動画の説明文を生成します。StoryTellerは、動画分割、音声・映像文字認識、説明文生成の3つの主要モジュールで構成されています。数分間の動画を効率的に処理でき、MovieQAタスクにおいて既存モデルよりも高い精度を示し、最も強力なベースラインであるGemini-1.5-proよりも9.5%高い精度を達成しています。

StoryTellerの主な機能

  • ビデオセグメンテーション長い動画を複数の短いセグメントに分割し、各セグメントの独立性と整合性を維持する。
  • 音声・映像による文字認識音声情報と映像情報を組み合わせて、動画内のセリフに対応する登場人物を特定してください。
  • 説明生成各動画セグメントごとに詳細な説明を生成し、それらを統合して長尺動画全体の首尾一貫した物語を構築します。
  • データセットの構築MovieStory101データセットを作成し、それを使用して長文動画の説明文の学習データとテストデータを提供する。
  • 自動評価MovieQAを基に、GPT-4を用いて動画の説明文の正確性と品質を自動的に評価する。
  • モデルのトレーニングと微調整文字認識と動画説明の精度を向上させるため、大規模なマルチモーダル言語モデルを訓練する。
  • グローバルデコード異なるビデオクリップ間で、同じキャラクターに対する認識結果が一貫していることを確認する。

StoryTellerの技術的原則

  • マルチモーダル融合映像コンテンツを完全に理解するために、視覚情報(ビデオフレーム)、音声情報(セリフ)、テキスト情報(字幕や説明)を統合します。
  • 音声分離と役割IDの割り当て各対話は音声埋め込みモデルを用いて埋め込まれ、クラスタリングアルゴリズムに基づいてグローバルIDが割り当てられます。類似した音声埋め込みには同じIDが割り当てられ、同じ役割を表します。
  • 音声・映像文字認識モデル大規模な言語モデル(Tarsier-7Bなど)とOpenAIのWhisper-large-v2オーディオエンコーダーを組み合わせることで、各オーディオIDを特定の役割にマッピングします。
  • グローバル復号アルゴリズム推論処理中は、異なるセグメント内の同一文字のグローバルIDが、一貫した文字名にマッピングされるようにすることで、文字識別の精度を向上させてください。
  • 動画の説明文生成認識結果を入力として使用し、大規模な言語モデルに基づいて各セグメントの詳細な説明が生成され、完全なビデオ説明に統合されます。

StoryTellerのプロジェクトアドレス

StoryTellerの応用シナリオ

  • 映画およびビデオコンテンツ制作映画の予告編やクリップの説明文を自動生成し、監督や脚本家が動画コンテンツを素早く理解するのに役立ちます。また、説明文に基づいて動画内の重要な部分を素早く見つけることができるため、動画編集作業も効率化できます。
  • 動画コンテンツ分析動画分析の分野では、動画コンテンツ内の登場人物、筋書き、行動などの重要な情報が抽出され、詳細なコンテンツ分析が行われます。
  • 視覚障害者の支援視覚障害者向けに動画コンテンツの音声解説を提供し、動画コンテンツやストーリーをより深く理解できるようにします。
  • 教育と訓練教育分野では、学習効果を高めるために、動画教材の詳細な説明を学生に提供します。職業訓練分野では、訓練効率を向上させるために、動画チュートリアルの詳細な手順説明を生成します。
  • 動画の検索とインデックス作成動画の説明に基づいて動画から関連性の高い部分を素早く抽出することで、動画検索の精度を向上させます。