AB
AiBoss
project

LiveCC - ByteDanceとシンガポール国立大学がオープンソース化した、リアルタイム動画ナレーションモデル。

LiveCCは、シンガポール国立大学のShow LabチームがByteDanceと共同開発したリアルタイム動画ナレーションモデルです。自動音声認識(ASR)キャプションを用いた大規模なトレーニングに基づいており、プロのナレーターのように動画コンテンツを迅速に分析します。

LiveCCとは何ですか?

LiveCCは、シンガポール国立大学のShow LabチームがByteDanceと共同開発したリアルタイム動画解説モデルです。自動音声認識(ASR)キャプションを用いて大規模に学習されています。プロの解説者のように、LiveCCは動画コンテンツを迅速に分析し、自然で流暢な音声またはテキスト解説を同時に生成します。LiveCCは、事前学習用のLive-CC-5Mデータセットと、高品質な教師ありファインチューニング用のLive-WhisperX-526Kデータセットを提供しています。また、LiveCCは、モデルのリアルタイム動画解説能力を評価するためのLiveSports-3Kベンチマークも備えています。実験結果によると、LiveCCはリアルタイム動画解説と動画質疑応答タスクにおいて非常に優れた性能を発揮し、低遅延かつ高品質な生成能力を示しています。

LiveCCの主な機能

  • リアルタイムのビデオ解説このシステムは、動画コンテンツに基づいて人間のようなリアルタイムの解説を継続的に生成し、スポーツイベント、ニュース放送、教育ビデオなど、さまざまなシナリオに適しています。
  • ビデオQ&A動画の内容に関連する質問に答えることで、ユーザーが動画内の出来事や詳細をよりよく理解できるように支援します。
  • 低遅延処理極めて低い遅延(1フレームあたり0.5秒未満)でビデオストリームを処理し、リアルタイムアプリケーションをサポートします。
  • マルチシナリオ適応スポーツ、ニュース、教育、エンターテイメントなど、様々な種類のビデオに適しています。

LiveCCの技術的原則

  • ストリーミングトレーニング方法この手法では、自動音声認識(ASR)で得られた単語をタイムスタンプに基づいてビデオフレームに密にインターリーブすることで、モデルが時間的に同期した視覚と言語の関係を学習できるようにします。これは、人間がビデオを視聴する際のリアルタイムの知覚プロセスをシミュレートし、モデルがビデオコンテンツに密接に関連したコメントを生成できるようにします。
  • 大規模データセットYouTube動画から抽出したASRキャプションから、Live-CC-5M(事前学習用)とLive-WhisperX-526K(高品質な教師ありファインチューニング用)という2つのデータセットが構築されました。これらのデータセットは、モデルにとって豊富な学習データを提供しました。
  • モデルアーキテクチャQwen2-VLモデルアーキテクチャに基づき、このシステムはビジュアルエンコーダーと言語モデルを組み合わせて、ビデオフレームとテキスト情報を処理します。モデルは自己回帰アプローチを用いてテキストトークンを予測し、ビデオトークンは予測不可能な入力として扱います。
  • リアルタイム推論推論フェーズでは、LiveCCモデルは入力ビデオをフレームごとに処理し、リアルタイムの解説を生成します。効率を向上させるため、モデルは以前の手がかり、視覚フレーム、および生成されたテキストをキャッシュし、言語デコードを高速化します。
  • 評価方法本モデルのリアルタイムコメント機能は、LiveSports-3Kベンチマークテストに基づいて評価され、異なるモデルによって生成されたコメントの質は、LLM-as-a-judgeフレームワークを使用して比較される。

LiveCCのプロジェクトアドレス

LiveCCのアプリケーションシナリオ

  • スポーツイベント視聴者の体験を向上させるため、リアルタイムの解説とイベント分析を提供します。
  • ニュース報道これはリアルタイムのニュース解釈を支援し、報道の深みと専門性を高める。
  • 教育教育ビデオの説明文を作成し、技能訓練を支援する。
  • エンターテインメントメディア映画やテレビ番組のリアルタイムなストーリー分析を提供し、インタラクティブ性を向上させます。
  • スマートアシスタント動画コンテンツを組み合わせることで、リアルタイムの情報を提供し、インタラクティブな体験を向上させます。