AB
AiBoss
project

Tarsier2 - ByteDanceの大規模視覚理解モデル

Tarsier2は、ByteDanceが開発した高度な大規模視覚言語モデル(LVLM)です。詳細かつ正確な動画説明を生成し、様々な動画理解タスクにおいて卓越した性能を発揮します。このモデルは、3つの主要なアップグレードによって性能向上を実現しています。

Tarsier2とは何ですか?

ByteDanceが開発したTarsier2は、詳細かつ正確な動画説明を生成する高度な大規模視覚言語モデル(LVLM)であり、さまざまな動画理解タスクにおいて優れたパフォーマンスを発揮します。このモデルは、3つの主要なアップグレードによってパフォーマンスを向上させています。1つ目は、事前学習データを1,100万から4,000万の動画-テキストペアに拡張し、データ量と多様性を豊かにすること。2つ目は、教師ありファインチューニング中にきめ細かい時間的アライメントを実行すること。3つ目は、モデルサンプリングに基づいて嗜好データを自動的に構築し、直接嗜好最適化(DPO)トレーニングを適用することです。DREAM-1Kベンチマークでは、Tarsier2-7BはGPT-4oを2.8%、Gemini-1.5-Proを5.8%上回ります。また、動画質問応答、動画位置特定、錯覚テスト、身体化質問応答などのタスクを網羅する15の公開ベンチマークで、新たな最先端の結果を達成しています。

Tarsier2の主な機能

  • 詳細な動画説明Tarsier2は、動画内のアクション、シーン、ストーリーなど、さまざまな詳細を網羅した高品質な動画説明を生成できます。
  • ビデオQ&A彼らは動画に関する具体的な質問に答えることができ、優れた空間認識能力と時間認識能力、そして推論能力を示している。
  • ビデオの位置決めTarsier2は、動画内の特定のイベントの発生時刻を検出して特定することができ、複数の動画セグメントの位置特定にも対応しています。
  • 幻覚検査Tarsier2は、トレーニング戦略を最適化することで、モデルが誤った情報を生成する可能性を大幅に低減します。
  • 多言語対応複数の言語での動画説明文生成をサポートしており、その応用範囲をさらに拡大しています。

Tarsier2の技術的原理

  • 大規模な事前学習データTarsier2は、事前学習データを1,100万組の動画とテキストのペアから4,000万組に拡張し、データの規模と多様性を向上させています。このデータには、インターネット上の短い動画、映画やテレビシリーズのナレーション動画、マルチモーダルLLMによって自動生成された動画の説明文や質疑応答のペアなどが含まれます。
  • きめ細かい時間アライメント(SFT)の教師あり微調整教師あり微調整フェーズにおいて、Tarsier2は、それぞれ特定のタイムスタンプに対応する、15万件の詳細な注釈付き動画説明を導入しました。この時間軸に沿った学習方法により、動画説明タスクにおけるモデルの精度と詳細把握能力が大幅に向上し、同時に錯覚の発生も減少しました。
  • 直接選好最適化(DPO)Tarsier2は、モデルサンプリングによって嗜好データを自動的に構築し、トレーニングに直接嗜好最適化(DPO)を適用します。モデルによって生成された正例と負例のサンプルペアに基づいて、モデルの生成品質がさらに最適化され、生成される動画の説明が人間の嗜好により合致するようにします。

Tarsier2のプロジェクトアドレス

Tarsier2の応用事例

  • 動画の説明Tarsier2は、動画内の動作、シーン、ストーリーなど、さまざまな詳細を網羅した高品質で詳細な動画説明を生成できます。
  • 幻覚検査Tarsier2は、錯覚の発生を抑制することに優れています。直接選好最適化(DPO)と高精度な時間的アライメントによるトレーニングを通じて、Tarsier2は誤った情報が発生する可能性を大幅に低減します。
  • 多言語対応Tarsier2は多言語対応の動画説明文生成をサポートしており、様々な言語環境のニーズに対応します。
  • 具現化された問いTarsier2は、視覚情報と言語情報を組み合わせて、身体化されたエージェントに正確なガイダンスを提供する、身体化された質問応答(Embodied QA)タスクにおいても優れた性能を発揮します。