project
Long-VITA - テンセントYouTuが南京大学および厦門大学と共同でオープンソース化したマルチモーダルモデル
Long-VITAは、Tencent YouTu Lab、南京大学、厦門大学が共同開発したオープンソースのマルチモーダルモデルです。100万トークンを超える長文入力にも対応でき、短文タスクでも優れた性能を発揮します。Long-VITAは段階的なトレーニングに基づいています。
Long-VITAとは何ですか?
Long-VITAは、Tencent YouTu Lab、南京大学、厦門大学が共同開発したオープンソースのマルチモーダルモデルです。100万トークンを超える長文テキスト入力を処理でき、短文テキストタスクでも優れた性能を発揮します。Long-VITAは段階的なトレーニングに基づいており、画像、動画、テキストなどのマルチモーダル入力をサポートするために、視覚的および言語的な文脈理解能力を段階的に拡張しています。Long-VITAは、高解像度画像を処理する動的ブロックエンコーダを使用し、コンテキスト並列分散推論を採用することで、長さ無制限の入力をサポートします。コミックの要約や映画のプロットなどの長文テキストデータを含むオープンソースデータセットでトレーニングされたLong-VITAは、複数のマルチモーダルベンチマークで新たな最先端(SOTA)性能を達成しています。
Long-VITAの主な機能
- 長文処理機能100万トークンを超える入力を処理でき、長文テキスト、長尺動画、高解像度画像などのマルチモーダルなタスクにも対応しています。
- マルチモーダルな理解画像、動画、テキストの入力に対応しており、動画の理解、高解像度画像解析、長文テキストの生成といったタスクに適しています。
- コンテキスト拡張機能段階的なトレーニングに基づき、モデルのコンテキストウィンドウは徐々に拡大され、短いテキストタスクにおける高いパフォーマンスが維持されます。
- オープンソースのデータトレーニングオープンソースのデータセットを用いたトレーニングは、内部データの必要性を排除し、開発の障壁を低くする。
- 拡張性コンテキスト並列分散推論をサポートし、無制限の長さの入力を処理でき、大規模な展開に適しています。
Long-VITAの技術原理
- 段階的訓練:
- 視覚言語の整合性言語モデルとビジュアルエンコーダーを固定し、プロジェクターのみをトレーニングして、視覚的特徴と言語的特徴の間の初期的なつながりを確立します。
- 一般知識の学習画像とテキストのデータを用いたマルチタスク学習は、モデルの一般知識理解能力を向上させる。
- 長系列の微調整コンテキストの長さを段階的に拡張し(128Kから1Mまで)、長文テキストと動画の理解データを追加し、長文コンテンツを理解するモデルの能力を最適化します。
- コンテキスト並列分散推論テンソル並列処理とコンテキスト並列処理に基づいて、無限長の入力に対する推論をサポートし、長文処理におけるメモリのボトルネックを解消します。
- 動的ブロックエンコーダ高解像度画像を効率的に処理するために動的なブロックベースの戦略を採用しており、異なるアスペクト比の入力にも対応しています。
- マスキング言語モデリングヘッド推論段階では、マスクに基づいてロジットが出力されます。これにより、メモリ使用量が大幅に削減され、大規模な長文テキストの生成が可能になります。
Long-VITAのプロジェクト住所
- GitHubリポジトリ:https://github.com/VITA-MLLM/Long-VITA
- ハギングフェイスモデルライブラリ:https://huggingface.co/VITA-MLLM
- arXiv技術論文:https://arxiv.org/pdf/2502.05177v1
Long-VITAの応用シナリオ
- 動画コンテンツの生成動画の要約や字幕を自動生成したり、動画に関する質問に回答したりする。
- 画像解析芸術作品の制作、医用画像診断、または衛星画像解析を支援します。
- 長文処理小説、学術報告書、または文書の要約を作成します。
- 知的な対話カスタマーサービス、教育、スマートホームアプリケーションにおいて、テキスト、画像、動画を通してユーザーとコミュニケーションを取る。
- リアルタイム会議支援リアルタイム翻訳、字幕作成、会議記録作成機能を提供します。