project
VITRON - Skywork AIは、シンガポール国立大学および南洋理工大学と共同で、ピクセルレベルの視覚的大規模言語モデルを開発しました。
VITRONは、Skywork AI、シンガポール国立大学、南洋理工大学が共同開発したピクセルレベルの視覚的大規模言語モデル(LLM)です。静止画像と動画を包括的に理解・処理することができ、画像や動画の理解を可能にします。
VITRONとは何ですか?
VITRONは、Skywork AI、シンガポール国立大学、南洋理工大学が共同開発したピクセルレベルのビジュアル大規模言語モデル(LLM)です。静止画像と動画を包括的に理解・処理し、画像・動画の理解、生成、セグメンテーション、編集を行います。VITRONは、フロントエンドのビジュアルエンコーダーとバックエンドのビジュアルエキスパートシステムを組み合わせ、ビジュアル理解からビジュアル生成まで、様々なタスクをサポートします。VITRONは、離散的なテキスト指示と連続的な信号埋め込みを組み合わせたハイブリッド方式で情報を提供し、正確な関数呼び出しを実現します。また、異なるビジュアルタスク間の連携を強化するクロスタスクコラボレーションモジュールも搭載しています。
VITRONの主な機能
- 視覚的理解これには、画像や動画に対する質問応答(QA)、指示表現、視覚的推論などが含まれます。
- ビジュアル生成テキストから画像への変換とテキストから動画への変換。
- 視覚的セグメンテーションこれには、インスタンスセグメンテーションやパノプティックセグメンテーションなどの画像および動画のセグメンテーションタスクが含まれます。
- ビジュアル編集画像や動画を編集します。追加、置換、削除、色の変更などが可能です。
- 対話型ユーザー入力ユーザーからのインタラクティブな入力(クリック、ボックスやポリゴンの描画、描画など)を処理します。
VITRONの技術原理
- エンコーダー-LLM-デコーダーアーキテクチャこれは、エンコーダー、大規模言語モデル(LLM)、デコーダーという一般的なアーキテクチャに基づいており、エンコーダーは画像や動画の入力処理を担当し、LLMは意味理解と意思決定を担当し、デコーダーは特定の視覚タスクの実行を担当します。
- フロントエンドビジョン - 言語エンコーディングCLIP ViT-L/14@336pxを画像および動画エンコーダとして使用し、平均プーリングを用いて動画の各フレームを処理し、全体的な時間的表現特徴量を取得しました。また、領域ピクセル認識型ビジュアルエクストラクタをスケッチエンコーダとして使用し、ユーザーの対話型入力を処理しました。
- コアLLMVicuna(7B、バージョン1.5)を言語言語モデル(LLM)として使用し、言語的および視覚的モダリティからの入力を処理し、意味理解と推論を実行し、意思決定を生成します。
- バックエンドビジョンエキスパート画像生成と編集のためのGLIGEN、画像とビデオのセグメンテーションのためのSEEM、テキストからビデオ、画像からビデオへの変換のためのZeroScopeとI2VGen-XL、ビデオ編集のためのStableVideoなど、一連の単一ビジョン専門技術を統合しています。
- 混合方式による指導の合格LLMの決定がバックエンドモジュールに正確に伝達されるようにするため、離散的なテキスト指示と連続的な信号特徴の埋め込みに基づいた、斬新なハイブリッドアプローチが導入される。
VITRONのプロジェクト住所
- プロジェクト公式サイト:vitron-llm.github.io
- GitHubリポジトリ:https://github.com/SkyworkAI/Vitron
- arXiv技術論文:https://arxiv.org/pdf/2412.19806
VITRONの応用事例
- 画像編集支援不要な被写体の除去や画像の色調補正など、写真の修復や補正を行います。
- 動画コンテンツ制作スクリプトテキストから、シーン構成やキャラクターアニメーションを含むビデオコンテンツを生成します。
- オンライン教育プラットフォームこの教育プラットフォームは、授業カリキュラムに基づいて教育用動画や画像を自動的に生成し、授業を支援します。
- Eコマースのビジュアルマーケティング商品の魅力を高めるため、ECプラットフォーム向けに商品紹介動画を自動的に生成します。
- ニュースメディアコンテンツ制作これは、報道機関が画像や動画を含むニュースイベントの視覚的なレポートを迅速に作成するのに役立ちます。