project
Lance - ByteDanceのオープンソース軽量ネイティブ統合マルチモーダルモデル
Lanceは、ByteDanceのインテリジェントクリエーションチームがオープンソース化した、軽量でネイティブな統合型マルチモーダルモデルです。わずか30億個のアクティベーションパラメータを使用し、画像と動画の理解、生成、編集といった一連のタスクを単一のフレームワーク内でサポートします。このモデルはマルチモーダルアプローチを採用しています。
ランスとは何ですか?
Lanceは、ByteDanceのインテリジェントクリエーションチームがオープンソース化した、軽量でネイティブな統合型マルチモーダルモデルです。わずか30億個のアクティベーションパラメータを使用し、画像と動画の理解、生成、編集といった一連のタスクを単一のフレームワーク内でサポートします。このモデルは、段階的なマルチタスクアプローチを用いてゼロからトレーニングされ、トレーニングサイクル全体を通してわずか128個のA100 GPUしか消費しません。GenEvalやVBenchなどの複数のベンチマークテストで優れたパフォーマンスを発揮し、商用利用をサポートするApache-2.0オープンソースライセンスの下で提供されています。
ランスの主な機能
- 画像理解入力画像に対して、意味解析、内容認識、および視覚的な質問応答を実行します。
- 画像生成テキストプロンプトに基づいて高品質な画像を生成し、複雑な合成や属性バインディングをサポートします。
- 画像編集背景の置換、オブジェクトの追加と削除、スタイルの変換、外観の変更など、コマンドレベルの編集をサポートしています。
- 動画の理解動画コンテンツに対して、時間分析、動作認識、および意味理解を実行します。
- ビデオ生成テキストによる説明に基づいて一貫性のある動画を生成し、キャラクターの動きやシーン構成をサポートします。
- 動画編集背景変換、被写体置換、モーション修正など、単一ステップおよび複合ステップでのビデオ編集を可能にします。
- 複数ラウンドの一貫性編集同一人物のアイデンティティとスタイルの一貫性を保つため、同じ被写体に対して複数回の編集作業を行う。
ランスの技術原則
- デュアルストリームハイブリッドエキスパートアーキテクチャ複数のモーダルなシーケンス表現を共有しながらも、異質な目的間の干渉を避けるために、理解タスクと生成タスクにはそれぞれ独立した専門家のパスが割り当てられる。
- 統一インターリーブシーケンス表現これは、テキストトークン、ViTセマンティックトークン、クリーンなVAE潜在トークン、およびノイズのあるVAE潜在トークンを統一されたシーケンスに整理し、理解、生成、および条件付き編集をサポートします。
- 一般化された3D因果的注意このシーケンスはモダリティごとに分割され、テキストトークンは因果的注意を使用し、ビジュアルトークンは双方向的注意を使用することで、マルチモーダルな理解と生成の処理を統合します。
- モダリティを考慮した位置コーディング画像や動画における異種視覚トークンに対して回転位置符号化を導入することで、異なるモダリティ間の信号干渉を低減する。
- 段階的マルチタスク訓練限られた計算能力の範囲内でマルチタスクの協調を実現するために、事前学習、継続学習、および教師あり微調整という段階的な手法を採用しています。
ランスの使い方
- 環境準備ローカル環境またはクラウド環境のいずれかに、Python環境と少なくとも1つのCUDA対応GPUがインストールされていることを確認してください。
- リポジトリのクローン作成:埋め込む
git clone https://github.com/bytedance/Lance.gitプロジェクトのソースコードをダウンロードしてください。 - 依存関係をインストールしますプロジェクトディレクトリに移動してから実行してください。
pip install -r requirements.txt必要なライブラリをインストールしてください。 - ダウンロード重量Lanceの事前学習済みモデルの重みは、Hugging Faceまたはプロジェクトのリリースページから入手できます。
- 推論を実行中公式のサンプルスクリプトに基づいてモデルを読み込み、入力テキストまたは視覚的な手がかりを使用して、タスクを生成、編集、または理解します。
ランスの主な強み
- 超軽量3B個の活性化パラメータのみを使用することで、統一モデルにおいてパラメータ数と性能の最適なバランスを実現しています。
- エンドツーエンドの統合単一モデルで、画像と動画の理解、生成、編集という6つの主要なタスクをカバーできるため、専用モデルに切り替える必要はありません。
- 低コストのトレーニングトレーニングは、予算内で128個のA100 GPUを使用してゼロから完了し、再現のハードルを大幅に下げた。
- ビジネスに優しいApache 2.0オープンソースライセンスは、商用利用、改変、配布を無償で許可しています。
- 優れた業績GenEval、GEdit-Bench、VVBenchなどの複数のベンチマークにおいて、既存のオープンソース統合モデルを上回る性能を発揮します。
ランスのプロジェクトアドレス
- プロジェクト公式サイト:https://lance-project.github.io/
- GitHubリポジトリ:https://github.com/bytedance/Lance
- ハギングフェイスモデルライブラリ:https://huggingface.co/bytedance-research/Lance
- arXiv技術論文:https://arxiv.org/pdf/2605.18678
ランスと類似の競合製品との比較
| 比較対象寸法 | Lance | TUNA | Show-o2 |
|---|---|---|---|
| 活性化パラメータ量 | 3B | 7B | 7B |
| タスク範囲 | 画像・動画の理解、生成、編集 | 画像/動画の理解と生成 | 画像/動画の理解と生成 |
| オープンソースライセンス | Apache-2.0 | 不明 | Apache-2.0 |
| GenEval合計スコア | 0.90 | 0.90 | 0.76 |
| GEdit-Benchの平均スコア | 7.30 | 6.52 | 記載なし |
| VBench総合スコア | 85.11 | 記載なし | 記載なし |
| 建築的特徴 | デュアルストリームMoE + モダリティ認識型位置符号化 | 統一自己回帰アーキテクチャ | 統一自己回帰アーキテクチャ |
ランスのアプリケーションシナリオ
-
インテリジェントなコンテンツ作成これは、デザイナーやクリエイターに、画像や動画の生成・編集をワンストップで行えるツールを提供し、創造的なアイデアの実現を加速させる。
-
短編動画制作短尺動画コンテンツの迅速な生成と編集をサポートし、動画制作の敷居とコストを削減します。
-
広告およびマーケティング資料製品画像、ポスター、プロモーションビデオの一括生成により、ビジュアル素材の効率的な反復作業が可能になります。
-
ビジュアル検索機能の強化画像および動画認識機能を活用することで、eコマースおよびコンテンツプラットフォームにおける視覚的な検索体験を向上させる。
-
教育コンテンツ制作教育用イラストやデモンストレーション動画を自動的に生成し、オンライン教育・研修のためのマルチメディア教材を充実させる。