AB
AiBoss
project

BAGEL - ByteDanceのオープンソースのマルチモーダル基盤モデル

BAGELはByteDanceが開発したオープンソースのマルチモーダルベースモデルで、140億個のパラメータを持ち、そのうち70億個がアクティブです。ハイブリッドトランスフォーマーエキスパート(MoT)アーキテクチャを採用し、2つの独立したエンコーダを通して画像のピクセルレベルおよび意味的パラメータをキャプチャします。

ベーグルとは何ですか?

BAGELはByteDanceが開発したオープンソースのマルチモーダル基盤モデルで、140億個のパラメータを持ち、そのうち70億個がアクティブです。ハイブリッドトランスフォーマーエキスパート(MoT)アーキテクチャを採用し、2つの独立したエンコーダを通して画像のピクセルレベルとセマンティックレベルの特徴を捉えます。BAGELは「次タググループ予測」パラダイムに従ってトレーニングされ、言語、画像、ビデオ、ネットワークデータを含む膨大な量のマルチモーダルラベル付きデータを事前トレーニングに使用します。パフォーマンスの面では、BAGELはマルチモーダル理解ベンチマークにおいて、Qwen2.5-VLやInternVL-2.5といったトップクラスのオープンソース視覚言語モデルを凌駕します。テキストから画像への生成品質はSD3に匹敵し、画像編集シナリオでは多くのオープンソースモデルを上回ります。BAGELは、自由形式の画像編集、将来のフレーム予測、3D操作、ワールドナビゲーションなどのタスクを実行できます。

BAGELの主な機能

  • 画像とテキストの融合に関する理解BAGELは画像とテキストの関係性を深く理解し、画像の内容とテキストの説明を正確に組み合わせることができます。
  • 動画コンテンツの理解BAGELは、動画データを処理し、動画内の動的な情報や意味内容を理解し、効果的な分析のために動画から重要な情報を抽出することができます。
  • テキストから画像への生成ユーザーはテキストによる説明を入力することで、対応する画像を生成できます。BAGELは、テキストの内容に基づいて、説明に合致する高品質な画像を生成できます。
  • 画像編集と修正BAGELは既存画像の編集・修正をサポートしています。また、指示に基づいて修正画像を生成できるため、自由な画像編集が可能です。
  • ビデオフレーム予測BAGELは動画の将来のフレームを予測できます。動画の最初の数フレームに基づいて、モデルは後続のフレームの内容を生成し、動画の整合性を回復します。
  • 3Dシーンの理解と操作BAGELは3Dシーンを理解し、操作することができます。仮想環境内でオブジェクトを移動させたり、その特性を変更したりするなど、3Dオブジェクトを識別、位置特定、操作することが可能です。
  • 世界地図BAGELは世界規模のナビゲーション機能を備えており、仮想空間または現実世界の3D環境における経路計画とナビゲーションを可能にします。
  • クロスモーダル検索BAGELは、テキストの説明に一致する画像や動画の検索、画像の内容に基づいた関連テキスト情報の検索など、複数のモーダル間での情報検索を可能にします。
  • マルチモーダル融合タスクマルチモーダル融合タスクにおいて、BAGELは画像、テキスト、音声など、異なるモダリティからのデータを効果的に融合し、包括的な結果を生成できます。

BAGELの技術原則

  • デュアルエンコーダー設計BAGELは、2つの独立したエンコーダーで構成されるハイブリッド・トランスフォーマー・エキスパート(MoT)アーキテクチャを採用しています。一方のエンコーダーは画像のピクセルレベルの特徴を処理し、もう一方は意味レベルの特徴に焦点を当てます。このデュアルエンコーダー設計により、モデルは画像の低レベルの詳細と高レベルの意味情報を同時に捉えることができます。
  • エキスパートハイブリッドメカニズムMoTアーキテクチャでは、各エンコーダーに複数のエキスパートモジュールが含まれています。これらのエキスパートモジュールは小さなサブネットワークと見なすことができ、各エキスパートは特定の種類の特徴量またはタスクの処理に特化しています。トレーニング中に最適なエキスパートの組み合わせを動的に選択することで、モデルは複雑なマルチモーダルデータをより効率的に処理できます。
  • トークン化BAGELは、入力されたマルチモーダルデータ(画像やテキストなど)をトークンの系列に変換します。画像の場合、モデルは画像を複数のパッチに分割し、それぞれのパッチをトークンとして扱います。テキストの場合も、各単語またはサブワードをトークンとして扱います。
  • 予測タスクこのモデルの学習目標は、次のタグのセットを予測することです。学習中、モデルは一連のタグを受け取り、次のタグを予測しようと試みます。
  • 圧縮と学習この予測タスクを通して、モデルはマルチモーダルデータの固有の構造と関係性を学習できます。次のラベルを予測するプロセスは、モデルに入力データから重要な情報を圧縮して理解することを促し、マルチモーダルデータの理解と生成能力を向上させます。
  • 膨大なデータBAGELの学習にあたり、ByteDanceは言語、画像、動画、ウェブデータから得られた数兆個のマルチモーダルタグを事前学習に利用しました。このデータは幅広いシナリオとドメインを網羅しており、モデルが多様なマルチモーダル特徴とパターンを学習することを可能にしました。
  • 最適化戦略トレーニング中、BAGELは混合精度トレーニングや分散トレーニングなどの高度な最適化戦略を採用し、トレーニング効率とモデル性能を向上させます。

BAGELのプロジェクトアドレス

BAGELの応用事例

  • コンテンツの作成と編集ユーザーはテキストによる説明を入力することで、高品質な画像を生成できます。BAGELは既存の画像の編集や修正も可能です。
  • 3Dシーン生成BAGELは3Dシーンを生成でき、VRおよびARアプリケーション向けに豊富なビジュアルコンテンツを提供します。
  • 視覚化された学習BAGELは、複雑な概念を画像や動画を通して提示することで、学生がそれらをよりよく理解できるよう支援します。
  • クリエイティブな広告制作広告主はBAGELを使って、魅力的な広告画像や動画を作成できます。例えば、製品の特徴に基づいたクリエイティブな広告ポスターや短い動画を作成することが可能です。
  • ユーザーインタラクション体験BAGELは、eコマースプラットフォーム上で製品の3Dモデルや仮想ディスプレイを生成することで、ユーザーのショッピング体験を向上させることができます。