project
WebLI-100B - Google DeepMindが公開した1000億件の視覚言語データセット
WebLI-100Bは、Google DeepMindが提供する1000億組の画像とテキストのペアを含む大規模なデータセットで、視覚言語モデル(VLM)の事前学習に使用されます。WebLI-100Bは、WebLIデータセットのデータを基にした、WebLIデータセットの拡張版です。
WebLI-100Bとは何ですか?
Google DeepMindが公開したWebLI-100Bは、ビジュアル言語モデル(VLM)の事前学習用に1,000億組の画像とテキストのペアを含む大規模なデータセットです。WebLIデータセットの拡張版であるWebLI-100Bは、Webから収集された膨大な数の画像とその対応するタイトルまたはページタイトルをテキストペアリング情報として用いて構築されています。これまでの最大のビジュアル言語データセットの10倍の規模を誇るWebLI-100Bは、膨大な量のデータを活用して、ロングテール概念、文化的多様性、多言語コンテンツに対するモデルの理解を強化します。研究者たちは構築時に基本的なデータフィルタリングのみを行い、可能な限り多くの言語的および文化的多様性を維持しました。WebLI-100Bの登場は、より包括的なマルチモーダルモデルのトレーニングにとって重要な基盤リソースとなります。
WebLI-100Bの主な機能
- 大規模な事前トレーニングのサポートWebLI-100Bは1000億組の画像とテキストのペアを提供し、VLMの事前学習のための豊富なデータリソースを提供するとともに、様々なタスクにおけるモデルのパフォーマンスを大幅に向上させます。
- 文化的多様性の向上このモデルには、さまざまな文化的背景を持つ画像やテキストが含まれており、異なる文化に関連する視覚的および言語的コンテンツをよりよく理解し、生成するのに役立ちます。
- 多言語対応能力を強化するこのデータセットには複数の言語のテキストが含まれており、リソースの少ない言語におけるモデルのパフォーマンス向上に役立ち、多言語タスクの開発と応用を促進します。
- マルチモーダルなタスクをサポートするWebLI-100Bデータは、画像分類、画像キャプション生成、視覚的質問応答など、さまざまなマルチモーダルタスクで使用されており、マルチモーダルモデルの開発を強力にサポートしています。
WebLI-100B 技術原理
- データ収集:
- ソースWebLI-100Bのデータは主にインターネットから取得され、大規模なウェブクローリングを通じて画像とその対応するテキスト説明(画像の代替テキストやページタイトルなど)を収集します。
- 規模このデータセットには1000億組の画像とテキストのペアが含まれており、現在までに発表されている視覚言語データセットの中で最大規模の一つとなっている。
- データフィルタリング:
- 基本的なフィルタリングデータ品質と多様性を確保するため、WebLI-100Bは、有害な画像や個人識別情報(PII)の削除など、基本的なデータフィルタリングのみを実行し、言語的および文化的多様性を可能な限り維持するように努めています。
- 高品質フィルター(オプション)この研究では、データ品質を向上させるためのデータフィルタリングにCLIPなどのモデルを使用することについても検討したが、そのようなフィルタリングは特定の文化的背景の代表性を低下させる可能性がある。
- データ処理:
- テキスト処理画像のaltテキストとページタイトルはペアテキストとして使用され、テキストデータの多様性と一貫性を確保するために、多言語対応のMT5単語分割ツールを使用して単語分割が行われます。
- 画像処理モデルの入力要件を満たすため、画像の解像度を224×224ピクセルに調整してください。
WebLI-100Bプロジェクトの住所
- arXiv技術論文:https://arxiv.org/pdf/2502.07617
WebLI-100Bの応用事例
- 人工知能研究者モデルの事前学習、新しいアルゴリズムの探索、および視覚言語モデルのパフォーマンス向上に使用されます。
- エンジニア画像説明、視覚的な質問応答、コンテンツ推薦システムなど、多言語および異文化に対応したアプリケーションを開発する。
- コンテンツクリエイターコンテンツのローカライズと多様性を高めるために、多言語の画像説明とタグを生成します。
- 異文化研究者異なる文化的背景を持つ画像やテキストを分析し、文化的な違いを研究する。
- 教育者と生徒教育教材として、学生がマルチモーダルデータの処理と分析を学ぶのに役立ちます。