project
dots.vlm1 - Xiaohongshu Hi Labがオープンソース化した最初のマルチモーダル大規模モデル
dots.vlm1は、Xiaohongshu氏のhi研究室がオープンソース化した初のマルチモーダル大規模モデルです。12億個のパラメータを持つNaViTビジュアルエンコーダをゼロから学習させ、DeepSeek V3大規模言語モデル(LLM)をベースに構築されており、強力な視覚認識能力を備えています。
dots.vlm1とは何ですか?
dots.vlm1 は、Xiaohongshu 氏の hi lab がオープンソース化した初のマルチモーダル大規模モデルです。ゼロからトレーニングされた 12 億パラメータのビジュアルエンコーダ NaViT と DeepSeek V3 大規模言語モデル (LLM) をベースに、強力な視覚認識およびテキスト推論機能を備えています。このモデルは、視覚理解および推論タスクで優れたパフォーマンスを発揮し、クローズドソースの最先端モデルのレベルに迫り、テキストタスクでも競争力を維持しています。dots.vlm1 の NaViT ビジュアルエンコーダは完全にゼロからトレーニングされており、動的解像度をネイティブにサポートし、テキスト監視に加えて純粋な視覚監視を追加することで、認識能力を向上させています。トレーニングデータには、さまざまな合成データアプローチが組み込まれており、多様な画像タイプとその説明を網羅し、データ品質を大幅に向上させています。
dots.vlm1の主な機能
-
優れた視覚理解能力複雑な図表、表、文書、グラフィックなど、画像内のコンテンツを正確に識別・理解することができ、動的な解像度にも対応しており、様々な視覚的タスクに適しています。
-
効率的なテキスト生成と推論DeepSeek V3 LLMをベースにしており、高品質なテキスト記述を生成でき、数学やコードなどのテキスト推論タスクにおいて優れた性能を発揮します。
-
マルチモーダルデータ処理画像とテキストが織り交ぜられたデータ処理をサポートし、視覚情報とテキスト情報を組み合わせることで包括的な推論を実行できるため、マルチモーダルなアプリケーションシナリオに適しています。
-
柔軟な適応と拡張軽量なMLPアダプタを介してビジュアルエンコーダと言語モデルを接続することで、さまざまなタスクに合わせて柔軟に適応・拡張することが容易になります。
-
オープンソースとオープン性本サービスは、開発者の研究開発を支援するための完全なオープンソースコードとモデルを提供し、マルチモーダル技術の開発を促進します。
dots.vlm1の技術的原理
-
NaViTビジュアルエンコーダーdots.vlm1は、既存の成熟したモデルを微調整するのではなく、12億個のパラメータを持つNaViTという、ゼロから学習させたビジュアルエンコーダを使用しています。ネイティブで動的な解像度をサポートし、異なる解像度の画像入力を処理できるだけでなく、テキストによる監視に加えて純粋な視覚的監視も加えることで、モデルの画像認識能力を向上させています。
-
マルチモーダルデータトレーニングこのモデルは、通常の画像、複雑な図表、表、文書、グラフ、およびそれらに対応するテキスト説明(代替テキスト、高密度キャプション、背景情報など)を含む、多様なマルチモーダル学習データを使用します。合成データ手法や、WebページやPDFなどのテキストと画像データをインターリーブしたデータを取り入れ、書き換えやクリーニングによってデータ品質を向上させることで、モデルのマルチモーダル理解能力を強化します。
-
視覚モデルと言語モデルの融合dots.vlm1モジュールは、ビジュアルエンコーダーとDeepSeek V3ラージランゲージモデル(LLM)を組み合わせ、軽量MLPアダプタを介して接続することで、視覚情報と言語情報の効果的な融合を実現し、マルチモーダルタスクの処理をサポートします。
-
3段階のトレーニングプロセスモデルのトレーニングは、ビジュアルエンコーダの事前トレーニング、VLMの事前トレーニング、VLMの事後トレーニングの3つの段階から構成されます。画像解像度を段階的に上げ、多様なトレーニングデータを導入することで、モデルの汎化能力とマルチモーダルタスク処理能力が向上します。
dots.vlm1 のプロジェクトアドレス
-
GitHubリポジトリ:https://github.com/rednote-hilab/dots.vlm1
-
ハグ顔モデルライブラリ:https://huggingface.co/rednote-hilab/dots.vlm1.inst
-
オンラインでデモを体験してください:https://huggingface.co/spaces/rednote-hilab/dots-vlm1-demo
dots.vlm1の応用シナリオ
-
複雑なグラフ推論複雑なグラフを分析・推論することができ、ユーザーがグラフ内の情報をよりよく理解し解釈するのに役立ちます。
-
STEM問題解決科学、技術、工学、数学(STEM)の分野では、モデルは関連する問題を解決し、解決策を提供するのに役立つ。
-
ロングテール認識dots.vlm1は、出現頻度の低いカテゴリやオブジェクトに対しても優れた認識能力を備えています。
-
視覚的推論視覚情報を用いた推論タスク、例えば障害物認識や製品比較分析などを処理できる。
-
テキストと画像による質疑応答とインタラクションテキストと画像を組み合わせた質疑応答タスクをサポートし、複数回の対話を行うことができ、文脈に基づいて一貫性のある回答を提供する。
-
コンテンツのおすすめマルチモーダルデータに基づいて、小紅書プラットフォーム上で関連する画像、テキスト、動画などをユーザーに推奨するなど、パーソナライズされたコンテンツの推奨を提供します。