project
OmniAlign-V - 上海交通大学と上海AI研究所などが共同で発表した高品質なデータセット。
OmniAlign-Vは、上海交通大学、上海AI研究所、南京大学、復旦大学、浙江大学が共同開発した高品質なデータセットです。マルチモーダル大規模言語モデル(MLLM)と人間の嗜好との整合性を向上させるために特別に設計されています。
OmniAlign-Vとは何ですか?
OmniAlign-Vは、上海交通大学、上海AI研究所、南京大学、復旦大学、浙江大学が共同開発した高品質データセットです。マルチモーダル大規模言語モデル(MLLM)の人間嗜好とのアライメント能力を向上させることを目的としています。OmniAlign-Vには、自然画像やインフォグラフィックを網羅した約20万点のマルチモーダル学習サンプルと、自由回答形式の知識豊富な質問と回答のペアが含まれています。OmniAlign-Vの設計は、知識ベースの質問応答、推論タスク、創造的タスクなど、タスクの多様性を重視しており、複雑な質問と多様な回答形式に基づいてモデルのアライメント能力を高めています。OmniAlign-Vは、意味的に豊かで複雑な画像がデータ生成に使用されるよう、画像選択戦略を導入しています。
OmniAlign-Vの主な機能
- 高品質なマルチモーダルトレーニングデータを提供するこのデータセットには、自然画像やインフォグラフィック(ポスター、グラフなど)を網羅した約20万点のマルチモーダルな学習サンプルが含まれており、複雑な質問や多様な回答形式と組み合わせることで、モデルが人間の好みやニーズをより深く理解できるように支援します。
- モデルの自由回答形式の質問への応答能力を強化する。このデータセットの設計は、自由回答形式の質問、学際的な知識、そして包括的な回答を重視しており、モデルが人間の好みにより合致した回答を生成できるようにしている。
- モデルの推論能力と創造力を向上させる。目標は、モデルがより複雑な思考や創造活動を行うように訓練し、それによってマルチモーダルなインタラクションにおけるパフォーマンスを向上させることである。
- マルチモーダル命令チューニングの最適化高品質な指示調整データに基づいて、モデルが人間の指示によりよく従い、基本的な機能(物体認識、OCRなど)を維持するのに役立ちます。
- マルチモーダルモデルの継続的な最適化をサポートするOmniAlign-Vは、教師あり微調整(SFT)に使用され、直接選好最適化(DPO)と組み合わせることで、モデルのアライメント能力をさらに向上させます。
OmniAlign-Vの技術原理
- 画像フィルタリングと分類画像複雑度(IC)スコアリングとオブジェクトカテゴリ(OC)フィルタリングに基づいて、意味的に豊かで複雑な画像が選択されます。画像は自然画像とインフォグラフィックに分類され、画像の種類ごとに異なるタスクが設計されます。
- タスク設計とデータ生成自然画像タスクには、知識ベースの質問応答、推論、および創造的なタスクが含まれ、モデルが現実世界のシーンからデータを理解し生成する能力を高めます。インフォグラフィックタスクは、グラフやポスターなどを含む特定のタスク向けに設計されており、モデルが複雑な情報を理解し解釈する必要があります。GPT-4oなどの高度なモデルを使用して高品質の質問応答ペアが生成され、後処理によってデータ品質が最適化されます。
- 後処理の最適化生成された質問と回答のペアは、データの多様性と高品質を確保するために、指示の強化、推論の強化、インフォグラフィックによる回答の精緻化などの後処理が施されます。
- マルチモーダルトレーニングと最適化モデルのアライメント能力は、教師ありファインチューニング(SFT)と直接選好最適化(DPO)を用いることで向上する。データセットの設計は多様性と複雑性を重視しており、モデルがマルチモーダルなインタラクションにおける人間の選好をより深く理解することを可能にする。
- ベンチマークと評価: MM-AlignBenchベンチマークテストを導入し、人間の嗜好の整合におけるMLLMの性能を評価し、実世界のシナリオにおけるモデルの適用可能性を保証する。
OmniAlign-Vプロジェクトの住所
- プロジェクト公式サイト:https://phoenixz810.github.io/OmniAlign-V
- GitHubリポジトリ:https://github.com/PhoenixZ810/OmniAlign-V
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/PhoenixZ/omnialign-v
- arXiv技術論文:https://arxiv.org/pdf/2502.18411
OmniAlign-Vの応用事例
- マルチモーダル対話システムインテリジェントアシスタントとユーザー間のインタラクションの質を向上させ、回答を人間の好みにより合致させるため。
- 画像支援型質問応答画像情報を組み合わせることで、より包括的かつ正確な質疑応答サービスを提供し、教育や観光などの分野に適用可能です。
- クリエイティブコンテンツの生成これは、広告コピーやストーリー作成など、質の高いクリエイティブなテキストをユーザーが迅速に生成するのに役立ちます。
- 教育と学習支援学生が複雑な図表やイラストを理解するのに役立つ、より充実した学習教材を提供する。
- インフォグラフィックの解釈これは、ユーザーが複雑なグラフを解釈するのに役立ち、背景知識や推論結果を提供し、データ理解能力を向上させます。