project
Mayaは、オープンソースで多言語・マルチモーダルなモデルであり、8つの異なる言語を処理・理解することができます。
Mayaは、オープンソースの多言語・マルチモーダルモデルであり、インストラクションベースのファインチューニングを使用して、複数の言語と文化的背景にわたって機能を拡張します。MayaはLLaVAフレームワークに基づいて構築されており、新たに作成された8言語の事前学習済みデータセットが含まれており、視覚的認識能力を向上させています。
マヤとは何ですか?
Mayaは、オープンソースの多言語・マルチモーダルモデルであり、インストラクションベースのファインチューニングを用いて、複数の言語と文化的背景にわたってその機能を拡張します。LLaVAフレームワークに基づいて構築されたMayaは、新たに作成された8言語の事前学習済みデータセットを含み、視覚言語タスクにおける文化的・言語的理解を向上させます。Mayaは、毒性分析とデータセットフィルタリングを採用してトレーニングデータの安全性と品質を確保し、中国語、フランス語、スペイン語、ロシア語、ヒンディー語、日本語、アラビア語など複数の言語をサポートし、リソースの少ない言語におけるAIコンテンツ生成の品質向上に注力しています。
Mayaの主な機能
- 多言語対応Mayaは、中国語、フランス語、スペイン語、ロシア語、ヒンディー語、日本語、アラビア語、英語を含む8つの異なる言語を処理および理解でき、リソースの少ない言語に対するサポートも強化されています。
- マルチモーダル機能画像データとテキストデータを組み合わせることで、機械は自然言語を通して視覚世界を理解し、画像の説明や視覚的な質問への回答といったタスクを実行できるようになる。
- コマンドの微調整指示の微調整に基づいて、自然言語による指示をより良く理解し、応答できるようになり、実用的なアプリケーションにおける性能と適応性が向上します。
- データセットの作成と毒性フィルタリング多言語対応の画像・テキスト事前学習済みデータセットを作成し、データセキュリティと品質を確保するために、有害性分析とフィルタリングを実行します。
- 異文化理解多言語・多様式データに基づいて、異なる文化的背景を持つ視覚情報と言語情報をより良く理解し、処理することができる。
Mayaの技術的原則
- モデルアーキテクチャLLaVA 1.5アーキテクチャに基づき、多言語言語モデル(LLM)としてAya-23 8Bモデルを、ビジュアルエンコーダとしてSigLIPを使用することで、多言語およびマルチモーダル入力に対応しています。
- 事前学習済みデータセット多言語視覚言語モデルの開発を支援するため、8つの言語で55万8000枚の画像を含む、多言語画像テキスト事前学習済みデータセットを作成する。
- 毒性分析私たちはLLaVAGuard 7BとToxic-BERTを使用して、データセット内の画像とテキストの毒性分析を行い、安全でない、または有害なコンテンツを特定して除外しました。
- 事前学習と微調整:
- 事前トレーニング画像の特徴は射影行列Wを用いて言語の特徴に変換され、画像とテキストのアライメントを最適化するために、複数ターンの対話データに基づいて事前学習される。
- 微調整モデルの命令理解力と命令への応答性をさらに向上させるため、PALO 150K命令ファインチューニングデータセットを用いてファインチューニングを実施した。
- 異種モダリティ間の連携投影行列と学習戦略に基づいて、画像特徴と言語特徴のアライメントを最適化することで、視覚と言語のタスクにおけるモデルのパフォーマンスを向上させます。
マヤのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/nahidalam/maya
- ハギングフェイスモデルライブラリ:https://huggingface.co/maya-multimodal/maya
- arXiv技術論文:https://arxiv.org/pdf/2412.07112
Mayaの応用シナリオ
- 言語を超えたコンテンツ理解これは、ユーザーが多言語環境において、道路標識、広告、メニューなど、さまざまな言語の画像コンテンツを認識・解釈するのに役立ちます。
- 画像および動画分析セキュリティ監視やコンテンツモデレーションといった分野では、画像や動画を分析して不適切なコンテンツを特定し、フィルタリングする。
- 教育と学習非ネイティブスピーカーの学習者向けに、多言語学習教材の画像とテキスト分析を提供し、学習体験を向上させます。
- 観光と航海これは、観光客がさまざまな国の道路標識、地図、文化的な名所を識別し、翻訳するのに役立ちます。
- 電子商取引多言語対応のECプラットフォームでは、これによりユーザーが商品の説明や画像を理解しやすくなり、ショッピング体験が向上します。