project
Aya Vision - Cohereがマルチモーダル、多言語対応のビジュアルモデルを発表
Cohere社が開発したAya Visionは、マルチモーダルかつ多言語対応のビジョンモデルであり、世界中の多言語・マルチモーダルコミュニケーション機能を強化します。23言語に対応し、画像説明生成、視覚的質問応答、テキスト翻訳などを行うことができます。
Aya Visionとは何ですか?
Cohere社が開発したAya Visionは、マルチモーダルかつ多言語に対応した画像認識モデルで、世界中の多言語・マルチモーダルコミュニケーション機能を強化します。23言語に対応し、画像キャプション生成、視覚的な質問応答、テキスト翻訳、多言語要約などのタスクを実行できます。Aya Visionには、Aya Vision 32BとAya Vision 8Bの2つのバージョンがあり、それぞれ性能と計算効率に独自の利点があります。このモデルは、合成アノテーションと多言語データ拡張技術を用いて学習されるため、限られたリソースでも高い効率性を実現します。
Aya Visionの主な機能
- 画像の説明生成Aya Visionは、入力画像に基づいて正確かつ詳細な説明文を生成することで、ユーザーが画像内容を素早く理解できるよう支援します。視覚障害者や、画像情報を迅速に抽出する必要がある場面に最適です。
- 視覚的質問応答(VQA)ユーザーは画像をアップロードし、それに関連する質問をすることができます。Aya Visionは、視覚情報と言語理解を組み合わせることで、正確な回答を提供します。
- 多言語対応Aya Visionは23の主要言語に対応しており、多言語のテキスト入出力が可能です。画像の説明文を生成したり、質問に答えたり、さまざまな言語環境でテキストを翻訳したりすることで、言語の壁を取り払います。
- テキストの翻訳と要約Aya Visionはテキストコンテンツを翻訳し、簡潔な要約を生成することで、ユーザーが重要な情報を素早く入手できるよう支援します。
- 異種感覚間の理解と生成Aya Visionは、視覚情報と言語情報を組み合わせることで、異なる感覚モダリティ間のインタラクションを可能にします。例えば、画像コンテンツをテキストによる説明に変換したり、テキストによる指示を視覚的な検索結果に変換したりすることができます。
Aya Visionの技術原理
- マルチモーダル建築Aya Visionは、ビジュアルエンコーダ、ビジュアル言語コネクタ、および言語モデルデコーダから構成されるモジュール型アーキテクチャを採用しています。SigLIP2-patch14-384をベースとしたビジュアルエンコーダは、画像の特徴抽出を担当し、ビジュアル言語コネクタは、画像の特徴を言語モデルの埋め込み空間にマッピングします。そして、デコーダはテキスト出力を生成します。
- 合成アノテーションとデータ拡張多言語性能を向上させるため、Aya Visionは合成アノテーション(AI生成アノテーション)を用いて学習されます。これらのアノテーションは翻訳と再記述によって処理され、多言語データの品質が向上します。また、このモデルは動的画像解像度処理とピクセルシャッフルダウンサンプリング技術を採用することで、計算効率を高めています。
- 2段階のトレーニングプロセスAya Visionのトレーニングは、視覚と言語の整合と教師あり微調整の2つのフェーズで構成されます。最初のフェーズでは視覚表現と言語表現を整合させ、2番目のフェーズではマルチモーダルタスクにおいてコネクタと言語モデルを共同でトレーニングします。
- 高性能コンピューティングAya Visionはパラメータサイズが小さい(8Bおよび32B)にもかかわらず、複数のベンチマークテストにおいて、Llama-3.2 90B Visionなどの大規模モデルを上回る性能を発揮します。これは、効率的な学習戦略と計算リソースの最適化によるものです。
Aya Visionのプロジェクト住所
- プロジェクト公式サイト:Cohere
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/CohereForAI/c4ai-aya-vision
Aya Visionの応用事例
- 教育Aya Visionは、生徒と教師が視覚コンテンツをより深く理解するのに役立ちます。例えば、画像の説明機能を通して、生徒は作品のスタイルや由来を素早く理解することができます。
- コンテンツ作成Aya Visionは、多言語ウェブサイト向けの画像説明文を生成し、ユーザーエクスペリエンスを向上させます。また、ニュース記事、物語、詩などのクリエイティブなコンテンツの生成にも利用できます。
- 補助ツールAya Visionは、視覚障害者が画像の説明を通して周囲の状況を理解するのを支援する補助ツールとして使用できます。
- 多言語翻訳とコミュニケーションAya Visionは23言語でのテキスト翻訳と要約をサポートしており、ユーザーが言語の壁を越えてコミュニケーションをとることを支援します。
- 研究開発研究者は、その効率性と多言語対応機能に基づいて、新たな応用シナリオを探求することができる。