AB
AiBoss
project

Ovis 1.6 - アリババの国際AIチームが発表したマルチモーダルな大規模モデルで、クローズドソースのGPT-4o-miniを凌駕する性能を持つ。

Ovis 1.6は、アリババの国際AIチームが開発したマルチモーダル大規模モデルです。マルチモーダルコンピューティングの総合ベンチマークであるOpenCompassにおいて優れた結果を達成しており、特にパラメータ数が30億未満のモデルの中で総合スコア1位を獲得しています。

Ovis 1.6とは何ですか?

Ovis 1.6は、アリババの国際AIチームが開発したマルチモーダル大規模モデルです。主要なマルチモーダルベンチマークであるOpenCompassにおいて、30億パラメータ未満のモデルの中で総合スコア1位を獲得し、他の主流モデルを凌駕する優れた結果を達成しました。Ovis 1.6モデルは、数学的推論や視覚的理解など、複数のタスクにおいて卓越した性能を発揮し、クローズドソースのGPT-4o-miniモデルをも上回ります。Ovis 1.6は、テキストや画像など、さまざまなデータ入力に対応でき、視覚的認識推論、数学的・科学的問題解決、日常的なシナリオの理解など、強力なマルチモーダルタスク処理能力を備えています。

Ovis 1.6の主な特徴

  • 数学的推論に関する問題と解答複雑な数式や論理的推論を含む、様々な数学的な問題に正確に答える。
  • 物体認識花の種類など、さまざまな物体を識別できるこの能力は、画像認識能力の高さを示している。
  • テキスト抽出複数の言語でのテキスト抽出に対応しており、Ovis 1.6は様々な文書からテキスト情報を識別して抽出できます。
  • 複雑なタスクの意思決定様々な種類のデータ入力を処理・理解し、画像やテキストの総合的な分析など、複雑な意思決定タスクを実行します。
  • 画像理解画像理解タスクにおいて最先端(SOTA)レベルの性能を実現し、高解像度画像や極めてアスペクト比の異なる画像も処理可能です。

Ovis 1.6の技術的原則

  • 革新的な建築デザインOvis 1.6は、ビジュアルトークナイザー、ビジュアル埋め込みテーブル、および大規模な言語モデルを組み合わせたアーキテクチャに基づいています。この設計では、連続的なビジュアル特徴を確率的なビジュアルトークンに変換する学習可能なビジュアル埋め込みテーブルが導入されています。その後、ビジュアル埋め込みテーブルの複数のインデックス付けと重み付けによって構造化されたビジュアル埋め込みが得られ、マルチモーダルタスクのパフォーマンスが向上します。
  • 高解像度画像処理Ovis 1.6は、極端なアスペクト比の画像の処理をサポートし、高解像度画像にも対応しているため、画像理解タスクにおいて優れた能力を発揮します。
  • 包括的なデータ最適化Ovis 1.6は、トレーニング中にキャプション、VQA、OCR、表、グラフなど、さまざまなデータセットを使用することで、包括的なデータカバレッジを実現し、マルチモーダルな質問応答や指示に従うといったタスクにおけるモデルのパフォーマンスを大幅に向上させています。
  • 優れたモデル性能主要なマルチモーダルベンチマークプラットフォームであるOpenCompassにおいて、Ovis1.6-Gemma2-9Bは30個未満のパラメータを持つモデルの中でトップの順位を獲得し、その優れた性能を実証しました。

Ovis 1.6 のプロジェクトアドレス

Ovis 1.6の応用シナリオ

  • 教育と学習支援Ovis 1.6は、数学の問題に正確に答えることができ、数式を識別・解釈することができ、教育ツールとして、生徒が複雑な概念を学び理解するのに役立ちます。
  • 農業および植物の識別Ovis 1.6は物体認識機能を備えており、様々な植物品種の識別に役立ち、農業研究や植物保護などの分野で重要な役割を果たしています。
  • 言語翻訳とテキスト処理複数の言語でのテキスト抽出と翻訳をサポートしているため、異言語間コミュニケーション、国際ビジネス、多言語コンテンツ作成に適しています。
  • 画像認識と分析手書き文字や複雑な画像を認識でき、画像コンテンツのレビュー、セキュリティ監視、美術分析などに適しています。
  • 自動運転視覚データを統合することで、自動運転車の環境認識能力と意思決定能力が向上し、運転安全性が強化される。
  • 医学的診断これは医師が医療画像を分析する際に役立ち、疾病診断の精度と効率を向上させる。