project
Ferret-UI 2 - AppleのクロスプラットフォームUI理解マルチモーダル大規模言語モデル
Ferret-UI 2は、Appleが開発したマルチモーダルな大規模言語モデルで、モバイルユーザーインターフェースの理解と操作に使用されます。Ferret-UI 2は、さまざまなモバイルデバイスの画面上のUI要素を認識・理解し、複雑なユーザーコマンドを実行できます。
Ferret-UI 2とは何ですか?
Ferret-UI 2は、Appleが開発したマルチモーダルな大規模言語モデルで、モバイルユーザーインターフェースの理解と操作に使用されます。Ferret-UI 2は、様々なモバイルデバイス画面上のUI要素を認識・理解し、複雑なユーザーコマンドを実行したり、モバイルデバイス画面上のユーザー操作をリアルタイムで観察したり、支援を提供したり、タスクを実行したりすることができます。Ferret-UI 2は、以前のバージョンと比較して大幅な改良とアップデートが施されています。高解像度画像エンコーディングと高度なデータトレーニング手法に基づき、UI要素の認識精度と操作能力が向上し、ユーザーがスマートデバイスをより自然かつ効率的に操作できるようになります。
Ferret-UI 2の主な機能
- マルチプラットフォーム対応Ferret-UI 2は、iPhone、Android、iPad、Webページ、Apple TVなど、複数のプラットフォームのユーザーインターフェースに対応できます。
- 高解像度画像認識適応型スケーリング技術に基づき、Ferret-UI 2は元のUIスクリーンショットの解像度を維持しながら、より正確な視覚要素認識を実現できます。
- 高度なタスクトレーニングデータ生成Ferret-UI 2は、GPT-4oとマークセットによる視覚的手がかりに基づいて、複雑なタスクのためのトレーニングデータを生成し、UI要素間の空間的関係に対するモデルの理解を向上させます。
- ユーザーセンターインタラクションFerret-UI 2は、単なる機械的なクリックだけでなく、送信内容の確認やボタンのクリックなど、ユーザー中心のインタラクションタスクを理解し、実行することができます。
- クロスプラットフォーム移行機能Ferret-UI 2は強力なクロスプラットフォーム移植性を備えており、異なるプラットフォーム間での移行と適応を可能にします。
Ferret-UI 2の技術的原理
- マルチモーダル大規模言語モデル(MLLM)視覚認識能力と言語処理能力を組み合わせることで、UIとの複雑なインタラクションを理解し、生成します。
- 適応型Nグリッド機構このアルゴリズムは最適なグリッドサイズを決定し、UIスクリーンショットの各部分を解像度の歪みやピクセル変動を最小限に抑えてエンコードします。
- 動的高解像度画像符号化CLIP画像エンコーダは、グローバル特徴量とローカル特徴量を抽出するために使用され、抽出された特徴量は大規模言語モデル(LLM)に入力されます。
- ビジュアルサンプラーユーザーの指示に基づいて、関連するUI領域を特定して選択し、UI要素の知覚または操作に関する説明を出力する。
- セットオブマーク(SoM)視覚キュートレーニングデータを生成する際には、SoMプロンプトを使用して、特に複数回のターンを伴う知覚や対話型の質問応答タスクにおいて、UI要素間の空間的関係に対するモデルの理解を深めてください。
- エンドツーエンドのトレーニングこのモデルは、エンドツーエンドのトレーニングプロセスを通じて元のデータ注釈から学習し、高品質のトレーニングデータを生成してモデルのパフォーマンスを最適化します。
Ferret-UI 2プロジェクトのアドレス
- arXiv技術論文:https://arxiv.org/pdf/2410.18967
Ferret-UI 2の応用シナリオ
- スマートフォンとタブレットFerret-UI 2は、iOSおよびAndroidデバイス上で、アプリケーションの操作、メッセージの送信、リマインダーの設定など、さまざまなユーザーコマンドを理解して実行できます。
- ウェブブラウジングウェブブラウジングにおいて、ボタンのクリック、フォームへの入力、ナビゲーションリンクの操作など、ウェブページ上の要素とのより効果的なインタラクションを支援します。
- スマートテレビApple TVなどのスマートTVプラットフォーム向けには、音声操作やその他のインタラクション方法を提供し、ユーザーエクスペリエンスを向上させる。
- マルチタスク環境複数のアプリケーションやウィンドウを同時に処理する必要があるシナリオでは、ユーザーがさまざまなタスクをより効率的に管理し、切り替えるのに役立ちます。
- 支援技術これは、障害のある人が音声コマンドやその他の入力方法を通じて機器を操作できるようにするための支援技術に組み込まれています。