AB
AiBoss
project

ScreenAI - Googleが開発した、UIやインフォグラフィックを理解できる読みやすい画面AIビジュアルモデル。

ScreenAIは、Googleの研究チームが開発した、読みやすい画面AIビジュアル言語モデルです。特にユーザーインターフェース(UI)やインフォグラフィックの理解と処理を目的として設計されています。このモデルは、ビジュアル処理と言語処理を組み合わせたPaLIアーキテクチャに基づいています。

ScreenAIとは何ですか?

ScreenAIは、Googleの研究者によって開発された、読みやすい画面AIビジュアル言語モデルです。特にユーザーインターフェース(UI)やインフォグラフィックの理解と処理を目的として設計されています。PaLIアーキテクチャをベースとし、ビジュアル処理と言語処理の機能を組み合わせ、Pix2Structの柔軟なタイリング戦略を取り入れることで、質問への回答、UIナビゲーションの説明、コンテンツの要約など、画面UI要素に関連するテキストを理解し、生成することができます。

ScreenAIの主な機能

  • 画面情報の説明ScreenAIは、UI要素やインフォグラフィックの内容(種類、位置、相互関係など)を認識し、理解することができます。
  • 質疑応答(QA)ScreenAIは、受信した視覚情報を理解し、UIやインフォグラフィックコンテンツに関する質問に答えることができます。
  • UIナビゲーションScreenAIは、ナビゲーションコマンド(「戻る」など)を解釈し、操作に適したUI要素を認識することで、ユーザーの意図を理解し、インターフェース内を正確にナビゲートすることができます。
  • まとめScreenAIは、画面コンテンツを簡潔に要約し、画面情報の要点を抽出してまとめることができます。
  • さまざまな画面フォーマットに対応ScreenAIは、解像度やアスペクト比の異なるスクリーンショットを処理でき、モバイルデバイスやデスクトップなどの様々なデバイスの画面フォーマットに適応できます。

ScreenAIの技術原則

  • マルチモーダルエンコーダーScreenAIは、PaLIアーキテクチャに着想を得て、ビジュアルエンコーダとランゲージエンコーダという2つの主要部分からなるマルチモーダルエンコーダブロックを採用しています。Vision Transformer(ViT)アーキテクチャに基づくビジュアルエンコーダは、入力されたスクリーンショットを一連の画像埋め込みに変換します。ランゲージエンコーダは、ユーザーインターフェース(UI)要素のラベルや説明など、スクリーンショットに関連付けられたテキスト情報を処理します。
  • 画像とテキストの融合マルチモーダルエンコーダーでは、画像埋め込みとテキスト埋め込みを組み合わせることで、モデルが視覚コンテンツとそれに関連する言語情報を同時に理解できるようにします。この融合により、ScreenAIは複雑な画面操作タスクを処理できるようになります。
  • 自己回帰デコーダーエンコーダの出力は自己回帰デコーダT5に渡され、デコーダT5はテキスト出力を生成する役割を担い、入力画像とテキスト埋め込みに基づいて自然言語による応答を生成できます。
  • 自動データ生成ScreenAIの学習にあたり、研究者らは自動データ生成技術を活用した。PaLM 2-S言語モデルを用いて、画面パターンとそれに対応する質問と回答のペアを含む合成学習データを生成した。この手法により、データの多様性と複雑性が向上し、手動による注釈への依存度を低減することができた。
  • 画像分割戦略ScreenAIは、解像度やアスペクト比が異なるスクリーンショットを処理するために、Pix2Structという技術を採用しています。この技術により、入力画像の形状と事前に定義された最大ブロック数に基づいて、任意のグリッド形状の画像パッチを生成することが可能になり、様々な画面フォーマットに対応できるようになります。
  • モデルの構成とトレーニングScreenAIは、6億7000万、20億、50億パラメータモデルなど、さまざまな規模のモデルバージョンを提供しています。これらのモデルは、事前学習段階で異なる開始点を使用します。例えば、PaLI-3マルチモーダル事前学習チェックポイントから開始するなどです。事前学習とファインチューニングタスクを組み合わせることで、モデルを幅広いタスクで学習および最適化できます。