AB
AiBoss
project

UniPixel - 香港理工大学とテンセントが共同で開発した、ピクセルレベルのマルチモーダル大規模モデル。

UniPixelは、香港理工大学とテンセントARCラボのチームが開発した、ピクセルレベルのマルチモーダルな大規模統合モデルであり、画像や動画のきめ細かな理解とインタラクションに重点を置いています。単一のモデル内で、オブジェクト参照、ピクセルレベルのセグメンテーションなどを実行できます。

UniPixelとは何ですか?

UniPixelは、香港理工大学とテンセントARCラボのチームが開発した、ピクセルレベルのマルチモーダル大規模統合モデルで、画像/動画のきめ細かな理解とインタラクションに重点を置いています。オブジェクト参照、ピクセルレベルのセグメンテーション、領域推論という3つの主要タスクを単一のモデル内で実行できます。革新的に設計された「オブジェクトメモリメカニズム」と統一されたビジュアルエンコーディング方法により、動画内のターゲットの正確な追跡と意味的理解を実現します。Qwen2.5-VLフレームワークに基づいて、ポイント、ボックス、マスクの3つのインタラクション方法をサポートしています。9つのビジュアルタスクベンチマークテストで、従来の72パラメータモデルを凌駕しています。コードとオンラインデモはオープンソースです。その核心的なブレークスルーは、ビジュアルセグメンテーションと言語推論の深い統合にあり、従来のモデルでは複雑な参照や動的な領域理解を処理できない問題を解決します。

UniPixelの主な機能

  • ピクセルレベルの視覚言語理解この技術はピクセルレベルの視覚言語理解に焦点を当てており、視覚信号と言語の意味論との間のピクセルレベルでの整合を可能にし、画像/動画のセグメンテーション、領域理解、ピクセル品質保証(PixelQA)タスクなど、さまざまなきめ細かいタスクをサポートします。
  • 統合オブジェクト参照およびセグメンテーションこのモデルは、オブジェクト参照機能とセグメンテーション機能をシームレスに統合し、視覚的な入力プロンプトに基づいて関連するマスクを生成し、推論プロセス中にこれらの中間ポインタに基づいて後続の推論を実行することで、きめ細かなピクセルレベルの推論を実現します。
  • マルチタスク対応本モデルは、ReVOS推論セグメンテーションベンチマーク、MeViS、Ref-YouTube-VOS、RefCOCO/+/gデータセットなど、複数のベンチマークテストで優れた性能を発揮しており、オブジェクト参照、セグメンテーション、質問応答を同時に実行することを要求する新しいPixelQAタスクを設計しました。
  • 柔軟な視覚キュー処理視覚的な手がかりの入力を柔軟に処理し、マスクを生成して推論を実行でき、単一フレームおよび複数フレームのビデオ領域の理解、マスクベースの質問応答タスクをサポートできます。

UniPixelの技術原則

  • 統一フレームワーク設計UniPixelは、オブジェクト参照機能とセグメンテーション機能を単一のモデルに統合した統一フレームワークを採用しており、粗粒度のシーン理解から細粒度のピクセル推論への飛躍を可能にし、複雑な視覚推論の基盤を提供します。
  • オブジェクトメモリこのモデルには、参照タスクから抽出されたオブジェクトの特徴を格納するオブジェクトメモリが含まれており、後続のセグメンテーションおよび推論タスクのためのコンテキスト情報を提供し、ピクセルレベルのタスクにおけるモデルのパフォーマンスを向上させます。
  • 多段階トレーニング戦略モデルのピクセルレベルのタスクにおける性能を段階的に向上させ、さまざまなタスク要件に適応させるために、事前学習、代数タスクのファインチューニング、セグメンテーションタスクのファインチューニングを含む、多段階のトレーニング戦略が採用されています。
  • エンドツーエンドのマスク生成このモデルは、言語による記述に基づいてピクセルレベルのマスクを直接生成することができ、言語と視覚の深い統合を実現し、画像/動画のセグメンテーションや領域理解など、さまざまなきめ細かいタスクをサポートします。
  • 柔軟な視覚キュー処理視覚的な手がかりの入力を柔軟に処理し、マスクを生成して推論を実行することができ、単一フレームおよび複数フレームのビデオ領域の理解、マスクベースの質問応答タスクをサポートし、さまざまなシナリオのニーズに適応します。
  • 優れた推論能力VideoRefer-Bench-Qの質問応答タスクにおいて、UniPixel-7Bモデルは74.1%の精度を達成し、GPT-4oを含むいくつかの強力なベンチマークモデルを上回り、複雑な視覚的推論タスクにおけるその強力な能力を実証しました。
  • モデルの重みとデータセットが提供されていますUniPixel-3BとUniPixel-7Bの両方のバージョンに対応したモデル重み、23種類の参照/セグメンテーション/QAデータセットの生画像/動画、および前処理済みの注釈を提供し、研究やアプリケーションのための豊富なリソースを提供します。
  • 研修および評価のサポートこのコードベースは、23種類のデータセットとベンチマークでのトレーニングと評価をサポートしており、柔軟なハードウェア構成、効率的なトレーニング手法、カスタムベースLLMとダイアログテンプレート、さらにTensorboard/Wandbによるトレーニングプロセスの監視機能を備えているため、ユーザーは簡単に利用して最適化できます。

UniPixelのプロジェクトアドレス

  • プロジェクト公式サイト:https://polyu-chenlab.github.io/unipixel/
  • GitHubリポジトリ:https://github.com/PolyU-ChenLab/UniPixel
  • ハギングフェイスのデータ:https://huggingface.co/datasets/PolyU-ChenLab/UniPixel-SFT-1M
  • arXiv技術論文:https://arxiv.org/pdf/2509.18094
  • オンラインでデモを体験してください:https://huggingface.co/spaces/PolyU-ChenLab/UniPixel

UniPixelのアプリケーションシナリオ

  • 画像セグメンテーションUniPixelは、言語による記述に基づいて画像内の特定オブジェクトのピクセルレベルのマスクを生成できるため、医療画像解析や自動運転におけるターゲットセグメンテーションなど、高精度な画像セグメンテーションを必要とするシナリオに適しています。
  • ビデオセグメンテーション映像処理の分野において、UniPixelは動画内のオブジェクトをリアルタイムでセグメント化することができ、動画編集、ビデオ監視、拡張現実などのアプリケーションをサポートします。
  • 地域理解言語による説明を理解することで、動画内の特定の領域を識別・分割することができ、動画コンテンツ分析、インテリジェント監視システム、ビデオ会議における背景分割などに利用できる。
  • 質疑応答課題UniPixelは、音声による説明と視覚情報に基づいて質問に答えることができるPixelQAタスクをサポートしており、教育、インテリジェントな顧客サービス、情報検索などのシナリオに適しています。
  • マルチモーダルな相互作用スマートアシスタント、バーチャルリアリティ、ゲーム開発など、視覚情報と言語情報を組み合わせたインタラクションを必要とするシナリオにおいて、UniPixelはより自然で正確なインタラクティブ体験を提供できます。
  • インテリジェントモニタリングセキュリティ監視の分野において、UniPixelは監視ビデオ内の特定の物体や領域をリアルタイムで識別・セグメント化することができ、監視システムのインテリジェンスレベルを向上させます。