project
Pixel Reasoner - ウォータールー大学が香港科技大学およびその他の大学と共同で開発した視覚言語モデル。
Pixel Reasonerは、ウォータールー大学、香港科技大学、中国科学技術大学などの機関によって開発された視覚言語モデル(VLM)です。ピクセル空間推論に基づいて、視覚情報を理解し、推論するモデルの能力を向上させます。
Pixel Reasonerとは何ですか?
Pixel Reasonerは、ウォータールー大学、香港科技大学、中国科学技術大学などの機関によって開発されたビジュアル言語モデル(VLM)であり、ピクセル空間推論に基づいてモデルの理解力と推論能力を向上させます。このモデルは、画像領域のズームインやビデオフレームの選択など、視覚入力を直接操作し、視覚的な詳細をより正確に捉えることができます。Pixel Reasonerは2段階のトレーニング方法を採用しています。まず、指示ベースの最適化によってモデルが視覚操作に慣れ、次に好奇心に基づく強化学習によってモデルがピクセル空間推論を探求するように促します。Pixel Reasonerは、複数のビジュアル推論ベンチマークで優れた結果を達成し、視覚的に負荷の高いタスクのパフォーマンスを大幅に向上させています。
Pixel Reasonerの主な機能
- 直接視覚操作これにより、画像領域を拡大したり、ビデオフレームを選択したりするなど、視覚入力(画像やビデオなど)を直接操作して、視覚的な詳細をより正確に捉えることができます。
- 視覚理解力を高める画像中の小さな物体、微妙な空間関係、埋め込まれた小さなテキスト、動画中の微妙な動きを識別し理解することができる。
- マルチモーダル推論視覚的質問応答(VQA)や動画理解など、複雑な視覚言語タスクをより包括的に処理できる。
- 適応推論タスクの要件に基づいて視覚操作を使用するかどうかを適応的に判断することで、さまざまな種類の視覚タスクにおいてより優れた推論結果を実現します。
Pixel Reasonerの技術的原理
- 指示チューニング:
- シードデータを収集するSA1B、FineWeb、STARQAなど、豊富な視覚情報を含む画像データセットと動画データセットを選択してください。
- 位置合わせの基準となる視覚的手がかりデータセット内の注釈、またはGPT-4oを使用して生成された注釈に基づいて、問題に関連する視覚的な手がかり(バウンディングボックスやフレームインデックスなど)を特定します。
- 合成エキスパートの軌跡推論経路は、モデルが推論中に視覚操作を正しく使用することを保証するため、テンプレートベースのアプローチを用いて合成されます。例えば、まず視覚入力全体が分析され、次に特定の視覚操作が実行されて詳細な視覚情報が抽出され、最後にそれらの情報が組み合わされて最終的な答えが導き出されます。
- 電車このモデルは、視覚操作に慣れるために、教師ありファインチューニング(SFT)を用いて学習されます。挿入された視覚操作に基づいて自己修正軌道が合成され、予期せぬ視覚結果への対応能力が向上します。
- 好奇心に基づく強化学習好奇心報酬と効率性ペナルティを含む報酬関数を設計し、モデルがピクセル空間推論を探求するよう促す。
- トレーニングプロセスこのモデルは強化学習(RL)を用いて学習され、好奇心報酬によってピクセル空間推論の探索が促進され、効率ペナルティによって視覚操作の回数が制限されます。ニアポリシーRL手法に基づき、行動ポリシーと改善ポリシーは512クエリごとに更新されます。学習中、モデルは適切なクエリでピクセル空間推論を徐々に学習し、視覚操作が失敗した場合には自己修正を行います。
Pixel Reasonerプロジェクトのアドレス
- プロジェクト公式サイト:https://tiger-ai-lab.github.io/Pixel-Reasoner/
- GitHubリポジトリ:https://github.com/TIGER-AI-Lab/Pixel-Reasoner
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/TIGER-Lab/pixel-reasoner
- arXiv技術論文:https://arxiv.org/pdf/2505.15966
- オンラインでデモを体験してください:https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner
Pixel Reasonerの応用シナリオ
- 研究者と開発者研究者や開発者は、特に視覚的な質問応答やビデオ分析といったタスクにおいて、モデルの性能と精度を向上させるために、モデルのトレーニングと最適化を行っている。
- 教育者教育者はこれらのツールを授業の補助として活用し、直感的な視覚表示や説明を用いて、生徒が複雑な概念をよりよく理解し、習得できるよう支援します。
- 工業品質検査官品質検査員は、自動画像検査を用いて製品の外観上の欠陥を迅速に特定し、品質管理の効率と精度を向上させる。
- コンテンツクリエイターこれにより、クリエイターはより精度の高いビジュアルコンテンツの分析と編集を行うことができ、コンテンツの質と魅力を向上させることができます。