project
xAR - ByteDanceがジョンズ・ホプキンス大学と共同開発した自己回帰型ビジュアル生成フレームワーク
xARは、ByteDanceとジョンズ・ホプキンス大学が共同で提案した、斬新な自己回帰型ビジュアル生成フレームワークです。このフレームワークは、「Next-X Prediction」と「Noisy Context Learning」を利用しています。
xARとは何ですか?
xARは、ByteDanceとジョンズ・ホプキンス大学が共同で提案した、斬新な自己回帰型ビジュアル生成フレームワークです。このフレームワークは、「Next-X Prediction」と「Noisy Context Learning」という技術を用いることで、従来の自己回帰型ビジュアル生成モデルにおける情報密度の不足や誤差の蓄積といった課題を解決します。
xARの主な機能
- 次期X予測これは、従来の「次のラベル予測」を拡張し、より複雑なエンティティ(画像パッチ、細胞、サブサンプル、画像全体など)を予測し、より豊富な意味情報を捉えるモデルをサポートするものです。
- ノイズのあるコンテキスト学習トレーニング中にノイズを導入することで、モデルのエラーに対する堅牢性を向上させ、累積エラーの問題を軽減することができる。
- 高性能発電ImageNetデータセットにおいて、xARモデルは、推論速度と生成品質の両面で、DiTやその他の拡散モデルといった既存の手法を凌駕する性能を発揮する。
- 柔軟な予測ユニット様々な予測ユニット設計(ユニット予測、サブサンプリング予測、マルチスケール予測など)をサポートしており、様々な画像生成タスクに適しています。
xARの技術原理
- フローマッチングxARは、フローマッチング法に基づいて、離散的なラベル分類問題を連続的なエンティティ回帰問題に変換します。具体的には以下のとおりです。
- このモデルは、補間とノイズ注入によってノイズを含む入力を生成する。
- 各自己回帰ステップにおいて、モデルはノイズ分布から目標分布への方向性のある流れ(速度)を予測し、それによって生成される結果を段階的に最適化します。
-
推論戦略推論フェーズにおいて、xARは自己回帰的なアプローチを用いて画像を段階的に生成する。
- まず、ガウスノイズから初期セル(例えば、8×8の画像ブロック)を予測します。
- 生成されたユニットに基づいて、モデルは画像全体が生成されるまで、次のユニットを順次生成していく。
- 実験結果xARはImageNet-256およびImageNet-512ベンチマークにおいて、大幅な性能向上を達成した。
- xAR-B1億7200万個のパラメータを持つこのモデルは、推論速度においてDiT-XL(6億7500万個のパラメータ)よりも20倍高速であり、既存の拡散モデルや自己回帰モデルよりも優れた1.72のフレーザー開始距離(FID)を達成している。
- xAR-H11億個のパラメータを持つこのモデルは、ImageNet-256において1.24のFIDを達成し、視覚ベースモデル(DINOv2など)や高度な誘導領域サンプリングに頼ることなく、新たな最先端レベルを確立した。
xARのプロジェクトアドレス
- プロジェクト公式サイト:https://oliverrensu.github.io/project/xAR/
- arXiv技術論文:https://arxiv.org/pdf/2502.20388
xARの応用シナリオ
- 芸術創作アーティストはxARを使って創造的な画像を生成でき、それを作品のインスピレーション源にしたり、作品に直接使用したりできます。xARは、豊かなディテールと多様なスタイルを備えた画像を生成できるため、さまざまな解像度やスタイルでクリエイティブなニーズに対応できます。
- 仮想シーン生成ゲーム開発やバーチャルリアリティ(VR)において、xARは自然の風景、都市環境、仮想キャラクターなど、リアルな仮想シーンを迅速に生成することができ、ユーザーエクスペリエンスを向上させる。
- 古い写真の修復xARは高品質な画像コンテンツを生成することで、古い写真の損傷部分を修復し、元のディテールと色彩を復元することができます。
- 動画コンテンツの生成xARは、ビデオエフェクトの作成、アニメーションの生成、ビデオ編集に使用するために、ビデオ内に特定のシーンやオブジェクトを生成することができます。
- データ拡張xARは多様な画像を生成することで、トレーニングデータセットを拡張し、モデルの汎化能力と堅牢性を向上させることができる。