project
SnapGen - Snapが香港科技大学などの機関と共同で開発した、モバイル向けのテキストベースの画像モデル。
SnapGenは、Snap Inc.、香港科技大学、メルボルン大学、およびその他の機関が共同開発したテキストから画像への変換(T2I)拡散モデルです。モバイルデバイス上で高解像度(1024x1024ピクセル)の画像を迅速に生成でき、必要なのは...
SnapGenとは何ですか?
SnapGenは、Snap Inc.、香港科技大学、メルボルン大学が共同開発したテキストから画像への拡散モデル(T2I)で、モバイルデバイス上でわずか1.4秒で高解像度(1024×1024ピクセル)の画像を高速に生成できます。このモデルは、わずか3億7900万個のパラメータでこの性能を実現しており、モデルサイズと計算要件を大幅に削減しています。また、GenEvalメトリックで0.66という高いスコアを獲得し、SDXLやIF-XLといった多くの大規模モデルを凌駕しています。SnapGenは、最適化されたネットワークアーキテクチャ、クロスアーキテクチャ知識蒸留、敵対的ステップ蒸留などの技術を活用して、モバイルデバイス上で効率的な画像生成を実現しています。
SnapGenの主な機能
- 高解像度画像生成モバイルデバイス上で、最大1024×1024ピクセルの高解像度画像を高速に生成できます。
- 迅速な生成能力画像生成は1.4秒で完了し、生成効率が大幅に向上しました。
- 最適化されたモデルサイズSnapGenモデルはパラメータ数がわずか3億7900万個しかないにもかかわらず、画質の面ではより多くのパラメータを持つモデルを凌駕している。
- アーキテクチャ横断的な知識抽出大規模モデルから得られた知識を応用することで、小規模モデルの生成品質を向上させる。
- 拮抗的な蒸留工程敵対的学習と知識蒸留を組み合わせることで、わずか数ステップで高品質な画像を生成する能力を実現します。
SnapGenの技術原則
- ネットワークアーキテクチャの最適化ノイズ除去用UNetとオートエンコーダー(AE)のネットワークアーキテクチャを徹底的に検証し、レイテンシとパフォーマンスの最適なバランスを実現し、モデルパラメータと計算の複雑さを軽減し、生成される画像の品質を維持した。
- 多段階知識抽出より大規模なモデルからアーキテクチャ横断的な知識を抽出し、多段階の手法を用いてモデル学習を誘導することで、モデルサイズを小さく保ちながら高品質な画像生成を実現する。
- 時間ステップを考慮したスケーリングトレーニング中は、時間ステップを考慮したスケーリング手法が用いられ、複数のトレーニング目標を組み合わせて、異なる時間ステップにおける予測の難易度に適応する。
- 競争力のあるトレーニング敵対的学習と知識蒸留を組み合わせることで、教師モデルを用いた少数のステップで、迅速かつ高品質な画像生成を実現します。
- 統合型敵対的誘導知識抽出プロセスにおいて、生成される画像の品質とリアリティをさらに向上させるために、敵対的誘導が統合されている。
- 非常に効率的なトレーニング手法トレーニングの安定性と生成品質を向上させるため、ストリームマッチングをターゲットとし、トレーニング中にロジット正規サンプリングを行うなど、改良されたトレーニング手法が導入されています。
SnapGenプロジェクトのアドレス
- プロジェクト公式サイト:snap-research.github.io/snapgen
- arXiv技術論文:https://arxiv.org/pdf/2412.09619
SnapGenの応用シナリオ
- ソーシャルメディアコンテンツの作成ユーザーは、Snapchatなどのソーシャルメディアプラットフォームの投稿やストーリーで使用するための、パーソナライズされた画像をすばやく生成できます。
- モバイルアプリケーションとの連携SnapGenをモバイルアプリケーションに統合することで、ユーザーが仮想試着やフィルター効果のプレビューなど、画像を即座に作成できる機能を提供します。
- ゲームとエンターテイメントゲーム内アセットの迅速な生成、またはモバイルゲームにおいてプレイヤーがキャラクターや環境をカスタマイズできるようにするために使用されます。
- 教育と訓練SnapGenを使用して、科学的な図や歴史的な場面など、教材用の画像を生成し、学習体験を向上させましょう。
- ニュースとメディアこれにより、ジャーナリストやメディア関係者はニュース報道に必要な画像を迅速に生成できるようになり、記事の魅力と表現力を高めることができる。