project
Jodi - 中国科学院が開発した、視覚理解と生成のための統一モデル
Jodiは、中国科学院計算技術研究所と中国科学院大学が開発した拡散モデルフレームワークです。画像ドメインと複数のラベルドメインの共同モデリングに基づき、視覚生成と理解を統合します。
ジョディとは何ですか?
Jodiは、中国科学院計算技術研究所と中国科学院大学が開発した拡散モデルフレームワークです。画像ドメインと複数のラベルドメインを統合的にモデル化することで、視覚生成と理解を統一します。Jodiは、線形拡散トランスフォーマーと役割切り替えメカニズムを利用して、共同生成(画像と複数のラベルを同時に生成)、制御生成(ラベルの組み合わせに基づいて画像を生成)、画像認識(画像から複数のラベルを予測)の3つのタスクを実行します。Jodiは、7つの視覚ドメインから収集された20万枚の高品質画像とラベルを含むJoint-1.6Mデータセットで学習されています。Jodiは、生成タスクと理解タスクの両方で優れた性能を発揮し、高い拡張性とドメイン間の一貫性を示しています。
ジョディの主な機能
- 共同世代このシステムは、深度マップ、法線マップ、エッジマップなど、画像と複数のラベルを同時に生成し、生成された画像とラベルが意味的にも空間的にも一貫性を持つことを保証します。
- 制御可能な発電指定されたラベルの組み合わせに基づいて画像を生成します。ユーザーは、生成される画像の特定の属性や機能を制御するために、条件付き入力として特定のラベルを指定します。
- 画像認識この技術は、与えられた画像から複数のラベルを同時に予測できるため、深度推定、エッジ検出、セマンティックセグメンテーションなどのタスクを同時に実行するなど、画像の多次元的な理解と分析が可能になります。
ジョディの技術原則
- 関節モデリングモデリングは、画像ドメインと複数のラベルドメインの同時分布に基づいています。学習された同時分布 p(x, y1, y2, …, yM) に基づいて、タスクの生成と理解に必要な周辺分布と条件付き分布が導出されます。
- 文字切り替えメカニズムトレーニング中、各ドメインには、ターゲット生成([G])、条件付き入力([C])、無視([X])の3つの役割のうちの1つがランダムに割り当てられます。モデルは、共同生成、制御生成、画像認識など、さまざまな種類の確率分布を同時に学習できます。
- 線形拡散トランスフォーマー線形拡散型Transformerをバックボーンネットワークとして使用することで、線形アテンション機構に基づき計算複雑度を効果的に低減し、複数の視覚ドメインを効率的に処理できるモデルを実現しました。マスク付き線形アテンションとドメイン不変位置埋め込みを導入することで、異なる視覚ドメイン間の一貫性と整合性を向上させています。
- データセットの構築複数の視覚領域にわたる共同モデリングをサポートするために、JodiはJoint-1.6Mデータセットを構築しました。このデータセットには、7つの視覚領域に対応する20万枚の高品質画像とそれに対応する自動ラベルが含まれており、モデルトレーニングのための豊富なデータサポートを提供します。
ジョディのプロジェクト住所
- プロジェクト公式サイト:https://vipl-genun.github.io/Project-Jodi/
- GitHubリポジトリ:https://github.com/VIPL-GENUN/Jodi
- ハギングフェイスモデルライブラリ:https://huggingface.co/VIPL-GENUN/Jodi
- arXiv技術論文:https://arxiv.org/pdf/2505.19084
ジョディの応募シナリオ
- クリエイティブコンテンツの生成これはアーティストやデザイナーにインスピレーションを与え、特定のスタイルや要素を持つ画像を素早く生成する。
- マルチモーダルデータ拡張機械学習モデルのトレーニングデータセットを強化するために、高品質なマルチモーダルデータを生成する。
- 画像編集と修復ユーザー入力に基づいて画像を修復または編集したり、不足している部分を生成したり、スタイルを調整したりします。
- 視覚的理解と分析医用画像解析などの画像理解タスクを支援するために、複数の視覚ラベルを予測する。
- 仮想現実と拡張現実VRおよびARアプリケーションの体験を向上させるために、リアルな仮想シーンと注釈情報を生成します。