project
DoraCycle - シンガポール国立大学が、マルチモーダルなドメイン適応のための統一生成モデルを発表
DoraCycleは、シンガポール国立大学のShow Labによって開発された、マルチモーダルなドメイン適応のための統一生成モデルです。これは、2つのマルチモーダルループ(テキスト→画像→テキスト、画像→テキスト→画像)を通じて、さまざまな機能を実現します。
DoraCycleとは何ですか?
シンガポール国立大学のShow Labが開発したDoraCycleは、マルチモーダルなドメイン適応のための統合生成モデルです。テキストから画像、そして再びテキストへと変換する2つのマルチモーダルループと、画像からテキスト、そして再び画像へと変換するループを通して、異なるモダリティ間の情報変換と整合を実現します。この統合生成モデルは、双方向マッピングに基づいて学習され、ドメイン適応のためにペアになっていないデータでトレーニングされるため、大量のラベル付きデータは必要ありません。ループのエンドポイントで交差エントロピー損失を用いてモデルを最適化することで、自己進化を促進し、特定のドメインへの適応を実現します。
DoraCycleの主な機能
- ペアデータなしのドメイン適応DoraCycleは、サイクル一貫性学習を通じて、初めて非ペアデータを用いた生成モデルのドメイン適応を実現し、データ取得コストを大幅に削減した。
- 柔軟なタスク適応能力DoraCycleは、ペアワイズな知識を必要としないタスク(スタイル設定など)を処理できるだけでなく、少量のペアデータを効果的に組み合わせて、新しい知識を必要とするタスク(ID生成など)を完了することもできます。
DoraCycleの技術原理
- マルチモーダル循環的一貫性学習DoraCycleは、テキストから画像、そして再びテキストへと変換する(Tサイクル)と、画像からテキスト、そして再び画像へと変換する(Iサイクル)という、2つのマルチモーダルサイクルを統合しています。これらの2つのサイクルは、クロスモーダルマッピングのために、事前学習済みの統合生成モデル(視覚と言語のアライメントモデルなど)を利用します。
- T cycle入力されたテキストシーケンスから始め、モデルはまずそれを画像表現に変換し、次に生成された画像をテキストシーケンスに戻し、生成されたテキストと元のテキスト間の交差エントロピー損失を計算することによってモデルを最適化します。
- I cycle入力画像はまずテキスト記述に変換され、次にそのテキスト記述が再び画像に変換されます。生成された画像と元の画像間の交差エントロピー損失を計算することで、モデルが最適化されます。
- 異種モダリティのアライメントのための自己教師あり学習DoraCycleは、統一された生成モデルを用いて学習された、視覚と言語間の双方向マッピングです。この2つのサイクルを通して、データは同一モダリティ内に保持され、処理中に生じるバイアスに制約が課されます。これにより、モデルは自己教師あり学習によって、視覚と言語間のクロスモーダルな整合性を実現できます。
- トレーニングの安定性向上DoraCycleは、マルチステップ推論中の勾配爆発を回避するために、以下の手法を採用しています。
- グラデーションクリッピングこれにより、2つのループ間で最適化の方向が矛盾することが回避され、トレーニングの安定性が向上します。
- EMAモデル推論のために擬似データを生成する際、ゆっくりと更新される指数移動平均(EMA)モデルを維持することで、擬似データ生成の安定性を向上させる。
DoraCycleのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/showlab/DoraCycle
- arXiv技術論文:https://arxiv.org/pdf/2503.03651
DoraCycleの応用事例
- 様式化されたデザインDoraCycleは、特定のスタイルに準拠した画像やテキストコンテンツを生成するために使用できます。
- 仮想キャラクター生成仮想キャラクターデザインにおいて、DoraCycleは少量のペアデータと大量の非ペアデータを組み合わせることで、特定の個性とスタイルを持つ仮想キャラクターを生成することができる。
- パーソナライズされた広告コンテンツDoraCycleは、ブランドスタイルとターゲット層に基づいて、パーソナライズされた広告画像とコピーを生成できます。
- 個別学習教材DoraCycleは、生徒の学習スタイルや好みに基づいて、個別の学習教材を作成できます。