project
GenEvolve - Meituanなどが開発した、自己進化型画像生成エージェント
GenEvolveは、香港科技大学(広州)、美団、シンガポール国立大学が共同開発した自己進化型画像生成エージェントです。GenEvolveは、ツールによってオーケストレーションされる視覚的軌跡として、オープンエンドな画像生成を形式化します。エージェントは…
GenEvolveとは何ですか?
GenEvolveは、香港科技大学(広州)、美団、シンガポール国立大学が共同開発した、自己進化型画像生成エージェントです。GenEvolveは、ツールによってオーケストレーションされる視覚的軌跡として、自由度の高い画像生成を形式化します。このエージェントは、テキスト証拠を検索し、視覚的参照を取得し、生成知識を呼び出して、最終的にプロンプト参照プログラムを合成します。そして、そのプログラムは任意の参照条件ジェネレータによってレンダリングされます。
GenEvolveの主な機能
-
テキスト検索(検索)実際の建物、著名人、製品構造などに関する世界的な知識を補完するために、外部の事実に基づいた証拠を収集する。
-
画像検索 (image_search)ランドマーク、人物、素材などの視覚的な参考資料を得るために、視覚的な参考画像を検索してください。
-
知識クエリを生成する(query_knowledge)テキストレンダリング、空間レイアウト、マテリアルの一貫性といった複雑な要件に対応するため、内部生成スキルを有効化します。
-
プロンプト・リファレンス・プログラムの統合このツールは、ツールの結果を、任意の参照条件を持つジェネレーターのレンダリングをサポートする実行可能なジェネレーターに統合します。
GenEvolveの技術原則
- 研修は2つの段階に分かれています。:
-
SFTコールドスタート高品質な教師用軌道上でQwen3-VL-8B-Instructの微調整を指導を受けながら行い、基本的なツール呼び出しとプログラム作成を学習する。
-
展開(自己進化)同一のリクエストに対して複数の軌跡がサンプリングされ、画像としてレンダリングされた後、視覚スコアラーとテキストスコアラーの両方によってスコアリングされます。GRPOは、軌跡レベルの報酬を最適化するために使用されます。
-
- 視覚体験の抽出同じ要求に対する最良の軌跡と最悪の軌跡を比較することで、その違いを構造化された意思決定ガイドにまとめます。教師ブランチの嗜好は、トークンレベルの逆知識論理(KL)によって生徒モデルに抽出され、モデルは「類似の要求があった場合に、どのように検索し、参照を選択し、制約を整理するか」という意思決定習慣を学習します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
GenEvolveの使い方
-
リポジトリのクローン作成GenEvolveのコードをGitHubからローカル環境にダウンロードしてください。
-
依存関係をインストールします:走る
pip install -r requirements.txt必要なPythonパッケージをインストールしてください。 -
モデルをダウンロードHuggingFaceからダウンロード
MeiGen-AI/GenEvolveQwen3-VL-8Bエージェントのポリシーウェイト。 -
検索ツールの設定検索エンジンのAPIキーを設定し、有効化してください。
searchそしてimage_searchツール呼び出し。 -
知識の読み込みと生成8つのスキルに関するMarkdownファイルを、後で使用するために指定されたディレクトリに配置してください。
query_knowledgeツールの読み取り。 -
ジェネレーターを選択バックエンドを選択し、Qwen-Image-EditまたはNano Banana Proでキーを設定します。
-
エージェントを初期化するインスタンス化
GenEvolveAgentモデルパス、ジェネレータ名、およびツールリストを渡してください。 -
入力要求: 電話
agent.run()この手法は、自然言語で書かれた画像を入力として受け取り、説明文を生成する。 -
実行軌跡エージェントは、テキスト証拠を自動的に検索し、視覚的な参照情報を取得し、生成された知識を呼び出し、プロンプト参照プログラムを合成する。
-
画像のレンダリングエージェントが出力したプログラムは、設定済みのジェネレーターバックエンドに渡され、最終的な生成画像が取得されます。
GenEvolveの主な利点
-
発電機の携帯性同じエージェント戦略は、オープンソースのQwen-Image-Editや強力な画像生成ツールであるNano Banana Proでも使用でき、特定の画像生成ツールに限定されるものではありません。
-
自己進化閉ループGRPOと視覚体験の自己抽出は、「より強力な戦略 → より良い軌道 → より豊かな体験 → 将来の改善」という閉じたループを形成します。
-
きめ細かな信用配分純粋な強化学習のスカラー報酬と比較して、SDLはトークンレベルのガイダンスを提供し、優れた軌跡が優れたツールプランなのか、参照選択なのか、制約記述方法なのかを明確にする。
-
クロスベンチマーク一般化WISE知識集約型ベンチマークにおいて、ドメイン内微調整を行わなくても、8Bオープンソース戦略はGPT-4oを上回る。
GenEvolveのプロジェクトアドレス
- プロジェクト公式サイト:https://ephemeral182.github.io/GenEvolve/
- GitHubリポジトリ:https://github.com/MeiGen-AI/GenEvolve
- ハギングフェイスモデルライブラリ:https://huggingface.co/MeiGen-AI/GenEvolve
GenEvolveの競合製品比較
| 比較対象寸法 | GenEvolve | Gen-Searcher |
|---|---|---|
| コアメカニズム | 視覚軌跡のツールオーケストレーション → プロンプト参照プログラム → クロスジェネレータレンダリング | 検索機能強化 → 直接生成 |
| エージェントアーキテクチャ | 3つのツールによるクローズドループ:検索+画像検索+クエリ知識 | 主に検索ツール呼び出し |
| トレーニング方法 | SFTコールドスタート + GRPO軌道最適化 + ビジュアルエクスペリエンス自己蒸留(SDL) | 多段階訓練の仕組みは公表されていない。 |
| 自己進化 | サポート:GRPOとSDLを通じて、「より強力な戦略→より良い軌道→より豊かな経験」という閉じたループを形成する。 | サポートされていません: 継続的な最適化メカニズムがありません |
| 発電機の携帯性 | コア設計:同じエージェント出力をQwen-Image-EditまたはNano Banana Proに適用できます。 | 特定のジェネレーターバックエンドをバインドする |
| オープンソースレベル | フルスタックのオープンソース:モデルの重み、実行時間、ツール、データセット、評価ベンチマーク。 | 限定的なオープンソース |
| KScore | 0.3663 | 0.3493 |
GenEvolveの応用事例
- 知識集約型画像生成現実世界の知識を必要とするシナリオ、例えば実際のランドマーク(エッフェル塔、紫禁城)、著名人の肖像画、特定の製品構造、歴史的出来事の再現などについては、エージェントは検索ツールを使用して事実を補足し、ジェネレーターが誤った詳細を「錯覚」させるのを回避します。
- 品質制約付き画像生成テキストのレンダリング、正確なカウント、空間レイアウト、属性の結合、解剖学的正確さ、素材のリアリズム、美的スタイルに関して厳格な要件が求められる、商業デザイン、広告ポスター、教育用イラスト。
- 参照整合性画像生成要件は、参照画像との一貫性を維持する(キャラクターデザイン)、特殊な素材を使用する(金属/絹の質感)、または統一されたスタイル(特定の画家のスタイル)を持つ一連の知的財産派生作品を制作することです。
- 曖昧な要件の明確化と手続き化曖昧なユーザー説明を実行可能なプログラムに変換し、検索対象、参照対象、制約条件を明確に定義することで、迅速なエンジニアリングへの障壁を低減する。