AB
AiBoss
project

ComfyGen - NVIDIAがテルアビブと提携して立ち上げたテキストから画像を生成するシステム

NVIDIAとテルアビブ大学の研究者によって開発されたComfyGenは、大規模言語モデル(LLM)に基づいてワークフローを自動的に作成し、ユーザーが入力したテキストプロンプトにマッチさせることで画像生成の品質を向上させるテキスト画像生成システムです。

ComfyGenとは何ですか?

NVIDIAとテルアビブ大学の研究者によって開発されたComfyGenは、大規模言語モデル(LLM)に基づいてユーザーが提供するテキストプロンプトに一致するワークフローを自動的に作成し、生成される画像の品質を向上させるテキストから画像への生成システムです。このシステムは、ベースモデルの微調整、LoRA、埋め込み、超解像ステップなどの複数の特殊なコンポーネントを組み合わせて複雑なワークフローを構築することで、従来の単一モデルによる画像生成アプローチの限界に対処しています。ComfyGenは、2つのLLMベースの手法を提案しています。1つはユーザーの好みデータに基づく最適化手法、もう1つはトレーニングを必要とせずに既存のワークフローを直接選択する手法です。どちらの手法も、従来のモデルや一般的なワークフローよりも高い画像品質を実現しています。

ComfyGenの主な機能

  • 適応型ワークフロー生成ユーザーのテキスト入力に基づいて、最適な画像生成ワークフローを自動的に作成します。
  • 複数コンポーネントの連携ベースモデルの微調整、LoRA、埋め込み、超解像といった様々な専門的な要素を組み合わせて、複雑なワークフローを構築します。
  • 品質改善最適化されたワークフローに基づき画質が向上し、ユーザーの好みに合ったテキストプロンプトが表示されるようになりました。
  • 自動化されたプロセス設計効果的なワークフローを設計するために必要な専門知識を軽減し、さまざまなテキストプロンプトに適応するプロセス設計を自動化する。
  • LLM予測統合大規模言語モデル(LLM)による予測と選択に基づいて、テキストプロンプトに最もよく一致する画像を生成するプロセス。

ComfyGenの技術原理

  • データ収集とトレーニングセットの構築研究者らは、人間が作成した一連の ComfyUI ワークフローを収集し、ワークフローのパラメータ(ベースモデル、LoRA、サンプラーなど)をランダムに交換することでデータセットを拡張した。一連のテキストプロンプトを使用して画像が生成され、美的および人間の好みの予測因子に基づいて画像が評価され、プロンプト、ワークフロー、スコアを含む 3 つのデータセットが形成された。
  • LLM予測ComfyGenは、LLMに基づいて、与えられたテキストプロンプトに対する最適なワークフローを予測します。これには2つの方法があります。
    • コンテキスト法(ComfyGen-IC)LLM(学習管理システム)に、さまざまなカテゴリのワークフローとスコアを含む表を提供し、新しいテキストプロンプトに対して最も適切なワークフローを選択するようにユーザーに求めます。
    • 微調整方法(ComfyGen-FT)テキストプロンプトと目標スコアが与えられた場合に、目標スコアを達成するワークフローを予測するようにLLMを微調整する。
  • ワークフロー生成推論段階では、ComfyGenはテキストによるプロンプトと高得点を入力として受け取り、LLMは条件に合致するワークフローを予測します。
  • 画像生成と評価生成された画像は、予測されたワークフロー、人間の好み、および画像品質指標を用いて評価される。

ComfyGenのプロジェクトアドレス

ComfyGenの応用事例

  • 芸術創作アーティストやデザイナーは、ComfyGenを使用して特定のスタイルやテーマの画像を生成することで、創作プロセスを加速させ、新しい視覚的コンセプトを探求しています。
  • ゲーム開発ゲーム開発者はComfyGenを使用することで、ゲーム環境内の背景、キャラクターのコンセプトアート、その他のゲーム要素を迅速に生成でき、開発効率を向上させることができます。
  • 広告とマーケティングマーケティングチームはComfyGenを使用して広告画像やマーケティング資料をデザインし、それらが広告コピーやブランドメッセージと一致するようにしました。
  • 映画・エンターテインメント業界映画制作者や視覚効果チームは、ComfyGenを使用して映画のコンセプトアートや特殊効果画像を作成し、プリプロダクションや視覚効果デザインを支援しています。
  • 教育と研究教育者や研究者は、ComfyGenを使用して教材用のイラストを作成したり、科学的な視覚化のための正確な画像を作成したりしています。