AB
AiBoss
project

Krea 2 - Krea AIは、ゼロから学習させた初の基本画像生成モデルを発表しました。

Krea 2は、Krea AIがゼロからトレーニングした初のベース画像生成モデルであり、「美的感覚を最優先する」クリエイティブ・コラボレーターとして位置づけられています。単にキーワードを洗練させるのではなく、視覚的な美的一貫性、スタイルの伝達、そしてクリエイティブなコントロールに重点を置いています。

Krea 2とは何ですか?

Krea 2は、Krea AIがゼロからトレーニングした初のベース画像生成モデルであり、「美的センスを最優先する」クリエイティブ・コラボレーターとして位置づけられています。単に指示語を正確に翻訳するのではなく、視覚的な美的一貫性、スタイルの伝達、そしてクリエイティブなコントロールに重点を置いています。このモデルには2つのオープンソース版が用意されています。RAW(未精製ベースモデル、非常に柔軟性があり、LoRAのトレーニングに適しています) Turbo(8段階蒸留モデル、約2秒で画像を出力、1K~2K解像度に対応)。Krea 2は、スタイル転送、ムードボード、4段階のクリエイティブパラメータ調整に対応し、Artificial Analysisの評価において、独立系ラボのテクスチャ画像モデルの中で第1位を獲得しました。

Krea 2の主な機能

  • スタイル転送1枚または複数枚の参考画像をアップロードし、それらのビジュアルスタイルを抽出して新しい画像に適用します。各参考画像の影響度を調整したり、複数のスタイルを組み合わせたりすることも可能です。
  • ムードボードクリエイティブな方向性を共有する一連の画像をアップロードすると、Krea 2は全体のトーン、質感、雰囲気、構図の意図を理解し、簡単な指示でも一貫性のある結果を出力します。
  • 創造性4速制御Raw(指示に厳密に従ってください)Low(近づくきっかけとなる言葉)Medium(バランス型デフォルト)High(このモデルは、美的深み、構図、視覚的な豊かさを自動的に追加します。)
  • テキストから画像へテキストプロンプトから高品質な画像を生成する機能をサポートしており、RAWモデルは最大1Kの解像度に対応し、ターボモデルは1Kから2Kまでの解像度に対応しています。
  • 生画像/画像編集Krea Edit機能と併用することで、画像全体を再生成することなく、領域レベルの画像編集、シーンのライティング調整、およびアウトペイントが可能になります。
  • LoRAのトレーニングと推論LoRAをRAWベースモデルで学習させ、ターボ蒸留モデルで推論を実行することで、高速かつパーソナライズされたスタイルカスタマイズを実現します。
  • Kreaノードワークフローこのシステムは、画像処理の流れを自然言語で記述することで、画像を自動的に組み立てて処理するため、複雑なパラメータを手動で設定する必要がなくなります。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

Krea 2の使い方

  • ウェブ上で直接使用するKrea 2モデルを生成するには、krea.aiにアクセスし、インターフェースでKrea 2モデルを選択し、テキストプロンプトを入力し、スタイルの参考画像またはムードボードをアップロードし、創造性パラメーター(Raw/Low/Medium/High)を調整して、「生成」をクリックします。
  • ローカル展開(RAWモデル)GitHubリポジトリのクローン krea-ai/krea-2、走る uv sync 依存関係をインストールし、RAWモデルの重みをダウンロードして設定します。 OSS_RAW 環境変数、実行 uv run inference.py "提示词" --checkpoint oss_raw --steps 52 --cfg 3.5最大1Kの解像度に対応しています。
  • ローカル展開(ターボモデル)Turboモデルの重量をダウンロードして設定してください。 OSS_TURBO 環境変数、実行 uv run inference.py "提示词" --checkpoint oss_turbo --steps 8 --cfg 0.0 --mu 1.15 --width 2048 --height 2048わずか8つの簡単なステップで画像を生成でき、1K~2Kの解像度に対応しています。
  • ComfyUIを使用するKrea 2モデルをComfyUIワークフローにインポートし、RAWまたはTurboモデルノードをロードして、推論用のキューワードノードとサンプラーノードを接続します。
  • API呼び出しFalなどの公式パートナーのAPIサービスを呼び出すことで、Krea 2を独自のアプリケーションやワークフローに統合できます。
  • LoRAのトレーニングと推論Hugging Face Diffusers、Ostris AIツールキット、Kohya(musubi tuner)、またはFalを使用して、RAWモデル上でLoRAをトレーニングします。トレーニング後、LoRAをTurboモデルにロードして、高速な推論を実行します。
  • スタイル転送ワークフロー1枚以上のスタイル参考画像をアップロードし、各画像の影響度を設定して、プロンプトとなる単語を入力してください。Krea 2は、参考スタイルを自動的にブレンドして新しい画像を作成します。
  • ムードボードの作成共通のクリエイティブな方向性を持つ一連の画像をムードボードとしてアップロードし、簡単な指示を入力するだけで、Krea 2は全体的なビジュアル意図に基づいて、一貫性のあるスタイルの出力を生成します。

Krea 2 公式ウェブサイトアドレス

  • GitHubリポジトリ:https://github.com/krea-ai/krea-2

Krea 2の主な利点

  • 美的品質においてトップクラスKrea 2は「美観を最優先」としたデザインモデルであり、Artificial Analysisの評価において、独立系研究機関が開発したテキストベースの画像モデルの中で第1位にランクインし、編集者レベルの視覚的品質を持つ出力を生成する。
  • オープンソースのバイモデルアーキテクチャまた、 RAW(未蒸留の基本モデル、非常に柔軟性あり) Turbo(8段階蒸留モデル、約2秒でグラフを出力)、そして両方の重みは完全にオープンソースです。
  • RAWトレーニングとターボ推論のベストプラクティスその独自のワークフロー設計は、RAWデータでLoRAをトレーニングし、Turboで推論を実行することで、カスタマイズ性と生成速度のバランスを取っています。
  • 非常に強力なスタイル転送能力複数の参照画像をアップロードして視覚スタイルを抽出・統合する機能をサポートしており、ムードボードを通じて画像群の集合的なクリエイティブ意図を理解し、一貫性のあるスタイルで一括出力を行うことができます。
  • AIフレーバーを削除「技術的には正しいが、見た目が味気ない」出力を生成する他のモデルと比べて、Krea 2は美的センスを備えたクリエイティブな協力者のような存在であり、より「AIらしさ」の少ない結果を生み出す。
  • クリエイティブパラメーターは柔軟で制御可能です創造性の調整レベルは4段階(未加工/低/中/高)あり、指示に厳密に従う場合から、モデルが自律的に美的深みを加える場合まで、さまざまなクリエイティブなニーズに対応できます。
  • 高解像度高速生成Turboモデルは1K~2Kの解像度出力に対応しており、高画質を実現するために必要なサンプリングステップはわずか8ステップです。
  • マルチプラットフォームのエコシステムをサポートComfyUI、Fal、SGLangといった主要な推論プラットフォームを公式にサポートしており、完全なAPIと微調整ツールチェーンを提供しています。
  • 地域画像編集Krea Edit機能と併用することで、画像全体を再生成することなく、対象を絞った修正、照明の調整、局所的な編集範囲の拡大などが可能になります。

Krea 2と類似の競合製品との比較

比較対象寸法 Krea 2 GPT Image 2 Gemini Imagen 3
位置 美的感覚に優れたクリエイティブなコラボレーター 命令準拠の正確なジェネレーター 汎用高品質画像モデル
中核的な利点 視覚美学、スタイル伝達、クリエイティブコントロール 複雑な指示に正確に従い、テキストをレンダリングする リアルで鮮明な写真出力
指示語が続きます 中級レベル(芸術的な解釈を重視し、構図を独自に最適化できる能力を持つ)。 極めて高い(直訳すると、複雑な複数パートからなる指示に対して最も高い) 高(説明に忠実で、自然な言語理解力が高い)
美的品質 極めて高い(優れた美的センス、編集者レベルの温かみを備えている) 良い(技術的には優れているがやや冷たい印象。正確だが冷たい印象) 高い(清潔感、洗練さ、汎用性)
スタイル転送 非常に強力(主な利点:ムードボードとマルチスタイルミックスをサポート) 良いが、一貫性に欠け、洗練されたスタイルに傾倒している。 良いが、ありきたりすぎて個性に欠ける。
写真のようなリアリズム 中程度(スタイル重視であり、主要な目的ではない) 非常に高い 極めて高い(おそらく3つの中で最も高い)
テキストレンダリング 弱い(短い単語には許容範囲だが、長いテキストには不安定) 非常に信頼性が高い(ラベル、UI、パッケージのテキストが最も信頼性が高い)。 中程度(短い文章には適していますが、長い文章ではエラーが発生しやすいです)
画像の一貫性 高い(強いスタイルの一貫性) 極めて高い信頼性(複雑なシーン構造において最も高い信頼性を発揮) 高(正確かつクリーンだが、複数ラウンドにわたって時折差異が生じる)
オープンソース/カスタマイズ可能 完全オープンソース(RAWデータ+ターボ重み+推論コード) 非公開ソース(API/ChatGPT経由でのみアクセス可能) クローズドソース(Googleプラットフォームでのみアクセス可能)
LoRAの微調整 (RAWトレーニング、ターボ推論)をサポート サポートされていません Vertex AI Enterprise Editionに対応しています。
生成速度 ターボ:約2秒/8ステップ 8~15秒/フレーム 標準版は動作が遅く、Flash版は5~10秒かかります。

Krea 2の応用シナリオ

  • クリエイティブスタジオとコンセプトデザインプロジェクトの初期段階で、視覚的な方向性を迅速に検討し、ムードボードを作成し、コンセプトアートやスタイルの参考資料を作成し、チームが美的方向性を統一できるよう支援します。
  • マーケティングと広告一貫性のある編集・広告キャンペーン素材を作成し、ブランドのビジュアルスタイルの一括出力に対応することで、従来の撮影およびポストプロダクションのコストを削減します。
  • ファッション業界ルックブックやファッション誌の編集用画像を作成し、生地の質感、照明、雰囲気、そして全体的な美的スタイルを精密にコントロールし、コンセプトから完成品まで効率的な反復作業を実現します。
  • 建築と空間デザインこれにより、コンセプトの視覚化、素材の研究、空間構成を迅速に検討することが可能になり、デザイナーは設計段階で様々なスタイルのレンダリングを提示できるようになります。
  • ゲーム開発キャラクターデザイン、シーンコンセプト、世界観構築、小道具デザインなどに使用され、スタイル転送を通じてプロジェクト全体を通して視覚的な一貫性を維持する。
  • Eコマースと商品表示一貫したスタイルで高品質な商品画像をバッチ処理で生成し、異なるシーン、背景、スタイルを素早く切り替えることで、商品の視覚的な魅力を高めます。