AB
AiBoss
project

F-Lite - FreepikとFALによってオープンソース化されたテキストベースのグラフモデル。

F-Liteは、FreepikチームがFALと共同でオープンソース化した、10パラメータのテキストベース画像モデルです。Freepik独自の80Mデータセットでトレーニングされており、商用利用にも対応しています。F-Liteは、テキストエンコーダーとしてT5-XXLを使用し、17番目のテキストを抽出することに基づいています。

F-Liteとは何ですか?

F-Liteは、FreepikチームがFALと共同でオープンソース化した、10パラメータのテキストベース画像モデルです。Freepik独自の8,000万件のデータセットで学習されており、商用利用にも対応しています。F-LiteはテキストエンコーダーとしてT5-XXLを使用し、17層目から抽出した特徴をDiTモデルに注入します。学習には、256と512の解像度での事前学習と、1024の解像度での事後学習が含まれるため、学習コストが高くなります。リッチなテクスチャと詳細な情報に最適化された特別バージョン、F-Lite Textureもリリースされています。

F-Liteの主な機能

  • テキストから画像への生成ユーザーがテキストによる説明を入力すると、モデルはその説明に一致する画像を生成する。
  • 商用ライセンスこのモデルはFreepikが提供する著作権保護されたデータセットで学習されており、生成された画像は商用目的で使用できます。
  • マルチ解像度トレーニングさまざまなシナリオのニーズに対応するため、256、512、1024の解像度での画像生成をサポートしています。
  • 特別バージョン最適化豊かなテクスチャと詳細なヒントに最適化されたF-Lite Textureバージョンをご紹介します。

F-Liteの技術原理

  • 拡散モデルアーキテクチャこの手法は、逆拡散プロセスを利用して、ランダムなノイズを徐々に意味のある画像へと変換します。テキストベースの条件付き拡散モデルとテキストエンコーダを組み合わせることで、画像生成プロセスにテキストの特徴を組み込みます。
  • テキストエンコーダーこの手法では、テキストエンコーダーとしてT5-XXLを使用し、テキストの特徴を抽出します。テキストの意味情報をより的確に捉えるため、T5-XXLエンコーダーの最終層ではなく、17層目から特徴を抽出します。抽出されたテキストの特徴は、クロスアテンション機構を用いて拡散モデルに注入され、生成される画像がテキストの説明と高い関連性を持つようにします。
  • トレーニング戦略
    • マルチ解像度事前学習このモデルは、画像の基本的な特徴を学習するために、256ピクセルと512ピクセルの解像度で事前学習されています。
    • 高解像度のトレーニング後データ1024ピクセルの解像度でトレーニング後処理を行うと、より高品質な画像が生成されます。
    • 強化学習トレーニングGRPO(勾配ベース強化ポリシー最適化)に基づく強化学習トレーニングは、生成される画像の多様性と品質を向上させます。
  • 最適化技術テキストと画像の特徴をより適切に整合させるために、学習可能なレジスタトークンが導入されています。残差接続により、モデルの学習の安定性と効率が向上します。μパラメータ化により拡散プロセスが最適化され、生成される画像の品質が向上します。

F-Liteプロジェクトの住所

F-Liteの応用事例

  • クリエイティブデザイン広告、ポスター、イラスト、その他のデザインのためのインスピレーションや視覚素材を提供し、デザイン効率と創造性の多様性を向上させます。
  • コンテンツ作成ソーシャルメディアやブログなどで使用する画像を生成し、コンテンツの視覚効果を高め、魅力と拡散力を向上させます。
  • ゲーム開発ゲームキャラクター、シーン、複雑なテクスチャを迅速に生成できるため、ゲームのデザインと開発プロセスを加速させることができます。
  • 教育と学習このシステムは、授業内容に基づいて関連性の高い画像を生成することで、学生が教材をよりよく理解し記憶するのに役立ち、学習成果の向上につながる。
  • ビジネスと企業事業促進やブランド構築のために、商品展示画像、ブランドプロモーション画像などを生成し、ブランドイメージと市場競争力を向上させる。