project
FIBO - JSONをネイティブにサポートする初のオープンソース画像生成モデル。
FIBOは、JSONをネイティブにサポートする初のオープンソースのテキスト画像生成モデルであり、特に長くて構造化された記述で学習されています。このモデルは、1億を超える構造化されたJSON記述(それぞれ約1,000文字)で学習され、高い精度を実現しています。
FIBOとは何ですか?
FIBOは、JSONをネイティブにサポートする初のオープンソースのテキスト画像生成モデルであり、特に長くて構造化された記述で学習されています。1億を超える構造化JSON記述(それぞれ約1,000文字)で学習されたこのモデルは、照明、構図、色、カメラパラメータを正確かつ再現性高く制御できます。FIBOは、生成、洗練、インスピレーションの3つのモードをサポートし、特徴分離機能により、シーン全体を損なうことなく個々の属性を調整できます。FIBOは100%ライセンスデータを使用しているため、コンプライアンスと法的透明性が確保され、プロフェッショナルなワークフローに適しています。
FIBOの主な機能
-
テキストから画像への生成ユーザーが入力したテキスト説明に基づいて、高品質な画像を生成します。
-
構造化JSONヒント短いテキストプロンプトを、照明、構図、色などの詳細を含む、構造化された詳細なJSON記述に展開します。
-
反復制御可能生成短いプロンプトから画像を生成したり、既存のJSONプロンプトを複数回に分けて洗練させたりすることをサポートします。
-
機能分離制御シーン全体を損なうことなく、単一の属性(カメラアングルなど)を調整する。
-
インスピレーションモード入力画像から構造化された手がかりを抽出し、関連性の高い画像を生成して創造性を刺激します。
-
企業レベルのコンプライアンス法的透明性と再現性を確保するため、100%認可されたデータを使用しています。
-
生産レベルでの統合このモデルは、APIインターフェース、ComfyUIノード、およびローカル推論をサポートしています。
FIBOの技術的原則
-
建築8BパラメータDiTアーキテクチャに基づき、フローマッチング学習法を採用している。
-
テキストエンコーダーSmolLM3-3Bと革新的なDimFusion条件付きアーキテクチャを組み合わせることで、長文記述の効率的な学習を実現しました。
-
VAEWAN 2.2を使用し、画像のエンコードとデコードを担当します。
-
VLMブートストラップビジュアル言語モデル(VLM)を使用して、短いテキストヒントを詳細な構造化JSONヒントに拡張します。
-
構造化された監督構造化されたJSON記述をトレーニングに使用することで、特徴量の分離が促進され、キューワードのずれを防ぐことができます。
-
データコンプライアンスデータコンプライアンスを確保するため、1億件を超える承認済みの長文構造化JSON記述に対してトレーニングが実施されました。
FIBOプロジェクトの住所
- GitHubリポジトリ:https://github.com/Bria-AI/FIBO
- ハギングフェイスモデルライブラリ:https://huggingface.co/briaai/FIBO
- オンラインでデモを体験してください:https://huggingface.co/spaces/briaai/FIBO
FIBOの応用シナリオ
- プロフェッショナルなデザインとクリエイティブなワークフロー広告、製品デザイン、グラフィックデザイン向けに高品質な画像を生成し、迅速な反復作業と精密な制御をサポートすることで、クリエイティブな効率性を向上させます。
- 映画とエンターテイメントFIBOは、映画、ゲーム、アニメーション向けのコンセプトアートやシーンデザインを生成することができ、ビジュアル制作を容易にし、開発プロセスを加速させます。
- 教育と訓練このモデルは、教育用画像や仮想実験シナリオを生成することができ、教育コンテンツの作成を支援し、学習体験を向上させる。
- 科学研究モデルは科学データを直感的に理解しやすい画像に変換することができ、研究発表やデータ視覚化に役立つ。
- 医療と健康FIBOは、医療図や仮想手術シナリオを生成することができ、医学教育や外科手術トレーニングを支援する。