AB
AiBoss
project

Seedream 2.0 - ByteDanceが開発した、中国語と英語のネイティブバイリンガル画像生成モデル。

Seedream 2.0 は、ByteDance の Doubao Big Model チームによって開発された中国語と英語のネイティブバイリンガル画像生成モデルであり、テキストレンダリングと文化理解における既存モデルの欠点を克服しています。このモデルは、独自開発のバイリンガル大規模言語モデル (LL...

Seedream 2.0とは何ですか?

Seedream 2.0は、ByteDanceのDoubao Big Modelチームが開発した中国語・英語ネイティブのバイリンガル画像生成モデルで、既存モデルのテキストレンダリングと文化理解における欠点を克服しています。このモデルは、独自開発のバイリンガル大規模言語モデル(LLM)をテキストエンコーダーとして使用し、膨大なデータからローカル知識を直接学習して、正確な文化的詳細と美的表現を備えた高精細な画像を生成します。Seedream 2.0は、柔軟な文字レベルのテキストレンダリングにGlyph-Aligned ByT5モデルを採用し、Scaled ROPE技術を使用して未学習の解像度にも一般化します。

Seedream 2.0の主な機能

  • 優れたバイリンガル理解能力中国語と英語のコマンドを高精度で理解し、それに従うことができ、文化的ニュアンスを含む、美的にも優れた中国語または英語の画像を生成できるため、異なる言語や視覚スタイル間の障壁を取り払うことができます。
  • 優れたテキストレンダリング機能テキストの破損率を大幅に低減し、より自然で美的に優れたフォント変更を実現するとともに、伝統的な中国風の模様や要素の生成において高品質な出力を提供します。
  • マルチ解像度生成機能3段階にアップグレードされたDiTアーキテクチャにより、マルチ解像度生成とトレーニングの安定性向上を実現し、これまでトレーニングされたことのない画像サイズと解像度の生成を可能にする。
  • 人間からのフィードバックに基づく強化学習(RLHF)の最適化報酬モデルとフィードバック学習アルゴリズムを開発することで、画像とテキストの配置、美観、構造の正確性、テキストレンダリングといった点で、モデルの全体的な性能を向上させます。

Seedream 2.0の技術的原理

  • データ前処理
    • データ構成事前学習データは、高品質のデータペア、分布維持データ、知識注入データ、および対象を絞った補足データの4つの部分から慎重に計画されます。
    • データクリーニングデータ品質と関連性を確保するために、多段階のフィルタリング手法が用いられます。
    • アクティブラーニングエンジントレーニングデータセットの品質を高く保つために、画像分類器を最適化する。
    • 画像注釈さまざまな説明タイプを網羅した、一般的なタイトルと専門的なタイトルを生成します。
    • テキストレンダリングデータテキストレンダリングタスクのための大規模なビジュアルテキストレンダリングデータセットを構築する。
  • モデルの事前学習
    • 拡散変換器(DiT)このシステムは、2D回転位置埋め込み(Scaling RoPE)のスケーリング版を使用して画像タグとテキストタグを処理し、未学習の解像度への汎化をサポートします。
    • テキストエンコーダー独自開発のバイリンガル大規模言語モデル(LLM)は、膨大なデータから直接ローカル知識を学習し、高精細な画像生成をサポートします。
    • 文字レベルのテキストエンコーダー: グリフ整列ByT5モデルを適用して、柔軟な文字レベルのテキストレンダリングを実現します。
  • モデルのトレーニング後
    • 継続的トレーニング(CT)高品質なデータセットを用いて学習を拡張することで、生成される画像の美的品質を向上させる。
    • 監視型微調整(SFT)少数の高品質な画像を使用してモデルを微調整し、芸術的な魅力を高めます。
    • ヒューマンフィードバックアライメント(RLHF)嗜好データ、報酬モデル、フィードバック学習アルゴリズムを組み合わせることで、複数の側面でパフォーマンスを向上させることができる。
    • プロンプト・エンジニアリング(PE)生成される画像の品質を向上させるため、微調整されたLLMを使用してユーザープロンプトを書き換えます。
    • 精製業者ベースモデルによって生成された画像を高解像度にアップスケールし、構造上のエラーを修正します。
  • 指導用画像編集の配置Seedream 2.0は、SeedEditなどの命令型画像編集モデルに対応し、高い美観と構図の忠実性を維持しながら、高品質な画像編集を実現できます。
  • パフォーマンスSeedream 2.0は、手がかり、美観、テキストレンダリング、構造の正確性において優れています。RLHF最適化を複数回実施した結果、その出力は人間の好みに非常に合致し、優れたELOスコアを獲得しました。

Seedream 2.0プロジェクトのアドレス

Seedream 2.0の使い方

  • アクセスプラットフォームの使用:斗敖の公式サイトまたは集盟の公式サイトをご利用ください。
  • 登録/ログインアカウントを使用してDoubaoプラットフォームにログインしてください。
  • 入力プロンプトワード画像生成インターフェースに、生成したい画像の内容を中国語と英語で詳細に入力してください。
  • 生成モードを選択してください適切な生成モード(通常生成、高解像度生成など)を選択してください。
  • パラメータを調整する必要に応じて、生成パラメータ(解像度、スタイルなど)を調整してください。
  • 画像を生成する「生成」ボタンをクリックし、モデルが画像を生成するまでお待ちください。
  • 画像をダウンロードまたは使用する生成された画像は直接ダウンロードすることも、さらに編集するために使用することもできます。
  • APIインターフェースを使用する
    • APIキーを取得する開発者の方は、DoubaoまたはJimengプラットフォームの開発者向けドキュメントからAPIキーを取得できます。
    • リクエストを送信HTTPリクエストを使用して、プロンプトと生成パラメータをSeedream 2.0 APIに送信します。
    • 応答を受け取るAPIは生成された画像へのリンクを返します。これらのリンクはダウンロードしたり、直接使用したりできます。

Seedream 2.0の応用事例

  • ポスターデザイン魅力的なポスターを生成し、複雑なテキストレンダリングや芸術的なスタイルをサポートし、ユーザーの入力に基づいて高品質なポスターデザインを生成できます。
  • ソーシャルメディアコンテンツソーシャルメディアプラットフォーム向けに魅力的な画像を生成し、多様なスタイルやテーマに対応することで、ユーザーが高品質なソーシャルメディアコンテンツを迅速に作成できるよう支援します。
  • 動画コンテンツ動画コンテンツのカバー画像、キーフレーム、その他の要素を生成し、様々な動画スタイルやシーンに対応し、動画コンテンツに基づいて関連画像を生成できます。
  • 絵画制作油絵、水彩画、スケッチなど、様々な画風に対応し、多様なスタイルの絵画を生成します。ユーザーが入力した指示に基づいて、高品質な絵画を生成できます。
  • 教材教材用画像を生成し、様々な教育シナリオに対応し、教育内容に基づいて関連画像を生成できる。
  • ゲームシーン生成ゲームのシーンや背景を生成し、複数のゲームスタイルに対応し、ゲームコンテンツに基づいて関連画像を生成できます。