project
Qwen-Image-Bench - Tongyi Qianwen氏が発表した、テキストベースの画像モデルを評価するためのベンチマーク。
Qwen-Image-Benchは、同義千文チームが開発した、テキストベースの画像モデルを評価するためのデータセットです。1,000個のテストサンプルが含まれており、中国語と英語の両方のプロンプトを提供し、さまざまなテキストベースの画像モデルの生成性能を多次元的に評価できます。APIを利用しています...
Qwen-Image-Benchとは何ですか?
Qwen-Image-Benchは、同義千文チームによって開発された、テキストベースの画像モデルを評価するためのデータセットです。サイズは[不明]です。 1kテストサンプル中国語と英語の二言語プロンプトを提供し、さまざまなテキストから画像へのモデルの生成効果の多次元評価をサポートし、... Apache 2.0はオープンソースライセンスです。これは、テキストレンダリング、画像編集、一般的な画像生成といったコア機能を網羅した、画像生成モデルのための標準化された再現可能な評価フレームワークを提供し、開発者や研究者が異なるモデルの実際のパフォーマンスを客観的に比較するのに役立ちます。
Qwen-Image-Benchの主な機能
-
バイリンガル評価(中国語と英語)テストサンプルには中国語と英語の両方のプロンプトが含まれており、モデルの多言語画像生成能力を包括的に評価することができます。
-
多次元能力評価テキストレンダリング、画像編集、一般的な生成、意味的一貫性といった側面から、テキストから画像への変換モデルを包括的に評価することをサポートします。
-
標準化されたテストプロセス異なるモデル間での公平な比較を保証するために、統一された評価スクリプトとデータ形式を提供します。
-
オープンソースデータセットさまざまな複雑なシナリオと細かなタスクを網羅した、綿密に設計された1,000のテストケース。
-
自動採点サポートGenEval、DPG、GEditなどの複数のベンチマーク指標を組み合わせることで、自動評価をサポートします。
Qwen-Image-Benchの使い方
-
リポジトリをローカルマシンにクローンするGitHubリポジトリにアクセスする
QwenLM/Qwen-Image-Bench、使用git cloneプロジェクトコードをローカル環境にダウンロードしてください。 -
依存関係をインストールします倉庫によると
requirements.txtまたは、ドキュメントを参照して、Pythonの依存関係(PyTorch、ディフューザー、トランスフォーマー、および画像生成と評価に必要なその他のツールなど)をインストールしてください。 -
評価対象モデルを準備するテスト対象のテキストグラフモデルを設定します。ローカルでのモデル重みの読み込み(Qwen-Image、FLUX、Stable Diffusionなど)をサポートするか、APIを介してリモートモデルサービスにアクセスできるようにします。
-
評価データセットを読み込むQwen-Image-Benchが提供する1,000個のバイリンガル(中国語と英語)テストサンプルを評価プロセスにロードしました。このデータセットには、一般的な画像生成、テキストレンダリング、画像編集など、さまざまな側面に関するプロンプトが含まれています。
-
バッチイメージ生成を実行する推論スクリプトを実行します。モデルは、データセット内のテキストプロンプトに基づいて、対応する画像を1枚ずつ生成します。評価の一貫性を確保するため、出力解像度(例:1024×1024)と推論パラメータを統一することをお勧めします。
-
自動評価スクリプトを実行するリポジトリに組み込まれている評価ツールは、テキストレンダリングの精度、意味の一貫性、画像品質、編集の忠実度といった側面から、生成された結果を自動的に採点するために使用されます。
-
評価結果を出力して比較する構造化された評価レポートを作成し、さまざまな側面におけるモデルのスコアを表示し、他のモデルとの水平的な比較分析をサポートします。
-
カスタム拡張評価(オプション)実際のニーズに応じてカスタムテストケースを追加したり、評価指標の重みを調整したりすることで、特定のビジネスシナリオの評価要件に適応させることができます。
Qwen-Image-Benchの主な利点
-
中国の状況に特化: 中国語テキストの翻訳と文化的要素の理解の評価を強化することに特に重点を置き、既存のベンチマークにおける中国語の網羅性の不足という欠点を解消します。
-
包括的な評価の次元これは、一般的な画像生成、精密な画像編集、複雑なテキストレンダリングなど、幅広いタスクを網羅しており、単一の機能に限定されるものではありません。
-
サイズは中程度で、繁殖も容易です。1,000個のサンプルを使用することで、再現性の閾値と計算コストを削減しつつ、評価の代表性を確保することができる。
-
良好な環境適合性Qwen-ImageやQwen-Image-Editなどのモデルとネイティブに互換性があり、サードパーティ製のテキストベースの画像モデルを評価するためにも使用できます。
-
オープンソースライセンスに対応Apache 2.0ライセンスは、商用利用と無償での二次開発を許可しています。
Qwen-Image-Benchプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/QwenLM/Qwen-Image-Bench
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/Qwen/Qwen-Image-Bench
- arXiv技術論文:https://arxiv.org/pdf/2605.28091
Qwen-Image-Benchの類似製品との比較
| 比較対象寸法 | Qwen-Image-Bench | GenEval | DPG-Bench |
|---|---|---|---|
| 発行機関 | 同義前文チーム (アリババ) | MetaFAIR、ワシントン大学、UCLAなど | 学術界(Hu et al., 2024) |
| データセットのサイズ | 1,000個の試験サンプル | 553個のテンプレート化されたプロンプト | 1,065件の密集したプロンプト |
| ヒントと機能 | 中国語と英語のバイリンガルで、複数の業務に対応可能 | 短いヒント、テンプレート生成の組み合わせ | 長い指示、段落レベルの緻密な場面描写 |
| 評価項目 | 一般的な生成、テキストレンダリング、画像編集、意味的一貫性など。 | 単一オブジェクト、デュアルオブジェクト、カウント、色、位置、色属性バインディング | 属性、エンティティ、グローバルシーン、関係性、その他(カウント/テキスト表示) |
| 評価方法 | 自動化スクリプトを用いた多次元スコアリング | エンドツーエンドのターゲット検出モデルの検証 | VQAモデル(BLIP-2)の質問応答検証 |
| 言語サポート | 中国語と英語のバイリンガル | 英語を主要言語とする | 英語を主要言語とする |
| 中国が標的にしている | (中国語のテキスト翻訳と文化シーンの描写に特化) | 弱い | 弱い |
| オープンソースライセンス | Apache-2.0 | オープンソース | オープンソース |
Qwen-Image-Benchの応用シナリオ
-
モデルリリース前の標準化された評価テキストベースの画像モデルが正式にリリースまたはオープンソース化される前に、Qwen-Image-Bench 上の 1,000 件のバイリンガル (中国語と英語) テストケースを使用して、一般的な生成、テキストレンダリング、画像編集などの側面でモデルの生成品質と安定性を体系的に検証し、モデルがリリース基準を満たしていることを確認します。
-
複数機種の水平方向の能力比較本研究では、Qwen-Image、FLUX、GPT Image 1、SeedDream、Stable Diffusionなど、さまざまなテキスト画像変換モデルの全体的な性能を横断的に比較します。さまざまな側面からの評価スコアは、各モデルの長所と短所を明確に示し、技術選択に役立ちます。
-
中国人世代能力テスト主な目的は、中国語のポスター、プレゼンテーション資料、電子商取引の画像、文化的な場面などのアプリケーションにおけるモデルのテキストレンダリング効果を検証し、中国語の意味、レイアウト、文化的要素に対するモデルの理解力と視覚表現能力を評価することである。
-
画像編集能力評価このテストモデルは、スタイル転送、部分的な変更、テキスト置換、オブジェクトの追加/削除といった画像編集タスクにおいて優れた性能を発揮し、編集前後の意味的一貫性と視覚的忠実度を測定します。
-
学術研究のベンチマーク引用論文におけるモデル評価のための権威あるベンチマークデータセットとして、研究結果の信頼性と再現性を高め、画像生成分野における基礎研究の発表を支援する。