project
Qwen-Image - アリババの同義千文氏がオープンソース化した、テキストベースのグラフモデル。
Qwen-Imageは、アリババ同義千文チームが開発したオープンソースの20パラメータMMDiTモデルです。同義千文シリーズ初の基本的な画像生成モデルであり、複雑なテキストレンダリングと精密な画像編集に優れ、複数行のテキストにも対応しています。
Qwen-Imageとは何ですか?
Qwen-Imageは、アリババ傘下のTongyi Qianwenチームが開発した、20パラメータのオープンソースMMDitモデルです。Tongyi Qianwenシリーズ初の基盤となる画像生成モデルであり、複雑なテキストレンダリングと高精度な画像編集に優れています。複数行レイアウト、段落レベルのテキスト生成、きめ細かなディテールレンダリングに対応し、中国語と英語の両方で高精細な出力を実現します。Qwen-Imageは、多様な芸術スタイルと高度な編集操作に対応し、一般的な画像生成・編集タスクにおいて強力な能力を発揮します。Qwen Chatの画像生成機能を通じて、このモデルの性能を体験できます。
Qwen-Imageの主な機能
- 複雑なテキストレンダリング複数行および段落テキストの生成をサポートし、小さなテキストも鮮明に表示でき、中国語と英語のテキストレンダリングに優れています。
- 精密な画像編集スタイルの転送、オブジェクトの追加、削除、変更、ディテールの強調、テキスト編集、キャラクターのポーズ調整をサポートしつつ、画像の自然さとリアリティを維持します。
- 一般的な画像生成複数のアートスタイルに対応しており、ユーザーの説明に基づいて創造的な画像を生成できます。
Qwen-Imageの技術原理
- モデルアーキテクチャ高度なマルチモーダル大規模言語モデル(MLLM)をテキスト特徴抽出モジュールとして採用することで、テキストの意味を正確に理解し、画像生成に必要な特徴に変換することができます。変分オートエンコーダー(VAE)は、入力画像をコンパクトな潜在表現にエンコードする役割を担い、推論フェーズでデコードすることで、効率的な画像処理と画像生成を実現します。モデルの中核となるのはマルチモーダル拡散トランスフォーマー(MMDiT)で、ノイズを段階的に除去することで画像を生成し、テキスト特徴に基づいて生成される画像がテキスト記述と高い整合性を保つように制御します。
- データ処理大規模なデータ収集とアノテーションを通じて、自然データ、デザインデータ、人物データ、合成データなど、幅広いデータを含む豊富なデータセットが構築されます。多段階のデータフィルタリングプロセスに基づき、低品質または不適切なデータが段階的に除去され、高品質で多様なデータが確保されます。
- トレーニング戦略トレーニング中は、フローマッチングを事前トレーニング目標として用い、常微分方程式(ODE)を用いて、最尤推定目標との等価性を維持しながら、安定したトレーニングダイナミクスを実現します。このモデルは、テキストから画像への変換(T2I)、画像から画像への変換(I2I)、およびテキストから画像への変換(TI2I)というマルチタスクトレーニングパラダイムを組み合わせ、共有潜在空間に基づくマルチタスク学習を実現します。
Qwen-Imageのパフォーマンス
- 総合的なパフォーマンス:
- 複数のベンチマークテストでトップの成績を収めるQwen-Imageは、複数の公開ベンチマークテストで12の最先端(SOTA)スコアを達成し、画像生成および編集分野における高い競争力を実証しました。
- ヘッドモデルを超えて一般的な画像生成テスト(GenEval、DPG、OneIG-Benchなど)および画像編集テスト(GEdit、ImgEdit、GSOなど)において、Qwen-ImageはFlux.1やBAGELといったオープンソースモデルを凌駕し、ByteDanceのSeedDream 3.0やOpenAIのGPT Image 1(High)といったクローズドソースモデルをも上回ります。Qwen-Imageは、生成品質と編集機能の両面で高いレベルを達成しています。
- テキストレンダリング機能:
- テキストレンダリングのベンチマークLongText-Bench、ChineseWord、TextCraftなどのベンチマークテストにおいて、Qwen-Imageは非常に優れた性能を発揮し、特に中国語テキストのレンダリングにおいて、SeedDream 3.0やGPT Image 1(High)といった既存の最先端モデルを大幅に上回る性能を示しています。
- 中国語テキストレンダリングの利点Qwen-Imageは、中国語テキストのレンダリング処理において独自の強みを持っています。言語理解、フォント生成、組版における最適化された技術により、中国語の複雑さと多様性により良く対応できます。
Qwen-Imageの使い方
- QwenChatにアクセスしてくださいQwen Chatの公式ウェブサイトをご覧ください。
- 画像生成機能を選択してくださいQwenChatのインターフェースで、「画像生成」機能を探して選択します。
- テキストプロンプトを入力してください生成したい画像の説明をテキスト入力ボックスに入力してください。
- 画像を生成する「生成」ボタンをクリックすると、Qwen-Imageがテキストプロンプトに基づいて画像を生成します。
- 生成された画像を表示およびダウンロードする生成された画像はインターフェース上に表示され、ユーザーはその効果を確認したり、ダウンロードしてローカルに保存したりすることができる。
Qwen-Imageのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/QwenLM/Qwen-Image
- ハギングフェイスモデルライブラリ:https://huggingface.co/Qwen/Qwen-Image
- 技術論文:https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen-Image/Qwen_Image.pdf
- オンラインでデモを体験してください:https://huggingface.co/spaces/Qwen/Qwen-Image
Qwen-Imageの応用シナリオ
- コンテンツ作成テキストの説明に基づいて高品質の画像、ポスター、PPTページを迅速に生成できるため、クリエイティブデザインやプレゼンテーション制作の効率と視覚効果を大幅に向上させることができます。
- 美術とデザインこのモデルは、スタイルの転用や創造的な絵画制作を容易に実現でき、アーティストやデザイナーに豊富なインスピレーションを提供し、作品制作プロセスを加速させる。
- 教育と学習教材や語学学習に関連する画像を生成することで、教師はより鮮やかに知識を伝えることができ、学習者はより深く理解し記憶することができる。
- ビジネスとマーケティングこれにより、ビジネス分野において魅力的な広告画像やブランドプロモーション素材を迅速に作成することが可能になり、広告の魅力とブランドの市場における影響力を効果的に高めることができます。
- エンターテインメントとゲームゲームにおけるキャラクター、シーン、小道具の画像生成、および映画やテレビ番組制作における特殊効果やコンセプトアートの生成に使用され、エンターテインメントコンテンツの制作サイクルを加速させる。