project
Uni-1.1 - Luma AIによる新世代画像生成モデル
Uni-1.1は、Luma AIが発表した新世代の画像生成モデルおよびAPIサービスです。デコーダーのみの自己回帰型Transformerアーキテクチャを採用し、テキスト推論とピクセル生成を統合した単一のプロセスを実現しています。
Uni-1.1とは何ですか?
Uni-1.1は、Luma AIが提供する次世代画像生成モデルおよびAPIサービスです。デコーダーのみの自己回帰型Transformerアーキテクチャを採用し、テキスト推論とピクセル生成を統合したプロセスを実現しています。最大9枚の参照画像の同時入力、文レベルの画像編集、複雑なレイアウト生成、多言語テキストレンダリングに対応し、Arena.aiのブラインドテストランキングで世界第3位を獲得しています。APIは従量課金制と予約型スループットモデルの両方を提供し、画像1枚あたり最低約0.04ドルのコストで、広告、eコマース、コンテンツ制作といった企業レベルのシナリオに対応します。
Uni-1.1の主な機能
-
トゥー・ウェンシェンテキストプロンプトに基づいて高品質な画像を生成し、ヘッダー、ナビゲーション、広告、本文など、10種類以上のレイアウト要素を含む複雑なレイアウトを単一の出力として出力できます。
-
画像編集文レベルの指示に基づいた複数回の編集を可能にし、デフォルトで言及されていない要素を保持し、文書編集のような反復的な視覚編集を実現します。
-
複数参照グラフの融合1回の呼び出しで最大9枚の参照画像を入力としてサポートし、ブランドロゴ、製品、実在の人物、キャラクターをモデルレベルの厳密な制約として使用して、意味レベルの融合を行います。
-
宇宙空間と姿勢制御回転、視点切り替え、空間関係の調整を精密に制御できるため、被写体の個性や質感が失われることはありません。
-
多言語表示中国語やアラビア語などの非ラテン文字を用いた高品質なテキスト生成をサポートし、グローバルなコンテンツ制作のニーズに対応します。
Uni-1.1の技術原理
-
統一自己回帰アーキテクチャこれはデコーダー専用の自己回帰型トランスフォーマーを採用しており、テキストトークンと画像トークンが同じシーケンスを共有することで、クロスモーダルな共同推論を可能にしている。
-
推論と生成の統合このモデルは、ピクセルを生成する前に、複数のモーダル間の推論を実行します。構図、空間、ブランドの一貫性といった制約は、まず変換してから描画するのではなく、構造レベルで解決されます。
-
2エンドポイントAPI設計推論エンドポイント(分解手順、構成の計画、ブランド/役割/製品制約のロック)と生成エンドポイント(推論結果に基づくピクセルレンダリングの完了)を提供します。
-
参照グラフのハード制約メカニズム複数の参照画像は、モデルレベルで厳密な制約として渡され、すべてのチャネルとバージョンで視覚的なアイデンティティの一貫性が維持されるようにします。
Uni-1.1の使い方
-
アカウントを登録するLuma AI開発者プラットフォームのウェブサイト(https://platform.lumalabs.ai)にアクセスして登録およびログインしてください。
-
キーを取得する開発者バックエンドでプロジェクトを作成し、APIキーを取得してください。
-
課金モードを選択してください使用状況に応じて、ビルドプラン(従量課金制、柔軟なスケジュール設定に適している)またはスケールプラン(処理能力が確保され、最低注文数が8台、大規模生産に適している)のいずれかを選択してください。
-
推論エンドポイントを呼び出すモデルが要件を分解し、レイアウトを計画し、ブランド/役割の制約を確定できるように、テキストによる指示と参照図を送信してください。
-
生成エンドポイントを呼び出す推論結果に基づいてピクセルレンダリングを実行し、最終的な生成画像を取得します。
-
統合SDK公式のPython、JavaScript、TypeScript、Go、またはCLI SDKを使用して、APIを既存のワークフローに統合してください。
-
参考画像をアップロードしてくださいリクエストに最大9枚の参照画像をハード制約として渡すことで、出力がブランドのビジュアルアイデンティティと一致することを保証します。
-
反復編集生成された結果に対して、文レベルの編集コマンドを使用して複数の調整を行い、満足のいく効果が得られるまで段階的に最適化してください。
Uni-1.1の主要情報と使用要件
-
製品名:Luma Uni-1.1 / Uni-1.1-Max
-
出版社Luma AI(中核研究チームは15名未満)
-
リリース時間2026年5月6日
-
製品ポジショニングエンタープライズグレードのAI画像生成モデルとAPIサービス
-
技術アーキテクチャデコーダー専用の自己回帰型トランスフォーマー(推論と生成を統合)
-
ランキングArena.aiは世界ランキングで3位にランクインしています(OpenAIのgpt-image-2とGoogleのnano-banana-2に次ぐ)。
-
価格帯建築計画の生画像:$0.0404~$0.1000(2048ピクセル);拡大縮小計画の月額料金:$2,100~$3,800/ユニット。
-
エンタープライズクライアントアディダス、マツダ、ピュブリシスグループ、サービスプラン、エンバト、コンフィ、クレアなど
-
SDKサポート:Python、JavaScript、TypeScript、Go、CLI
-
コアチーム宋嘉明(DDIM著者)、ウィリアム・シェン(CVPR最優秀論文)
Uni-1.1の主な利点
-
世界で3番目に優れた品質Arena.aiのユーザーによるブラインドELOレーティングテストでは、OpenAIのgpt-image-2とGoogleのnano-banana-2に次ぐ世界第3位にランクインした。
-
究極のコスト効率2K解像度の画像1枚あたりの最低価格は0.0404ドルで、価格と遅延時間はいずれも同カテゴリーの最上位モデルの半分以下となっている。
-
企業レベルの一貫性参照図からの厳密な制約と文レベルの編集を用いることで、従来のモデル文字の変形、ブランドカラーのずれ、市場間でのスタイルの不一致といった問題点を解決します。
-
複雑なタスクを一度に完了する複数のモジュールを組み合わせる必要なく、完全で読みやすいニュースウェブサイトのページと、広告キャンペーンに必要な資料一式を一度に生成できます。
Uni-1.1と類似の競合製品との比較
| 比較対象寸法 | Luma Uni-1.1 / Uni-1.1-Max | OpenAI GPT-image-2 | Google Nano Banana 2 |
|---|---|---|---|
| Arena.aiランキング | 3位(ELOレーティング 1193) | 第1位(ELOレーティング 1398) | 第2位(ELOレーティング 1268) |
| 出版社 | Luma AI(15人からなる中国チーム) | OpenAI | |
| コアアーキテクチャ | デコーダーのみの自己回帰型トランスフォーマー。推論と生成を統合。 | 具体的なアーキテクチャは明らかにされていない(拡散モデルとマルチモーダル動作を組み合わせたものと推測されている)。 | 具体的なアーキテクチャは明らかにされていない(ジェミニシリーズのマルチモーダルであると推測されている)。 |
| 推論と生成の統合 | テキストトークンと画像トークンは同じシーケンスを共有し、推論が生成に先行する。 | 従来のパイプラインでは、理解と生成が分離されている。 | 従来のパイプラインでは、理解と生成が分離されている。 |
| 複数参照グラフの融合 | 一度に最大9枚の参照画像を入力できるため、意味レベルでの融合が可能になります。 | 参照画像はサポートされていますが、融合精度には限界があります。 | 参照図はサポートされていますが、制約機能は制限されています。 |
| 文レベルの編集 | 文章に合わせて画像を編集し、デフォルトでは文章に記載されていない要素は保持します。 | 編集機能は備えているが、一貫性管理機能は弱い。 | 編集機能はサポートしているが、複数回の編集を繰り返すとクラッシュしやすい。 |
| 複雑なレイアウト生成 | 一度に完全なニュースウェブサイトや広告ページを生成でき、テキストも読みやすい。 | 長文や複雑なレイアウトは、エラーが発生しやすい。 | 複雑なレイアウトでは、複数のモジュールを接続する必要がある。 |
| 2K解像度の画像1枚あたりの価格 | 0.0404ドルから(競合他社の半額以下) | 比較的高い(非公開、推定0.08ドル以上) | 比較的高い(非公開、推定0.08ドル以上) |
| 企業レベルのブランドの一貫性 | 参照画像はモデルレベルの厳密な制約として機能し、バージョン間で視覚的な同一性を維持する。 | キャラクターやブランドの色は変わりやすく、ガチャを繰り返し引く必要がある。 | スタイルの一貫性管理は概ね良好である。 |
| 多言語テキストレンダリング | 中国語やアラビア語などの非ラテン文字をサポートします。 | 英語は堪能だが、中国語には時折間違いが見られる。 | 優れた多言語サポート |
| レイテンシー性能 | 低遅延(競合他社の半分以下) | 中くらい | 中くらい |
| 主な利点 | 高いコストパフォーマンス、企業間での一貫性、複雑なタスクを単一の操作で完了できること、そして明確な投資対効果。 | 最高品質で、見た目にも美しく、環境的に成熟した製品を生み出す。 | Googleエコシステムとの統合、安定した出力、そして優れた多言語サポート。 |
| 主な欠点 | チーム規模は小さく、エコシステムはまだ構築中です。 | 高価格、企業としての一貫性の欠如、そして編集管理の不備。 | 高価格、複雑なレイアウト、編集の柔軟性の制限 |
| 典型的な法人顧客 | アディダス、マツダ、ピュブリシスグループ、サービスプラン | 大企業とクリエイティブエージェンシー | Google Cloudの顧客と広告主 |
| 適用可能なシナリオ | 地域密着型広告、大量eコマース生成、IPの一貫性、ブランドパイプライン | 高度な創造性、芸術的探求、プロトタイプデザイン | Googleエコシステム内で制作された多言語コンテンツ |
Uni-1.1の応用シナリオ
-
広告のローカライズメインビジュアルは多言語版や多地域版に迅速に展開でき、ブランド要素は参照画像によって確定できるため、制作サイクルを大幅に短縮できます。
-
Eコマース商品の視覚化このシステムは、製品写真、生地サンプル、シーン参照に基づいて、リアルタイムで一貫性のある製品画像を生成し、従来の撮影とテンプレート適用というプロセスを置き換えます。
-
キャラクターと知的財産の一貫性ゲームのプロモーション素材、コミック、映画のプリプロダクションにおいて、キャラクターデザイン、ポーズ、ライティングの一貫性をシーン間で確保します。
-
ブランドコンテンツパイプラインエンタープライズコンテンツ制作システムと統合することで、市場を問わず、ビジュアル素材の一括生成とスタイルの一貫性を実現します。
-
クリエイティブプロトタイピング手描きのスケッチと素材の参考資料を組み合わせることで、リアルな製品コンセプト画像や3Dの衣服レンダリングを素早く作成できます。