SDXL-Lightning - ByteDanceが発表したテキストから画像を生成するモデル
SDXL-Lightningは、ByteDanceの研究チームが開発した拡散モデルに基づくテキストから画像への生成技術です。従来の拡散モデルにおける画像生成速度と計算コストの限界を克服することを目的としています。このモデルは…
SDXL-Lightningは、ByteDanceの研究チームが開発した拡散モデルに基づくテキストから画像への生成技術です。従来の拡散モデルにおける画像生成速度と計算コストの限界を克服することを目的としています。このモデルは…
Stable Diffusion 3は、Stability AIが開発した高度なテキスト画像生成モデルです。Stable Diffusionシリーズの最新版であり、テキストプロンプトから高品質の画像を生成するように設計されています。
ConsiStoryは、NVIDIAとテルアビブ大学の研究者によって開発された、テキストから画像を生成するためのトレーニング不要の手法です。この手法を用いることで、元のスタイルと主題を維持しながら、さまざまなテキストスタイルに対応した画像を生成することが可能です。
ScreenAgentは、吉林大学人工知能学部の研究チームによって開発された、コンピュータ制御のインテリジェントエージェントです。このエージェントは、ビジュアル言語モデル(VLM)に基づいており、実際のコンピュータ画面と対話することができます。
YOLOv9は、中央研究院や台北科技大学などの研究機関の研究チームによって開発された次世代の高度な物体検出システムです。YOLO(You Only Look Once)アルゴリズムシリーズの最新バージョンであり、前バージョンを基盤として開発されています。
VideoPrismは、Google Researchが開発した汎用ビデオエンコーダーで、単一の固定モデルで様々なビデオ理解タスクを処理するように設計されています。このモデルは、ビデオから豊富な意味表現を抽出することができ、それによって…
GPT-SoVITSはオープンソースの音声クローンプロジェクトです。この音声合成ツールは、GPTモデルとSoVITS音声変換技術を組み合わせることで、少量のサンプルデータのみで高品質な音声クローンとテキスト音声変換を実現します。このツールは…
OpenCodeInterpreterは、大規模なモデルとコード生成、実行、反復的な改良機能を組み合わせることで、ソフトウェア開発プロセスにおけるコードの生成、テスト、最適化を支援するように設計されたオープンソースのコードインタープリタシステムです。
ChatMusicianは、音楽の理解と生成を目的としたオープンソースの大規模言語モデルであり、マルチモーダルアートプロジェクション研究コミュニティ、Skywork AI、香港科技大学の研究者によって開発されました。
EMO(Emote Portrait Alive)は、アリババグループのインテリジェントコンピューティング研究所の研究者によって開発されたフレームワークです。これは、単一の参照画像と音声入力から画像を生成できる、音声駆動型のAIポートレートビデオ生成システムです。
StarCoder 2は、BigCodeプロジェクトチームが開発した次世代の大規模コード言語モデルであり、コード生成、編集、推論タスクを強力にサポートするように設計されています。このモデルシリーズは、前世代のStarCoderモデルをベースに構築されています。
MeloTTSは、MyShell AIが開発したオープンソースの高品質な多言語テキスト音声合成(TTS)ライブラリです。テキストを自然で流暢な音声に変換し、複数の言語をサポートしています。MeloTTSは、驚異的な音声合成速度を誇ります。
Snap Videoは、Snap Inc.の研究チームが開発したAI動画生成モデルです。その目的は、テキストによる説明に基づいて動画を合成することです。ユーザーは説明文を入力することができ、モデルはそのテキストに基づいて動画を生成します。
スタンフォード大学の研究者らが提案したLayerDiffusionは、大規模な事前学習済み潜在拡散モデルを用いて透明画像を生成する技術です。単一の透明画像、あるいは複数の透明レイヤーを生成することができます。
Text-Diffuser 2は、Microsoft Research、香港科技大学、中山大学の研究者らが開発した、拡散モデルに基づく新しいテキストレンダリング手法です。テキスト生成における画像拡散モデルの限界、特に柔軟性の面での限界を克服することを目的としています。
UniEditは、浙江大学、マイクロソフトリサーチ、北京大学の研究者によって開発された革新的なビデオ編集フレームワークです。モデルの微調整を必要とせずに、ビデオの動きや外観を編集できます。
DUSt3Rは、フィンランドのアールト大学とNaver Europe Labsの研究者によって開発された3D再構成フレームワークです。カメラのキャリブレーションや視覚的特徴に関する事前知識がなくても、任意の画像セットから3Dシーンを再構成するプロセスを簡素化することを目的としています。
ScreenAIは、Googleの研究チームが開発した、読みやすい画面AIビジュアル言語モデルです。特にユーザーインターフェース(UI)やインフォグラフィックの理解と処理を目的として設計されています。このモデルは、ビジュアル処理と言語処理を組み合わせたPaLIアーキテクチャに基づいています。
ByteDanceの研究者によって開発されたResAdapterは、拡散モデル(安定拡散など)向けに設計された解像度アダプタであり、これらの画像生成モデルが任意の解像度とアスペクト比で画像を生成できるようにするものです。
AtomoVideoは、アリババの研究チームが提案した高忠実度画像-動画変換(I2V)フレームワークです。入力された静止画像から高品質の動画コンテンツを生成することを目的としています。このフレームワークは、元の画像を保持しながら、生成された動画の品質を維持します。
Moondreamは、無料のオープンソースAIビジュアル言語モデルです。パラメータ数は少ないものの、高性能な画像処理機能を備えており、ローカルコンピュータ、モバイルデバイス、さらにはRaspberry Piでも動作します。
PixArt-Σは、ファーウェイ・ノアズアーク研究所、大連理工大学、香港大学の研究者によって開発されたテキストベースのグラフモデルです。拡散変換アーキテクチャ(DiT)に基づいており、プロンプトからテキストを抽出するために特別に設計されています。
ELLA(Efficient Large Language Model Adapter)は、テンセントの研究者によって開発された新しい手法であり、複雑なテキストを処理する際のテキストから画像への生成モデルのパフォーマンスを向上させるように設計されています。
Transformer Debugger (TDB) は、OpenAI の Superalignment チームによって開発されたツールで、研究者や開発者が Transformer モデルの内部動作をより深く理解し、分析するのに役立ちます。