TIP-I2V - 170万件を超える実世界のテキストおよび画像キューを含む大規模データセット。
TIP-I2Vは、画像から動画への変換に使用される、実世界のテキストと画像キューの大規模データセットです。TIP-I2Vには、170万を超える独自のユーザー生成テキストと画像キューに加え、5つの最先端(SOTA)画像から動画への変換モデルによって生成された対応する動画が含まれています。
TIP-I2Vは、画像から動画への変換に使用される、実世界のテキストと画像キューの大規模データセットです。TIP-I2Vには、170万を超える独自のユーザー生成テキストと画像キューに加え、5つの最先端(SOTA)画像から動画への変換モデルによって生成された対応する動画が含まれています。
FLUX Toolsは、Black Forest Labsが開発したモデリングツール群で、基本的なテキストから画像への変換モデルであるFLUX.1の制御性と操作性を向上させます。FLUX Toolsには、FLUX.1 Fill(画像復元と拡張)、FLUX.1 D...
SmoothCacheは、Robloxとクイーンズ大学の研究チームによって開発された、拡散トランスフォーマー(DiT)モデル向けの汎用的な推論高速化手法です。これは、隣接する拡散時間ステップにおける層の出力の類似性を分析することに基づいています。
AutoConsisは、美団の技術チームと復旦大学が共同開発したインテリジェントなUI一貫性検出ツールです。ディープラーニングと大規模言語モデルに基づいて、インターフェースから重要なデータを自動的に識別・抽出し、データの検出と認識を行います。
OmniEditは、複数のエキスパートモデルからの監視を用いて汎用モデルをトレーニングし、様々な画像編集タスクを処理する高度な画像編集技術です。異なるアスペクト比の画像や、7種類の画像編集タスクに対応できます。
In-Context LoRAは、Alibaba Tongyi Labsが開発した拡散変換器(DiT)に基づく画像生成フレームワークです。モデル固有のコンテキスト学習機能を活用し、活性化モデルの調整によるコンテキスト生成能力を最小限に抑えます。
Add-itは、NVIDIAが開発したトレーニング不要の画像編集技術で、テキスト指示に基づいて画像にオブジェクトを追加します。この技術は、拡張拡散モデルのアテンションメカニズムに基づいており、シーン画像、テキストプロンプト、および生成された画像を統合します。
DINO-Xは、IDEA Researchが開発した汎用大規模ビジョンモデルで、オープンワールドでの物体検出と理解能力を備えています。テキスト、ビジュアル、カスタムキューをサポートし、ユーザーの指示なしに画像内のあらゆる物体を認識できます。1億を超えるデータに基づいており…
『マトリックス』は、同名の映画にちなんで名付けられた、初のAIベースの世界シミュレーターです。これは、アリババ、香港大学、ウォータールー大学、カナダのAI研究機関であるベクター研究所の研究者からなる、すべて中国のチームによって開発されました。
DreamPolishは、Zhipu AI、清華大学、北京大学が共同開発したテキストから3Dを生成するモデルです。2段階のアプローチを用いて、複雑なオブジェクトの精緻な形状と高品質なテクスチャの生成を改善します。第1段階では、複数のニューラル表現を使用します...
OmniBoothは、ファーウェイ・ノアズアーク・ラボと香港科技大学の研究チームが共同開発した画像生成フレームワークです。テキストプロンプトまたは画像参照に基づいて、空間制御とインスタンスレベルのカスタマイズをサポートします。このフレームワークは、ユーザー定義のマスクと関連する...
DynaMemは、ニューヨーク大学とHello Robotが開発した動的な空間意味記憶システムで、オープンワールドでのモバイル操作に特化して設計されています。ロボットのメモリとして特徴点群を保持し、環境の動的な変化に対応します。
MVPaintは、Tencent PCG、上海AIラボ、南洋理工大学S-Lab、清華大学が共同開発した3Dテクスチャ生成フレームワークです。同期マルチビュー拡散技術に基づき、複数のビューにわたって高解像度でシームレスかつ一貫性のある3Dテクスチャ生成を実現します。
LTX Videoは、Lightricks社が開発したオープンソースのAI動画生成モデルで、5秒間の高品質動画を4秒で生成でき、動画視聴速度を凌駕します。2億個のパラメータを持つDiTアーキテクチャに基づいており、滑らかな動きとフレーム間の構造的な一貫性を保証します。
BALROGは、ゲームにおける大規模言語モデル(LLM)と視覚言語モデル(VLM)の推論能力、特に動的な環境における計画、空間推論、探索能力を評価します。これは、一連の難易度の高いゲームに基づいています。
AutoVFXは、イリノイ大学アーバナ・シャンペーン校の研究チームが開発した高度な物理エフェクトフレームワークです。自然言語コマンドに基づいて、リアルでダイナミックな視覚効果(VFX)ビデオを自動的に作成します。このフレームワークは、ニューラルシーン構築を統合しています。
Markdown-to-Imageは、Markdownテキストをポスターに変換するオープンソースのエディタです。Reactコンポーネントとして、Markdownテキストコンテンツを画像に変換し、ソーシャルメディア投稿、ポスター、その他のビジュアルコンテンツの作成に適しています。ツールは以下をサポートします...
TÜLU 3は、アレン人工知能研究所(Ai2)がリリースしたオープンソースの命令適合性モデルシリーズで、バージョン8Bと70Bがあり、将来的には405Bバージョンも予定されています。このモデルは、パフォーマンスの面でLlama 3.1命令を凌駕しています。
EchoMimicV2は、アリババ傘下のAnt Groupが立ち上げた、上半身AIデジタルヒューマンプロジェクトです。参照画像、音声編集、手のジェスチャーシーケンスに基づいて高品質のアニメーション動画を生成し、音声コンテンツと上半身の動きの一貫性を確保します。EchoMi...
サリー大学が開発した革新的なシステムであるFlipSketchは、静止画をテキストガイド付きのスケッチアニメーションに変換します。この技術は、スケッチスタイルの微調整のためのフレーム生成、入力スケッチビューを維持しながらノイズを加えること、そして…という3つの重要なイノベーションに基づいています。
StoryTellerは、ByteDance、上海交通大学、北京大学が共同開発したシステムです。音声と映像の文字認識技術に基づき、長尺動画の説明文の質と一貫性を向上させます。このシステムは、低レベルの視覚概念と高レベルの物語性を組み合わせたものです。
DELIFT(Data Efficient Language Model Instruction Fine-Tuning)は、大規模言語モデル(LLM)を最適化するために使用される新しいアルゴリズムであり、命令の微調整、タスク固有の微調整、継続的な微調整という3つの主要な段階にわたって最適化を行います。
HART(Hybrid Autoregressive Transformer)は、MITの研究チームによって開発された自己回帰型視覚生成モデルです。拡散モデルに匹敵する品質で、1024×1024ピクセルの高解像度画像を直接生成できます。
WebDreamerは、オハイオ州立大学とOrby AI研究チームによって開発されたモデルプランニングネットワークエージェントです。大規模言語モデル(LLM)、特にGPT-4oを活用し、世界規模のモデル予測ウェブサイト上でインタラクティブな結果を提供します。