Kandinsky-3 - さまざまな画像生成タスクに対応可能な、オープンソースのテキストから画像を生成するフレームワーク。
Kandinsky-3は、潜在拡散モデルに基づくテキストから画像への生成(T2I)フレームワークであり、その高品質かつリアルな画像合成で画像合成分野において際立っています。Kandinsky-3は、テキスト誘導型など、さまざまな画像生成タスクに対応できます。
Kandinsky-3は、潜在拡散モデルに基づくテキストから画像への生成(T2I)フレームワークであり、その高品質かつリアルな画像合成で画像合成分野において際立っています。Kandinsky-3は、テキスト誘導型など、さまざまな画像生成タスクに対応できます。
CAVIAは、Apple、テキサス大学オースティン校、Googleが共同開発したマルチビュービデオ生成フレームワークです。単一の入力画像を、時空間的に一貫性のある複数のビデオシーケンスに変換できます。このフレームワークは、視点統合型アテンションの導入に基づいています。
Flex3Dは、MetaのGenAIチームとオックスフォード大学の研究チームが開発した革新的な2段階3D生成フレームワークです。テキスト、単一画像、または複数の高品質な入力ビューに基づいて疎なビュー画像から、高品質な3D画像を生成できます。
EvolveDirectorは、アリババと南洋理工大学が共同で開発した革新的なフレームワークです。公開されているリソースと高レベルモデル用のAPIインターフェースを使用して、高性能なテキストから画像への生成モデルをトレーニングします。このフレームワークは、既存の高レベルモデルに基づいています。
MCP(Model Context Protocol)は、Anthropic社が開発したオープンプロトコルで、大規模言語モデル(LLM)アプリケーションと外部データソースおよびツールとのシームレスな統合を可能にします。
LazyGraphRAGは、Microsoft Researchが開発したグラフ拡張生成拡張検索(RAG)フレームワークであり、GraphRAGの改良版です。LazyGraphRAGは、GraphRAGの0.1%にデータインデックス作成コストを大幅に削減すると同時に、...
LEOPARDは、シアトルのTencent AI Labが開発したビジュアル言語モデルで、大量のテキストを含む複数画像タスクの理解と処理に特化して設計されています。LEOPARDは主に2つの技術革新に基づいています。まず、約100万個の特別に設計された要素を組み込んでいます。
上海人工知能研究所が開発したInternThinkerは、高度な知能密度を持つデータとメタアクション思考を自律的に生成できる強力な推論モデルです。長期的な思考能力と自己反省・修正メカニズムに基づき、数学、プログラミングなどにおいて優れた能力を発揮します。
Pangeaは、カーネギーメロン大学の研究チームが開発した、多言語・マルチモーダルな大規模言語モデル(LLM)です。その目的は、世界の言語と文化の多様性をより網羅的にカバーすることです。このモデルには、600万件の指示を含む多様なデータセットが含まれており、39の言語をサポートしています。
MobA(モバイルエージェント)は、上海交通大学の研究チームによって開発された革新的なモバイルインテリジェントエージェントです。マルチモーダル大規模言語モデル(MLLM)に基づいて、モバイルデバイスの自動タスク実行機能を強化します。MobAは、高レベルの2層アーキテクチャを採用しています。
FramesはRunwayの最新AI画像生成モデルであり、スタイル制御と視覚的忠実度において大幅な進歩を遂げています。Framesはスタイルの一貫性を維持し、幅広いクリエイティブな探求をサポートし、プロジェクトごとに特定のルックを確立し、そして…
SlideChatは、上海AI研究所、厦門大学、華東師範大学などの研究機関によって開発された、ギガピクセルレベルのフルスライス画像を理解できる初の視覚言語アシスタントです。SlideChatは、フルスライス画像の詳細な説明を生成できます。
Fugattoは、NVIDIAが開発した音声合成・変換モデルで、「Foundational Generative Audio Transformer Opus 1」の略です。このモデルは、テキストプロンプトに基づいて音声や動画を生成できます。
LongRAGは、清華大学、中国科学院、およびZhipuの研究チームによって開発された、長文質問応答(LCQA)のための堅牢な検索強化生成(RAG)フレームワークです。ハイブリッド検索システム、LLM強化情報抽出器、および…に基づいています。
Illustriousは、Onoma AI Researchが開発したオープンソースのテキストから画像へのアニメーション生成モデルです。バッチサイズの最適化、ドロップアウト制御、トレーニング画像の解像度、マルチレベル見出しなどの主要な手法に基づいて、高い精度を実現しています。
aisuiteは、Andrew Ng氏によって公開されたオープンソースのPythonライブラリで、複数の大規模言語モデル(LLM)サービスを呼び出すための統一インターフェースを提供するように設計されています。OpenAI、Anthropic、Azureなどのサービスをサポートしています。
XGrammarは、Tianqi Chen氏のチームによって開発されたオープンソースのソフトウェアライブラリです。大規模言語モデル(LLM)向けに、効率的で柔軟性があり、移植性の高い構造化データ生成機能を提供します。文脈自由文法(CFG)定義構造に基づいており、…をサポートしています。
Edify 3Dは、NVIDIAが提供する高度な3Dアセット生成ソリューションで、テキストプロンプトや参照画像から高品質な3Dモデルを迅速に生成できます。Edify 3Dを使えば、詳細なジオメトリや明確なトポロジーなどを備えたモデルをわずか2分で生成できます。
SongCreatorは、清華大学深圳国際大学院、香港中文大学などが共同開発したAI音楽生成モデルです。歌詞からボーカルや伴奏を含む完全な楽曲を生成することができます。
Teacher2Taskは、Googleが開発したマルチティーチャー学習フレームワークで、教師固有の入力タグを導入し、トレーニングプロセスを根本的に見直し、ヒューリスティックを手動で集約する必要性をなくしています。このフレームワークはタグの集約に依存せず、トレーニングデータを直接集約します。
DynaSaurは、Adobe Researchが開発した大規模言語モデル(LLM)エージェントフレームワークであり、定義済みのアクションセットによって制限される従来のLLMエージェントシステムの限界を打破します。このフレームワークは、生成的なアプローチに基づいてエージェントアクションを動的に作成および構成することをサポートします。
Takin AudioLLMは、Himalaya FMのEverestチームが開発した、Takin TTS、Takin VC、Takin Morphingを含む、高品質なゼロショット音声生成モデルシリーズです。これらのモデルは、最先端の大規模言語モデリング技術を活用しています。
AutoTrain(AutoTrain Advanced)は、Hugging Face社が提供するオープンソースのノーコードプラットフォームで、最先端モデルのトレーニングプロセスを簡素化します。ユーザーは、コードを記述することなく、独自のAIモデルを作成、微調整、デプロイできます。
CAMPHORは、Appleが開発した小型言語モデル(SLM)マルチエージェントフレームワークで、モバイルデバイスにおけるプライバシーと応答性の向上を目的としています。このフレームワークは、複数のユーザー入力をデバイス上でローカルに処理し、パーソナライズされたコンテキスト推論を実行することに基づいています。