Pix2Gif - 静止画像をアニメーションGIFに変換するための、マイクロソフトの拡散モデル。
Pix2Gifは、Microsoft Researchの研究者によって提案されたモーション誘導拡散モデルで、静止画像を動的なGIFアニメーション/ビデオに変換するために特別に設計されています。このモデルは、画像...
Pix2Gifは、Microsoft Researchの研究者によって提案されたモーション誘導拡散モデルで、静止画像を動的なGIFアニメーション/ビデオに変換するために特別に設計されています。このモデルは、画像...
Follow-Your-Clickは、テンセント(滬源チーム)、清華大学、香港科技大学の研究者らが共同開発した画像から動画への変換(I2V)モデルです。このモデルは、…
AutoDevは、Microsoftの研究者によって開発されたAIプログラミングおよびアプリケーション開発のためのインテリジェントエージェントフレームワークです。コード作成、デバッグ、テスト、バージョン管理などの複雑なソフトウェアエンジニアリングタスクを自律的に計画および実行するために特別に設計されています。
Grok-1は、イーロン・マスクが設立したAIスタートアップ企業xAIが開発した大規模言語モデルです。3140億個のパラメータを持つハイブリッドエキスパート(MoE)モデルであり、パラメータ数において最大のオープンソース言語モデルとなっています。
Open-Soraは、Colossal-AIチームが開発したオープンソースのビデオ生成モデルで、OpenAIのSoraビデオ生成製品を再現するように設計されています。Open-SoraもDiTアーキテクチャに基づいており、大規模画像事前学習、大規模画像...の3段階でトレーニングが行われます。
VLOGGER AIは、Googleの研究チームが開発したマルチモーダル拡散モデルで、単一の入力画像と音声サンプルから、リアルで一貫性のある人間の動きの動画を生成するように特別に設計されています。このモデルの主な機能は、人工知能を活用することです...
Stable Video 3D (SV3D) は、Stability AI が開発した高度な 3D テクノロジーで、1 枚の画像から高品質な新しいパースペクティブ ビューと 3D メッシュを生成できます。このモデルは、以前にリリースされた Stable Video をベースにしています。
ByteDanceの研究者によって最近発表された高品質ビデオ生成モデル「AnimateDiff-Lightning」は、プログレッシブ敵対的拡散蒸留技術を利用して高速ビデオ生成を実現します。このモデルは、既存のビデオ生成における課題に対処することを目的としています。
StreamMultiDiffusionは、拡散モデルの高品質な画像合成機能と領域制御の柔軟性を組み合わせた、リアルタイムのインタラクティブな画像生成フレームワークです。ユーザーが指定した領域のテキストプロンプトに基づいて、リアルタイムでインタラクティブな画像を生成できます。
Moraは、Microsoftとリーハイ大学の研究者によって開発されたマルチエージェント(AIエージェント)フレームワークで、一般的なビデオ生成タスク向けに特別に設計されています。その目標は、OpenAIのSoraビデオ生成モデルをシミュレートし、拡張することです。このフレームワークは…
LATTE3Dは、NVIDIAの研究者によって開発されたテキストから3Dオブジェクトを生成するモデルです。テキストプロンプトから高品質の3Dコンテンツを高速に生成できます(わずか400ミリ秒)。この技術の中核は、「...」と呼ばれる手法にあります。
BrushNetは、Tencent PCGのARC Labsと香港大学の研究者によって開発された、拡散モデルに基づくプラグアンドプレイ型の画像修復モデルです。分解型デュアルブランチアーキテクチャを効果的に活用しています。
SUPIRは、大規模生成モデルStableDiffusion-XL(SDXL)とモデル拡張技術を活用した画期的な画像修復・強調手法です。深層学習とマルチモーダル手法により、高品質な画像復元を実現します。
StreamingT2Vは、PicsArt AI研究チームが開発したテキストから動画を生成するモデルです。既存のモデルは、1秒あたり16フレームまたは24フレームの高品質な短い動画しか生成できず、より長い動画を生成する際に画質の問題が発生するなど、既存のモデルの限界を克服することを目的としています。
VoiceCraftは、テキサス大学オースティン校の研究チームが開発したオープンソースのニューラルコーデック言語モデルで、ゼロショット音声編集とテキスト音声合成(TTS)タスクに特化しています。このモデルはTransformerアーキテクチャを採用しています。
Champは、アリババ、復旦大学、南京大学の研究者らが提案した、人間の画像をビデオアニメーションに変換する3Dベースのモデルです。この手法は、3Dパラメトリックモデル(特にSMPLモデル)と潜在的...
AI21 Labsが開発したJambaは、Mambaアーキテクチャに基づいた初の商用レベルの大規模言語モデルです。現在、ほとんどの大規模言語モデル(GPT、Gemini、Llamaなど)はTransformerアーキテクチャに基づいています。しかし、Jambaは…
Voice Engineは、OpenAIが開発した最新のAI搭載音声合成・音声クローン技術です。15秒程度の短い音声サンプルとテキスト入力から、ほぼ自然な音声を生成できます。この技術は2022年から提供されています。
SWE-agentは、プリンストン大学の自然言語処理グループの研究者によって開発されたオープンソースのAIプログラマーおよびソフトウェアエンジニアシステムです。大規模言語モデル(GPT-4など)の機能を活用し、GitHubリポジトリ内の問題を自動的に解決します。
DreaMovingは、アリババグループの研究チームが開発した、拡散モデルに基づく人間動画生成フレームワークです。DreaMovingは、動画制御ネットワークとコンテンツガイドを通して、人間の動きと外見を精密に制御します。
AniPortraitは、アリババが以前リリースしたEMOと同様の、写真の口パク動画生成のためのオープンソースAIフレームワークです。音声と参照用のポートレート画像から、高品質なアニメーションを生成できます。
InstantStyleは、XiaohongshuのInstantXチームが開発した、スタイルが一貫したパーソナライズされたテキストから画像を生成するオープンソースのフレームワークです。テキストから画像を生成する際の重要な課題、つまり、スタイルの一貫性を維持しながら、どのように画像を生成するかという問題を解決することを目的としています。
DesignEditは、Microsoft Research Asiaと北京大学の研究チームが共同開発したAI画像編集フレームワークです。デザイン分野のレイヤー概念を取り入れ、多層ポテンシャル分解・融合技術を用いて、追加レイヤーなしで処理を実現します。
CodeGemmaは、Googleがリリースした大規模な言語モデルで、コード生成と理解に重点を置いています。このシリーズには、20億の事前学習済みモデル、70億の事前学習済みモデル、および70億の命令ファインチューニングモデルという3つの異なる規模のモデルが含まれており、コード生成と理解の精度向上を目指して設計されています。