WonderPlay - スタンフォード大学とユタ大学が共同開発した、動的な3Dシーン生成フレームワーク
WonderPlayは、スタンフォード大学とユタ大学が開発した新しいフレームワークで、単一画像とユーザー定義のアクションから動的な3Dシーンを生成することを可能にします。物理シミュレーションとビデオ生成技術を組み合わせ、物理ソルバーを使用して粗粒度の動きをシミュレートします。
WonderPlayは、スタンフォード大学とユタ大学が開発した新しいフレームワークで、単一画像とユーザー定義のアクションから動的な3Dシーンを生成することを可能にします。物理シミュレーションとビデオ生成技術を組み合わせ、物理ソルバーを使用して粗粒度の動きをシミュレートします。
HunyuanVideo-Avatarは、テンセントのHunyuanチームとテンセントミュージックのTianqin Labが共同開発した音声ベースのデジタルヒューマンモデルです。マルチモーダル拡散Transformerアーキテクチャに基づいており、動的で感情を制御可能な、多役の対話動画を生成できます。
Jodiは、中国科学院計算技術研究所と中国科学院大学が開発した拡散モデルフレームワークです。画像ドメインと複数のラベルドメインの共同モデリングに基づき、視覚生成と理解を統合します。
HunyuanPortraitは、TencentのHunyuanチームが清華大学、中山大学、香港科技大学と共同で開発した拡散ベースのフレームワークです。高度に制御可能でリアルなポートレートアニメーションを生成するために使用されます。
Ming-Lite-Omniは、Ant Groupがオープンソース化した統合型マルチモーダル大規模モデルです。MoEアーキテクチャに基づき、テキスト、画像、音声、動画など複数のモダリティにわたる知覚機能を統合し、強力な理解力と生成能力を備えています。このモデルは、複数の環境で優れた性能を発揮します。
OnitはMac向けに設計されたAIチャットアシスタントで、あらゆるアプリケーションにドッキングできます。Onitはハイライトされたテキストの自動読み込みに対応しており、ユーザーはテキストを選択するだけで、Onitが自動的にそれをコンテキストとして開くため、コピー&ペーストの手間が省けます。
AI-Media2Docは、オープンソースの音声・動画からドキュメントへの変換ツールです。AI大規模モデル技術に基づき、音声・動画コンテンツを小紅書ノート、WeChat公式アカウント記事、知識ノート、マインドマップ、動画字幕など、さまざまなドキュメント形式にインテリジェントに変換します。
DeepSeek-R1-0528は、DeepSeekチームがリリースした最新のAIモデルです。このモデルはDeepSeek-V3-0324をベースに学習されており、660バイトのパラメータを持っています。HuggingFace上でオープンソースとして公開されているため、開発者は自由に利用・変更できます。
CoGenAV - 同義大学と深圳科技大学が共同開発したマルチモーダル音声表現モデル
OmniConsistencyは、シンガポール国立大学が開発した画像スタイル変換モデルで、複雑なシーンにおける様式化された画像の整合性の問題に対処します。このモデルは、2段階の学習プロセスを用いて、大規模なペアになった様式化データで学習されます。
Keling 2.1は、Kuaishouが開発したAI動画生成モデルで、Keling AI動画プラットフォームで利用可能になりました。プラットフォームのアップデートには、Keling 2.1とKeling 2.1 Master Editionという2つの基本モデルが含まれています。このモデルは、速度、品質、価格において大幅な改善が施されています。
Paper2Posterは、カナダのウォータールー大学やシンガポール国立大学などの機関によって開発された革新的な学術フレームワークです。マルチモーダル自動化技術を用いて科学論文からポスターを生成します。Paper2Posterは、セルフサービス型のPosterAgentを導入しています。
Chatterboxは、Resemble AIが開発したオープンソースのテキスト音声合成(TTS)モデルです。0.5B規模のLLaMAアーキテクチャをベースとし、厳選された50万時間以上の音声データで学習されており、一部のクローズドソースシステムに匹敵、あるいは凌駕する性能を実現しています。Chatterboxは…
MagicTryOnは、浙江大学コンピュータ科学技術学部とvivoモバイルコミュニケーションズなどが共同開発した、ビデオ拡散トランスフォーマーをベースとしたビデオ仮想試着フレームワークです。このフレームワークは、従来のU-Netアーキテクチャをより表現力豊かなものに置き換えています。
SearchAgent-Xは、南開大学とイリノイ大学アーバナ・シャンペーン校(UIUC)の研究者によって開発された効率的な推論フレームワークであり、大規模言語モデル(LLM)に基づく検索エージェントの効率を向上させることができます。
WebAgentは、アリババが開発したオープンソースの自律型検索AIエージェントであり、エンドツーエンドの自律的な情報検索と多段階推論機能を備えています。WebAgentは、人間のようにオンライン環境を能動的に認識し、意思決定を行い、行動することができ、その応用分野には学術研究などが含まれます。
EVI 3は、Hume AIが開発した最新の音声・言語モデルです。このモデルは、テキストタグと音声タグを同時に処理できるため、自然で表現力豊かな音声対話が可能です。高度なパーソナライゼーションに対応し、ユーザーの指示に基づいてあらゆる音声を生成します。
Mobvoi MCP Serverは、Mobvoiが提供する、さまざまなAI機能を統合したワンストップツールです。Mobvoi MCP Serverは、音声生成、音声クローン、画像駆動型デジタルヒューマン、ビデオ吹き替えなど、複数のマルチモーダルAI機能を統合しています。
OmniSyncは、中国人民大学、快手科技、清華大学が共同開発した汎用リップシンクフレームワークです。拡散トランスフォーマーを使用して、動画内の唇の動きと音声の正確な同期を実現します。OmniSyncは…
FLUX.1 Kontextは、Black Forest Labsが開発した画像生成・編集モデルで、コンテキスト認識型画像処理をサポートしています。このモデルは、テキストや画像情報に基づいて画像を生成・編集し、オブジェクトの変更、スタイルの調整などに対応しています。
SignGemmaは、Google DeepMindが開発した、世界で最も強力な手話翻訳AIモデルです。視覚データとテキストデータを組み合わせたマルチモーダルな学習方法を採用し、アメリカ手話(ASL)を英語のテキストに翻訳することに特化しています。
DGM(ダーウィン・ゲーデル・マシン)は、自身のコードを反復的に修正することで性能を向上させる自己改善型人工知能システムです。DGMは、保持しているコード化されたエージェントのアーカイブからエージェントを選択し、基本モデルに基づいて新しいバージョンを生成します。
Anthropic社が開発したオープンソースツールであるCircuit Tracerは、大規模言語モデルの内部構造を研究するために使用されます。Circuit Tracerは、生成属性グラフに基づいてモデルの生成特性を明らかにします。
Congrong Big Modelは、CloudWalk Technologyが開発したマルチモーダルAIモデルです。このモデルは、国際的に権威のある評価プラットフォームであるOpenCompassのマルチモーダルベンチマークリストで80.7点を獲得し、GoogleやOpenAIといったトップチームを凌駕するスコアで首位に立ちました。