InstructMove ― 東京大学とAdobeが共同で、指導型画像編集モデルを発表。
InstructMoveは、東京大学とAdobeが共同開発した、指示に基づく画像編集モデルです。動画のフレームごとの変化を観察することで、指示に基づいた画像操作の実行方法を学習します。このモデルは、マルチモーダルな大規模言語モデルに基づいています。
InstructMoveは、東京大学とAdobeが共同開発した、指示に基づく画像編集モデルです。動画のフレームごとの変化を観察することで、指示に基づいた画像操作の実行方法を学習します。このモデルは、マルチモーダルな大規模言語モデルに基づいています。
LatentSyncは、ByteDanceと北京交通大学が共同開発したエンドツーエンドのリップシンクフレームワークです。音声条件の潜在拡散モデルに基づいており、中間的な3D表現や2D特徴点を必要としません。LatentSyncは安定差分法を使用しています。
PsycoLLMは、合肥工業大学コンピュータ科学情報工学部が開発した大規模な中国語心理言語モデルです。高品質の心理学データセットで学習されており、メンタルヘルスの問題の理解と評価を向上させます。このモデルのデータは…
Casevo(認知エージェントおよび社会進化シミュレーター)は、中国伝媒大学のデータサイエンス・インテリジェントメディアコミュニケーション学部とメディア融合・コミュニケーション国家重点実験室が共同で開発した製品です。
No More Tuning (NMT) は、カリフォルニア大学バークレー校とアリババグループが共同開発したマルチタスク学習フレームワークです。マルチタスク学習における様々なタスクの優先順位付けという課題に取り組みます。NMT は、マルチタスク学習問題を制約ベースの学習問題に変換します。
MiniPerplxは、Grok 2.0モデルを用いたオープンソースのAI検索エンジンです。MiniPerplxは、ウェブページ、Twitterの投稿、研究論文、YouTube動画などを検索するための無料の代替手段を提供します。
AddressCLIPは、CLIP技術に基づいて構築されたエンドツーエンドの画像位置情報モデルであり、中国科学院自動化研究所とアリババクラウドが共同開発しました。このモデルは、1枚の写真からストリートレベルの精度で位置情報を特定し、画像キャプチャの位置を直接予測することができます。
TradingAgentsは、UCLAとMITが開発したマルチエージェントLLM金融取引フレームワークであり、現実世界のトレーディング会社環境をシミュレートします。TradingAgentsは、異なる役割を持つ複数のエージェントを統合し、...
CreatiLayoutは、復旦大学とByteDanceが共同で提案した革新的なレイアウト・トゥ・イメージ(L2I)技術です。270万枚の画像を含む大規模レイアウトデータセットLayoutSAMを活用しています。
RealisHumanは、生成された画像内の手や顔などの人体部位を精緻化する革新的な後処理フレームワークです。このフレームワークは、2段階のアプローチでこれを実現します。まず、元の変形した領域を基準として使用し、より精緻化されたバージョンを生成します。
CosmosはNVIDIAのジェネレーティブワールドモデリングプラットフォームであり、特に自動運転やロボット工学分野における物理AIシステムの開発を加速させます。Cosmosはテキスト、画像、動画からのプロンプトを受け入れることができます。
UCloud Computingは、UCloud傘下のGPUコンピューティングパワーレンタルプラットフォームであり、AIアプリケーション向けに効率的かつ柔軟なコンピューティングリソースを提供することに重点を置いています。さまざまなプロジェクトのニーズに対応するため、オンデマンドレンタルをサポートしています。このプラットフォームは、豊富な画像コミュニティを誇り、複数の画像を提供しています。
KAG(Knowledge Augmented Generation)は、Ant Groupが開発したドメイン特化型の知識サービスフレームワークです。知識拡張に基づき、特定のドメインにおける大規模言語モデル(LLM)の質問応答性能を向上させ、垂直分野向けの知識サービスを提供します。
Gemini Coderは、GoogleのGemini API、Next.js、およびTailwind CSSをベースにしたツールで、アプリコードを迅速に生成するために使用されます。Gemini Coderはシンプルな記述に基づいており、リアルタイムでSandpackと組み合わせて使用します。
AIOpsLabは、クラウドサービス運用管理のためのAIOpsエージェントの構築、評価、改善を目的として、マイクロソフト、カリフォルニア大学バークレー校、イリノイ大学アーバナ・シャンペーン校、マイクロソフトリサーチ、およびその他の機関によって開発されたプロトタイプフレームワークです。AIOpsLabは…
浙江大学とアリババDAMOアカデミーが共同開発したVideoReferは、動画内の物体認識と推論のために特別に設計されています。拡張ビデオ大規模言語モデル(Video LLM)の時空間理解能力に基づいて、このモデルは…
JoyCaptionは、拡散モデルのトレーニングに使用されるオープンソースの画像キャプション生成ツールです。JoyCaptionは、幅広い画像スタイル、コンテンツ、民族、性別、および向きに対応し、フィルタリングを最小限に抑えて世界のさまざまな側面を理解しますが、...
MajicFlusは、MajicFlusがFlux.1アーキテクチャに基づいて開発したAIモデルです。高品質なポートレート画像の生成に特化しており、特にアジア人女性の繊細さと美しさを捉えることに優れています。このモデルは、複数の技術を統合して、まるで生きているかのような人物像を生成します。
CHRONOSは、上海交通大学コンピュータ科学工学部、アリババグループの同義研究所、およびその他の機関が共同開発した、ニュースタイムライン要約を生成するための新しいフレームワークです。反復的な質疑応答アプローチに基づいており、大規模なデータを使用します。
香港科技大学、アントグループ、スタンフォード大学、香港中文大学が開発したEdichoは、拡散モデルに基づいた画像編集手法であり、複数の画像にわたって一貫した編集を可能にします。Edichoはトレーニング不要のアプローチを採用しており、...
Mobile-Agentは、ネットワーク上のノード間を移動してユーザーや他のエージェントに代わって動作できる、モバイルでインテリジェントなエージェントソフトウェアです。状況に応じて、現在の実行を中断し、別のデバイスで再開することができます。
VideoRAGは、長尺動画の理解を支援する検索拡張型生成技術です。動画から視覚的に整列した補助テキストを抽出することで、大規模動画言語モデル(LVLM)が視覚的に整列した補助テキストをより良く理解し、生成するのに役立ちます。
SPRIGHT(SPatially RIGHT)は、空間関係に焦点を当てた大規模な視覚言語データセットであり、アリゾナ州立大学、インテルラボ、Hugging Face、ワシントン大学、その他の機関が共同で開発しました。これは、空間関係の問題を解決できます。
LIGERは、Meta AIなどの機関が開発したハイブリッド検索モデルで、生成型検索と密な検索の利点を組み合わせています。LIGERは、生成型検索モジュールを使用して候補アイテムの有限セットを生成し、次に密な検索を使用してランク付けと...