Motionshop - アリババのAIキャラクターアニメーションプロジェクト。動画のキャラクターを3Dアニメーションに置き換えることができる。
Motionshopは、アリババ知能コンピューティング研究所が開発したAIキャラクターアニメーションフレームワークです。動画内の他のシーンやキャラクターを変更することなく、動画内のキャラクターを3Dアバターに置き換えることができます。このフレームワークはビデオ処理技術を利用しています。
Motionshopは、アリババ知能コンピューティング研究所が開発したAIキャラクターアニメーションフレームワークです。動画内の他のシーンやキャラクターを変更することなく、動画内のキャラクターを3Dアバターに置き換えることができます。このフレームワークはビデオ処理技術を利用しています。
AnyTextは、アリババ知能コンピューティング研究所が開発した、拡散ベースの多言語ビジュアルテキスト生成・編集モデルです。画像内で正確かつ一貫性のあるテキストをレンダリングすることに重点を置いています。AnyTextは主に2つの要素で構成されています...
InstantIDは、拡散モデルに基づいた画像生成技術であり、ゼロショットで本人確認を保持するパーソナライズされた画像合成を実現することに重点を置いています。この技術により、ユーザーはたった1つの画像だけで済みます...
VideoCrafter2は、Tencent AI Labsが開発した動画生成モデルです。高品質な動画データの取得における制約を克服し、高品質な動画を生成できるモデルを育成することを目的としています。このモデルの核心となる考え方は…
Screenshot to Codeは、人工知能技術(GPT-4VとDALL・E 3)を用いてユーザーのスクリーンショットをフロントエンドのWebページコードに変換するオープンソースプロジェクトです。このプロジェクトの中核機能は、Webページデザインのコーディングを自動化することです。
DDColorは、アリババDAMOアカデミーの研究者によって開発されたオープンソースのAI画像カラー化フレームワークです。白黒画像をワンクリックでフルカラー画像に変換できます。この手法は、デュアルデコーダーアーキテクチャ(ピクセルデコーダーとカラーデコーダー)を利用しています。
Real-ESRGAN(Real-World Blind Super-Resolution with Pure Synthetic Data)は、テンセントの研究チームが開発した深層学習モデルで、低解像度画像を処理して高解像度画像にアップスケールするために特別に設計されています。
DemoFusionは、低コストで高解像度画像を生成するために設計された技術フレームワークです。既存のオープンソース生成AIモデル(Stable Diffusionなど)を拡張し、追加のトレーニングなしで高解像度画像を生成できるようにします。
ActAnywhereは、スタンフォード大学とAdobe Researchの研究者が共同開発した動画生成モデルです。特に、前景の被写体(人物など)を新しい背景に合成する必要がある場合など、動画の背景生成の問題を解決することを目的としています。
Vary-toyは、中国科学院大学、華中科技大学、Megviiの研究者らが提案した小型の視覚言語モデル(LVLM)です。大規模視覚言語モデル(LVLM)の学習と展開における課題を解決することを目的としています。
Lepton Searchは、アリババの元技術担当副社長でありAI科学者でもある賈陽青氏が、Lepton AIアプリケーション構築プラットフォーム上で開発したオープンソースの対話型AI検索エンジンです。このプロジェクトは、Leptonプラットフォーム上のクラウドベースの人工知能を活用することに基づいています。
Follow Your Poseは、清華大学、香港科技大学、テンセントAIラボ、中国科学院の研究者らが開発したオープンソースのテキスト動画生成フレームワークです。テキストによる説明と特定のポーズを入力することで、動画を生成できます。
IPアダプター(イメージプロンプトアダプター)は、事前学習済みのテキストから画像への拡散モデル(安定拡散など)向けに特別に設計されたアダプターで、テキストから画像へのモデルが生成できるようにすることを目的としています。
OLMo(Open Language Model)は、Allen AI(AI2、Allen Institute for AI)によって開発された、完全オープンソースの大規模言語モデル(LLM)フレームワークです。当初の設計目的は、オープンなコラボレーションを通じて学術研究を促進することでした。
DiffusionGPTは、ByteDanceと中山大学の研究者によって開発された、オープンソースの大規模モデル(LLM)駆動型テキスト画像生成システムです。多様な入力に対応できない、あるいは特定の種類のデータに限定されるといった、従来のテキスト画像生成システムの限界を克服することを目的としています。
MetaGPTは、大規模な言語モデルとマルチエージェント協調システムを組み合わせた革新的なメタプログラミングフレームワークであり、人間のワークフローをシミュレートすることで複雑な問題を解決することを目指しています。その中核となるのは、標準作業手順書(SOP)の標準化です。
Make-A-Character(略称:Mach)は、アリババグループのインテリジェントコンピューティング研究所が開発した、AIを活用した3Dデジタル人間生成フレームワークです。テキスト記述に基づいて、リアルな3Dキャラクターを迅速に作成することを目的としています。このシステムは特に…
MotionCtrlは、テンセント、香港大学、その他の研究機関の研究者によって開発された、ビデオ生成モデル向けに設計された統一的で柔軟なモーションコントローラーです。ビデオ内のカメラの動きとオブジェクトの動きの視点を独立して制御できます。
AnimateDiffは、上海人工知能研究所、香港中文大学、スタンフォード大学の研究者によって開発されたフレームワークです。パーソナライズされたテキストから画像への変換モデルをアニメーション生成器に拡張し、その中核となる機能は、以下の機能を利用できることです。
Depth Anythingは、TikTok、香港大学、浙江大学の研究者によって開発された、単眼深度推定のための深層学習モデルです。様々なシナリオの画像を処理し、深度情報を推定することを目的としています。
Metaの研究者によって開発されたV-JEPAは、特徴予測を通じて動画の視覚的表現を学習することに焦点を当てた、新しい動画自己教師あり学習手法です。この手法の核心的なアイデアは、モデルが...を予測できるようにすることです。
Boximatorは、ByteDanceの研究チームが開発したビデオ合成技術で、豊かで制御可能な動きを生成し、ビデオ合成の品質と制御性を向上させるように設計されています。この技術は、2種類の制約ボックス(ハードボックス...
DiT(拡散トランスフォーマー)は、ウィリアム・ピーブルズ(Soraの研究リーダーの一人)とニューヨーク大学の助教授である謝賽寧によって提案された新しい拡散モデルです。これは、ノイズ除去拡散確率モデル(...
VideoPoetは、Googleの研究チームが大規模モデルに基づいて開発したAI動画生成ソリューションです。テキスト、画像、または動画入力から高品質の動画コンテンツを合成し、それに合った音声を生成する機能をサポートしています。VideoPoetの中核となる機能は…