EMOVA - ファーウェイ・ノアズアークと複数の大学が共同開発した、マルチモーダルな総合処理モデル。
EMOVA(Emotionally Omni-present Voice Assistant)は、香港科技大学、香港大学、ファーウェイ・ノアズアーク・ラボなどが共同開発した、マルチモーダルで包括的なモデルです。EMOVAは画像処理、音声認識、音声認識などを行うことができます。
EMOVA(Emotionally Omni-present Voice Assistant)は、香港科技大学、香港大学、ファーウェイ・ノアズアーク・ラボなどが共同開発した、マルチモーダルで包括的なモデルです。EMOVAは画像処理、音声認識、音声認識などを行うことができます。
OminiControlは、FLUX.1などの拡散変換モデル向けに設計された、非常に汎用性が高くパラメータ効率に優れた画像生成フレームワークであり、画像生成プロセスをきめ細かく制御できます。OminiControlは、被写体主導型制御と空間制御をサポートしています。
Talker-Reasonerは、Google DeepMindが開発したAIエージェントアーキテクチャです。人間の認知理論から着想を得て、エージェントをTalkerとReasonerの2つのモジュールに分割しています。Talkerは、迅速で直感的な人間の思考(システム1)をシミュレートし、...
拡散自己蒸留(DSD)は、事前学習済みのテキストから画像への拡散モデルを使用してデータセットを自動的に生成し、テキスト条件付き画像間処理を可能にするために微調整する、革新的なゼロショットのカスタマイズ画像生成技術です。
Open Materials 2024 (OMat24) は、MetaData が公開した大規模なオープンデータセットで、無機材料の構造的および組成的多様性に焦点を当てた 1億1000 万を超える構造に対する密度汎関数理論 (DFT) 計算が含まれています。これには、事前学習済みのデータが含まれています。
CodeDPOは、北京大学とByteDanceが共同開発したコード生成・最適化フレームワークです。コードモデルの正確性と効率性を向上させます。このフレームワークは、自己生成・検証メカニズムに基づいており、コードとそのテストを同時に構築・評価します。
Voice-Proは、音声認識(STT)、音声合成(TTS)、リアルタイム翻訳、YouTube動画ダウンロード、音声分離などの機能を統合した、オープンソースの多機能音声処理ツールです。100以上の言語に対応しています。
ジェネレーティブ・オムニマットは、Google DeepMindをはじめとする複数の組織が開発した動画編集技術です。動画を透明な背景を持つ複数のRGBAレイヤーにインテリジェントに分解し、各レイヤーはオブジェクトとその関連効果(影、残像など)に対応します。
GLM-PCは、Zhipuが開発したマルチモーダル大規模モデルCogAgentをベースにしたコンピュータインテリジェンスエージェントです。人間のようにコンピュータを「観察」し「操作」することができ、文書処理、ウェブ検索、情報処理など、さまざまなコンピュータタスクを効率的に完了できるようユーザーを支援します。
TryOffDiff (VTOFF) は、拡散モデルに基づいた新しい仮想試着技術です。高忠実度な衣服再構築を用いて仮想試着を実現し、着用者の1枚の写真から標準化された衣服画像を生成することに重点を置いています。従来の仮想試着と比較して…
GLM-Edgeは、Zhipu Open Sourceが提供する、エッジデプロイメントに最適化された大規模言語対話モデルおよびマルチモーダル理解モデルのシリーズで、GLM-Edge-1.5B-Chat、GLM-Edge-4B-Chat、GLM-Edge-V-2B、GLM-Edge-V-5Bなどが含まれます。1.5...
FlagEvalMMは、北京人工知能研究院が開発したオープンソースのマルチモーダルモデル評価フレームワークです。テキスト、画像、動画など、複数のモダリティを扱うモデルを包括的に評価し、さまざまなタスクと指標をサポートしています。このフレームワークは、評価とモデルの組み合わせを採用しています。
Delta-CoMeは、清華大学NLP研究室がOpenBMBオープンソースコミュニティ、北京大学、上海財経大学と共同で提案した、新しい増分圧縮アルゴリズムです。80GBのA100 GPUは最大50個の7Bモデルを容易にロードでき、GPUメモリを節約します。
Agent-Eは、AutoGenプロキシフレームワーク上に構築されたインテリジェントな自動化システムであり、ブラウザ内での自動化操作に重点を置いています。自然言語による対話に基づいて、Agent-Eはフォームへの入力、eコマース商品の検索とランキング、ウェブページの検索などのタスクを実行できます。
Magic Copyは、Chromeブラウザ拡張機能に対応したオープンソースの画像切り抜きツールです。MetaのSegment Anything Modelテクノロジーに基づいて、画像から前景オブジェクトを自動的に識別して抽出し、ユーザーのクリップボードにコピーします。
NSFW Detector(Not Safe For Work、略してNSFW)は、不適切なコンテンツを検出するためのオープンソースツールです。NSFW Detectorは、画像、PDF、動画ファイル内の不適切なコンテンツを識別できます。このツールは、GoogleのVita-...
MultiFoleyは、Adobe Researchとミシガン大学が共同開発したサウンド生成システムです。テキスト、音声、動画のマルチモーダル制御に基づいてフォーリー効果音を生成できます。このシステムでは、テキストプロンプトや参照音声などに基づいてフォーリー効果音を生成できます。
Google DeepMind、コロンビア大学、カリフォルニア大学サンディエゴ校が共同開発したCAT4Dは、単眼ビデオから4Dシーン(動的3D)表現を生成する技術です。CAT4Dはマルチビュービデオ拡散モデルに基づいており、あらゆる視点から4Dシーン表現(動的3D)を生成することを可能にします。
Make-It-Animatableは、中国科学技術大学とテンセントPCGが開発したデータ駆動型フレームワークです。形状やポーズに関係なく、あらゆる3Dヒューマノイドモデルを1秒未満でキャラクターアニメーション用に準備できます。
Co-op Translatorは、Microsoftが提供するオープンソースの翻訳ツールで、Azure AIを使用してプロジェクト文書や画像内のテキストの多言語翻訳を自動化します。Co-op Translatorは、たった1つのコマンドでプロジェクトコンテンツを分析できます。
AnchorCrafterは、拡散モデルに基づいたインテリジェントなビデオ制作システムであり、高精細なアンカースタイルの製品プロモーションビデオを自動生成するために使用されます。人間と物体のインタラクション(HOI)とジェスチャー誘導による人間によるビデオ生成を統合しています。
MyTimeMachine(MyTM)は、20~40年にわたる約50枚の個人写真を使用して、事前に学習済みのパーソナライズされたグローバル老化モデルをトレーニングする、高度なパーソナライズされた顔年齢変換技術です。My...
HiFiVFS(High Fidelity Video Face Swapping)は、TencentとVIVOが開発した高忠実度ビデオ顔交換フレームワークです。HiFiVFSは、複数フレームの入力と時間を使用するStable Video Diffusion(SVD)フレームワークに基づいています。
MVGenMasterは、復旦大学、アリババDAMOアカデミー、および湖盤研究所が共同開発したマルチビュー拡散モデルです。多様な新規ビュー合成(NVS)タスク向けに強化された3D事前処理に基づいています。このモデルは、メトリック深度とカメラに基づいています...