PortraitGen - 中国科学技術大学が開発したAI搭載ポートレート動画編集ツール
PortraitGenは、中国科学技術大学の研究チームが開発したAI搭載のポートレート動画編集ツールです。3Dガウス拡散技術とニューラルガウステクスチャメカニズムに基づき、2Dポートレート動画を4Dガウス場に変換し、高品質な3Dポートレートを実現します。
PortraitGenは、中国科学技術大学の研究チームが開発したAI搭載のポートレート動画編集ツールです。3Dガウス拡散技術とニューラルガウステクスチャメカニズムに基づき、2Dポートレート動画を4Dガウス場に変換し、高品質な3Dポートレートを実現します。
MMMLU(Multilingual Large-Scale Multitask Language Understanding)は、OpenAIが公開したオープンソースのデータセットで、さまざまな言語的、認知的、文化的コンテキストにおける人工知能モデルのパフォーマンスを評価および改善するために設計されています。MMMLUは、以下の要素に基づいて構築されています。
Llama 3.2は、Metaの最新のオープンソースAI大規模モデルシリーズで、小型および中型のビジュアル言語モデル(11Bおよび90Bパラメータ)と軽量プレーンテキストモデル(1Bおよび3Bパラメータ)が含まれています。Llama 3.2モデルは、エッジコンピューティング向けに特別に設計されています。
MIMOは、アリババグループのインテリジェントコンピューティング研究所が開発した、制御可能なキャラクタービデオ合成のための革新的なAIフレームワークです。空間分解モデリング技術に基づき、2Dビデオを3D空間コードに変換することで、キャラクター、動作、シーンを精密に制御することを可能にします。
DoubaoのAI動画モデルは、ByteDanceが発表した2つの大規模AI動画生成モデル、PixelDanceとSeaweedです。PixelDanceはDiT構造に基づいており、複雑な指示を理解し、複数のエージェントが相互作用する一貫性のある動画クリップを生成することに優れています。
Meitu MiracleVisionは、Meitu Inc.が開発したAIビジュアルモデルで、東洋美学、肖像画、商業デザインなど、美的創造に特化しています。このモデルは、動画生成機能において包括的なアップグレードを実施しました。
SafeEarは、浙江大学と清華大学が共同開発したAI搭載の音声なりすまし検出フレームワークです。音声なりすましを検出しながらユーザーのプライバシーを保護します。ニューラルオーディオコーデックに基づく分離モデルを採用し、音声の音響情報を他の情報から分離します。
PDF2Audioは、PDF文書を音声コンテンツに変換するオープンソースツールで、ポッドキャスト、講義、要約の作成に適しています。OpenAIのGPTモデルに基づいてポッドキャストスクリプトを生成し、テキスト読み上げ技術を使用して音声に変換します。
GraphReasoningは、大量の科学論文を知識グラフに変換する人工知能ベースの手法です。構造化分析を通じて、ノード次数を計算し、コミュニティとその接続性を特定し、主要ノードの中心性を評価することで、…を明らかにします。
Comic Translateは、ogkalu2によって開発されたオープンソースの漫画翻訳ツールです。世界中の漫画を自動的に翻訳することができ、英語、韓国語、日本語、フランス語、簡体字中国語、繁体字中国語、ロシア語などに対応しています。
PearAIは、Visual Studio Code(VSCode)をベースに構築されたオープンソースのAI駆動型コードエディタです。PearAIはAI技術を統合することで、プログラミング作業の負担を軽減し、開発効率を向上させます。PearAIは開発者を直接サポートします...
EzAudioは、ジョンズ・ホプキンス大学とテンセントAIラボが共同開発したテキスト音声変換(T2A)モデルです。効率的な拡散変換器技術に基づいており、テキストプロンプトから高解像度の音声を生成します。
FLUX-Controlnet-Inpaintingは、アリババ傘下のAlimamaが開発した画像修復ツールで、ControlNetとFLUX.1-devの技術を統合しています。このツールは、ユーザーが指定したマスク領域に基づいて画像を修復します。
Ropeは、InsightFaceのinswapper_128モデルをベースに構築されたオープンソースのAI顔交換ツールで、ユーザーフレンドリーなグラフィカルインターフェースを提供します。ユーザーは画像や動画をアップロードし、数秒で顔交換操作を完了でき、優れた結果が得られます。
Westlake-Omniは、Westlake Omniが開発した、世界初のオープンソースのエンドツーエンド中国語感情ベース音声対話モデルです。このモデルは離散表現を採用し、テキストと音声の処理を統合し、迅速なユーザー応答のためのリアルタイム性能を特に重視しています。
AutoGen Studioは、Microsoft Researchが開発したオープンソースのグラフィカルインターフェースツールで、マルチエージェントシステムの構築、デバッグ、評価を簡素化するように設計されています。AutoGen Studioは、WebベースのインタラクティブインターフェースとPythonを提供します。
IDIFYは、AI技術を使用して画像を自動的に切り抜き、ユーザーが規格に準拠したID写真を迅速に作成できる、無料のオープンソースオンラインID写真生成ツールです。ユーザーは、写真をブラウザにアップロードし、サイズと背景色を選択するだけで、…
Emu3は、北京人工知能研究院(BAAI)が開発したネイティブなマルチモーダル世界モデルです。BAAIが独自開発したマルチモーダル自己回帰技術を採用し、画像、動画、テキストを共同で学習させることで、ネイティブなマルチモーダル機能を実現しています。
CCI 3.0は、北京人工知能研究院(BAAI)が公開した大規模な中国語インターネットコーパスで、1000GBのデータセットと498GBの高品質サブセットであるCCI 3.0-HQが含まれています。このバージョンは、CCI 2.0と比較してデータ規模がほぼ1倍に拡大されています。
MemFreeは、複数のAIモデルと検索エンジンを統合したオープンソースのハイブリッドAI検索エンジンで、効率的で多様な検索体験を提供します。ユーザーは、テキスト、画像、ドキュメント、Webページなどを使用して検索や質問を行うことができます。
GarDiffは、CLIPとVAEエンコーディングを使用して衣服の外観を事前に抽出し、衣服フォーカスアダプタと高周波ディテール強調アルゴリズムを組み合わせることで、高忠実度で詳細な試着画像を生成する革新的な仮想試着技術です。
NeMoは、NVIDIAが提供するエンドツーエンドのクラウドネイティブフレームワークであり、生成型AIモデルの構築、カスタマイズ、およびデプロイを可能にします。大規模言語モデル(LLM)、マルチモーダルモデル、音声認識、テキスト音声合成(TTS)などのアプリケーションをサポートしています。
Oryxは、清華大学、テンセント、南洋理工大学が共同開発したマルチモーダル大規模言語モデル(MLLM)です。視覚データの処理には、事前学習済みのOryxViTモデルと動的圧縮モジュールという2つのコアイノベーションを活用しています。OryxVi...
I2VEditは、画像から動画への拡散モデルを利用してフレーム単位での動画編集を可能にする、高度な動画編集フレームワークです。ユーザーは動画の最初のフレームを編集するだけでよく、I2VEditは編集内容を動画全体に自動的に適用します。