BEN2(Background Erase Network 2)は、Prama LLCが開発した深層学習モデルで、画像や動画から背景を素早く除去し、前景を抽出するために特別に設計されています。革新的な信頼度誘導型マッティング(CGM)パイプラインに基づいています。
BEN2(Background Erase Network 2)は、Prama LLCが開発した深層学習モデルで、画像や動画から背景を素早く除去し、前景を抽出するために特別に設計されています。革新的な信頼度誘導型マッティング(CGM)パイプラインに基づいています。
PartEditは、KAUSTが開発した、事前学習済みの拡散モデルに基づくきめ細かな画像編集手法です。PartEditは特定のテキストマーカー(「パーツマーカー」と呼ばれる)を最適化することで、拡散モデルが画像内のオブジェクトのさまざまな部分を正確に特定し、編集できるようにします。
Agentic Object Detectionは、Andrew Ng氏のチームが開発した革新的な物体検出技術です。インテリジェントエージェントシステムによってラベル付きデータなしで物体検出を実現します。ユーザーはテキストプロンプトを入力するだけで、AIが推論を実行します。
Agnoは、インテリジェントエージェントを構築するための軽量フレームワークです。Agnoは、マルチモーダル(テキスト、画像、音声、動画)およびマルチエージェントコラボレーションをサポートし、LangGraphよりも最大5000倍高速なエージェント作成を可能にし、さらに...
Olaは、清華大学、テンセント渾源研究チーム、シンガポール国立大学S-Labが共同開発したマルチモーダル言語モデルです。段階的なモダリティ整合戦略により、画像やテキストから始まり、言語モデルがサポートするモダリティを徐々に拡張しています。
AlphaGeometry2は、Google DeepMindが開発した高度な人工知能システムで、国際数学オリンピック(IMO)の幾何学問題を解くために特別に設計されています。ニューラルシンボリック手法とGoogleのGeminiシステムを組み合わせたものです。
EliGenは、浙江大学とアリババグループが共同開発した、エンティティレベルで制御可能な新しい画像生成フレームワークです。領域アテンションメカニズムを導入することで、追加のパラメータなしで、任意の形状のエンティティキューと空間マスクをシームレスに統合できます。
Hibikiは、Kyutai Labsが開発した同時音声翻訳用のオープンソースデコーダーモデルで、ある言語の音声を別の言語の音声またはテキストにリアルタイムで翻訳できます。Hibikiはマルチストリーム言語モデルアーキテクチャに基づいており、ソース言語を同時に処理します...
HMA(Heterogeneous Masked Autoregression)は、MIT、Meta、イリノイ大学アーバナ・シャンペーン校が開発した、ロボットの動きの動画のダイナミクスをモデル化するためのオープンソース手法です。HMAは異種事前学習に基づいており、...
DeepRant(中国語名:鲸喷)は、ゲーマー向けに特別に設計された多言語翻訳ツールです。DeepRantは、国際サーバー上でプレイヤーがテキストで素早くコミュニケーションを取り、言語の壁を取り除くのに役立ちます。プレイヤーは…
StochSync(確率的拡散同期)は、360°パノラマや3D表面テクスチャなどの複雑な空間で高品質な画像を生成するために特別に設計された革新的な画像生成技術です。拡散同期と…
Sonicは、Tencentと浙江大学が共同開発した音声駆動型ポートレートアニメーションフレームワークです。グローバルな音声知覚に基づいて、リアルな表情と動きを生成します。Sonicは、コンテキスト強化型音声学習とモーション分離コントローラを利用して音声を抽出します。
FireRedASRは、Xiaohongshuが開発したオープンソースの産業グレード自動音声認識(ASR)モデルファミリーです。中国語(北京語)、中国語方言、英語に対応し、中国語ASRベンチマークテストで新たな最先端(SOTA)レベルを達成したほか、歌詞認識においても優れた性能を発揮します。
MVoT(Multimodal Visualization-of-Thought)は、マイクロソフトリサーチ、ケンブリッジ大学言語技術研究所、中国科学院自動化研究所が共同開発した、斬新なマルチモーダル推論パラダイムです。生成画像可視化に基づいています。
DynVFXは、シンプルなテキストコマンドに基づいて、動的なコンテンツを現実世界の動画にシームレスに統合する革新的な動画強化技術です。事前学習済みのテキスト・トゥ・ビデオ拡散モデルとビジュアル言語モデル(VLM)を組み合わせることで、動的なコンテンツを現実世界の動画にシームレスに統合することを実現します。
Xiaohongshuと上海交通大学が開発したWorldSenseは、実世界のシナリオにおける視覚、聴覚、テキスト入力のマルチモーダル大規模言語モデル(MLLM)の総合的な理解能力を評価するために使用されるベンチマークテストです。WorldSenseは…
Kiln AIは、大規模言語モデル(LLM)の微調整、合成データの生成、データセットの共同作業を簡素化するオープンソースのAI開発ツールです。Kiln AIは、Windows、macOS、Linuxに対応した直感的なデスクトップアプリケーションを提供しています。
Airweaveは、あらゆるアプリケーション(API、データベース、Webサイトなど)のデータをグラフデータベースやベクトルデータベースに同期できるオープンソースツールです。これにより、インテリジェントエージェントや検索メカニズムに基づいたデータ取得が可能になります。Airweaveは…
MotionCanvasは、香港中文大学、Adobe Research、モナッシュ大学が共同開発した画像から動画への変換(I2V)手法です。静止画像を、豊かな動的効果を持つ動画に変換できます。MotionCanvasは…
MedRAX(胸部X線検査用医療推論エージェント)は、胸部X線検査専用に設計された医療推論AIエージェントです。最先端の胸部X線分析ツールとマルチモーダルな大規模言語モデルを統合し、...
LangBotは、複数のプラットフォーム(QQ、WeChat、Lark、Discordなど)とさまざまな大規模言語モデル(ChatGPT、DeepSeek、Geminiなど)をサポートするオープンソースのインスタントチャットボットプラットフォームです。LangBotはマルチモーダルな機能を備えています。
LLMDetは、アリババグループの同義研究室、中山大学コンピュータ科学工学部、彭城研究室など複数の機関によって開発されたオープンソースの語彙的物体検出器です。大規模言語モデル(LLM)との共同学習に基づいて物体検出精度を向上させています。
VisoMasterは、強力でありながら使いやすいAIベースの顔交換・編集ソフトウェアです。画像、動画、ライブストリームの顔交換に対応し、エンターテインメント、映画制作、その他の分野でのアプリケーション向けに自然でリアルな効果を生み出します。
FlashVideoは、ByteDanceチームが提案した高効率・高解像度ビデオ生成フレームワークです。高解像度ビデオ生成における従来の単段拡散モデルが抱える計算コストの大きな問題を、2段階のアプローチで解決します。最初の段階では…