ディープフェイク・ディフェンダーズ - 中国科学院が開発した、ディープフェイクコンテンツを識別するためのAIモデル。
Deepfake Defendersは、中国科学院自動化研究所のVisionRushチームが開発したオープンソースのAIモデルです。Deepfake技術によって生成された偽造画像や動画を識別し、それらから防御することを目的としています。このモデルはメディアを分析し、
Deepfake Defendersは、中国科学院自動化研究所のVisionRushチームが開発したオープンソースのAIモデルです。Deepfake技術によって生成された偽造画像や動画を識別し、それらから防御することを目的としています。このモデルはメディアを分析し、
Blue Heart Big Modelは、vivoが独自開発した全く新しい汎用ビッグモデルマトリックスで、言語ビッグモデル、デバイス側ビッグモデル、音声ビッグモデル、画像ビッグモデル、マルチモーダルビッグモデルなどを含みます。複数のドメインとシナリオにおいて重要な役割を果たします。
VideoLLaMBは、メモリブリッジング層と再帰的なメモリトークンを導入することで動画データを処理し、分析中に重要な視覚情報が失われないようにする革新的な長尺動画理解フレームワークです。このモデルは、特に長尺動画の理解を目的として設計されています。
MagicManは、清華大学深圳国際大学院、テンセントAIラボ、香港科技大学、スタンフォード大学、香港中文大学の研究チームが共同で立ち上げたAIプロジェクトです。深層学習技術を用いて単一の2次元画像を分析することに重点を置いています。
DeepSeek-Coder-V2は、DeepSeekが開発したオープンソースのコード言語モデルで、コード関連のタスクにおける性能はGPT4-Turboに匹敵します。このモデルは、さらに6兆個のデータで事前学習されています。
AppFlowyは、Notionの代替として設計されたオープンソースのノート作成およびタスク管理ツールで、より高いプライバシー保護を提供します。RustとFlutterを使用して構築されており、ミニマリストの原則に準拠し、十分な柔軟性を備えています。
Fengyu Big Modelは、SF Technologyが物流業界向けに特別に設計した大規模言語モデルです。SF Technologyは、Fengyu Big Modelは小型ながら、物流分野における汎用モデルを総合的に凌駕すると述べています。Fengyu Big Modelは既に市場で入手可能です。
SAM2PointはSAM2をベースとした3Dセグメンテーション技術です。追加のトレーニングや2D-3D投影を行うことなく、任意の3Dデータに対して直接ゼロショットセグメンテーションを実行します。3Dデータをボクセル化し、多方向ビデオストリームをシミュレートすることで、SAM2に基づいた高精度なセグメンテーションを実現します。
CodeFuse-muAgentは、Ant GroupのCodeFuseチームによって開発されたマルチエージェントフレームワークです。知識グラフエンジンを使用してエージェントのオーケストレーションとコラボレーションを推進し、エージェントの標準運用手順オーケストレーションプロセスを簡素化します。統合を通じて...
VoxInstructは、清華大学が開発したオープンソースの音声合成技術です。人間の言語コマンドに基づいて、ユーザーのニーズに非常に合った音声を生成できます。このシステムは、統一された多言語コーデック言語モデリングフレームワークを採用し、従来のテキスト音声合成を変革します。
Pixtral 12Bは、フランスのAIスタートアップ企業Mistralが発表した初のマルチモーダルAIモデルで、画像とテキストを同時に処理できる。このモデルは120億個のパラメータを持ち、サイズは約24GBで、テキストモデルNemo 12Bをベースに構築されている。
MMRoleは、中国人民大学高嶺人工知能学院の研究チームが開発したマルチモーダルロールプレイングエージェント(MRPA)フレームワークです。画像とテキストを組み合わせることで、エージェントがより自然で没入感のある役割を演じることを可能にします。
RReHiFace-Sは、Silicon Intelligenceチームが立ち上げたオープンソースプロジェクトで、高精度なリアルタイム顔置換AIアルゴリズムを実装しており、ユーザーは簡単な操作で動画やライブ配信中の顔を入れ替えることができます。
NarratoAIは、動画のナレーションと編集を自動化するAI搭載ツールです。大規模言語モデル(LLM)を用いて動画コンテンツを理解し、ナレーションスクリプトを自動生成、スクリプトを音声に変換、さらに動画編集と字幕作成を同時に行います。
Skywork-Rewardは、Kunlun Wanweiが開発した高性能報酬モデルシリーズで、Skywork-Reward-Gemma-2-27BやSkywork-Reward-Llama-3.1-8Bなどが含まれます。主に大規模言語モデルの最適化と学習を支援するために使用されます。
Torch-MLUは、Cambriconが提供するオープンソースのPyTorchデバイスバックエンド拡張プラグインで、開発者はCambriconのMLUシリーズスマートアクセラレータカードをPyTorchアクセラレーションバックエンドとして使用できます。このプラグインは、ネイティブのPyTorchサポートを実装しています。
ImageBindは、Metaが開発したオープンソースのマルチモーダルAIモデルで、テキスト、音声、画像、温度、モーションデータの6種類の情報を統合された埋め込み空間に統合します。このモデルは、画像モダリティを橋渡しとして利用し、
LlamaCoderは、Llama 3.1 405Bモデルを使用してフルスタックアプリケーションを迅速に生成するオープンソースのAIツールです。Claude Artifactsの代替となることを目指しています。Sandpack、Next.jsと統合されています。
XVERSE-MoE-A36Bは、Yuanxiangが開発した中国最大のオープンソースMoE(エキスパート混合モデル)です。このモデルは、総パラメータ数2550億、活性化パラメータ数360億を誇り、1000億を超えるモデルに匹敵する性能を有しています。
PyVideoTransは、動画コンテンツをある言語から別の言語に自動的に翻訳し、対応する字幕と吹き替えを追加するオープンソースの動画翻訳・吹き替えツールです。PyVideoTransは複数の言語をサポートし、効率的な音声認識機能を備えています。
ongCiteは、長文質問応答タスクにおける大規模言語モデル(LLM)の信頼性と検証可能性を向上させることを目的として、清華大学が立ち上げたプロジェクトです。このプロジェクトでは、ユーザーがきめ細かな文レベルの引用を生成することで、モデルの性能を検証することができます。
CSGO(Content-Style Composition in Text-to-Image Generation)は、南京理工大学、小紅樹、その他の機関が共同で開発した、画像スタイル変換とテキストから画像への生成に関する研究プロジェクトです。CSGOの…
GameGen-Oは、Tencentが開発したゲーム動画生成モデルで、Transformerアーキテクチャをベースに、オープンワールド型ビデオゲームの生成に特化して設計されています。このモデルは、ゲームキャラクターやアニメーションなどの生成を含む、ゲームエンジンの様々な機能をシミュレートできます。
mPLUG-DocOwl 2は、アリババ同義研究所のmPLUGチームが開発した、複数ページ文書理解のためのマルチモーダル大規模言語モデルです。光学文字認識(OCR)技術に頼ることなく、高解像度の文書理解を実現します。