Grok-2 - xAIが発表した新世代AIモデル。
Grok-2は、xAIが開発した次世代AIモデルで、優れたチャット、プログラミング、推論機能を提供します。学術ベンチマークテストにおいて、Grok-2はGPQA、MMLU、MMLU-Pro、MATHなどの分野で前モデルのGrok-1を上回る性能を発揮します。
Grok-2は、xAIが開発した次世代AIモデルで、優れたチャット、プログラミング、推論機能を提供します。学術ベンチマークテストにおいて、Grok-2はGPQA、MMLU、MMLU-Pro、MATHなどの分野で前モデルのGrok-1を上回る性能を発揮します。
MagicPoseは、南カリフォルニア大学とByteDanceが共同開発したAI動画生成モデルです。微調整なしで、人間の動きや表情をリアルに再現した動画を生成します。MagicPoseは、斬新な2段階の学習戦略を採用しています。
Agent Qは、MultiOnがスタンフォード大学と共同で開発した、自己教師ありエージェント推論および探索フレームワークです。Agent Qは、ガイド付きモンテカルロ木探索(MCTS)、AI自己批判、直接選好最適化(DPO)などの技術を統合しています。
アリババが開発したUniPortraitは、AIを活用した画像パーソナライズ編集ツールで、写真をアニメ風に変換したり、集合写真や顔交換技術をサポートしたりすることができます。UniPortraitは、高度な「ID埋め込み」および「IDルーティング」技術を利用して、
LabelUは、画像、動画、音声の注釈をサポートするオープンソースのマルチモーダルデータ注釈ツールです。境界ボックス注釈、ポリゴン注釈、句読点、線注釈、分類、説明注釈などの機能を備えており、物体検出や画像分類などのニーズに対応できます。
Buzzは、OpenAI Whisperモデルをベースにしたオフライン音声認識ツールで、Windows、macOS、Linuxシステムで利用可能です。Buzzは、マイク入力やオーディオ/ビデオファイルをリアルタイムでテキストに変換でき、複数の言語に対応しています。
HoloDreamerは、北京大学が鵬城研究所と共同開発した、AIによるテキスト駆動型3Dシーン生成フレームワークです。様式化されたパノラマ画像生成と強化された2段階パノラマ画像再構成という2つのコアモジュールを通して、テキスト記述からパノラマ画像を迅速に生成します。
HumanVidは、香港中文大学と上海人工知能研究所が共同開発した高品質データセットで、特に人物画像アニメーションの学習用に設計されています。実世界の動画と合成データを組み合わせ、綿密に設計されたルールを用いて高品質データをフィルタリングしています。
ORMBGは、開発者schirrmacher氏がGitHubで開発を開始したオープンソースのAI画像セグメンテーションツールです。ORMBGは、高度な画像処理技術を用いて前景と背景を正確に分離することで、画像から背景を正確に除去することに重点を置いています。
Cradleは、汎用コンピュータ制御(GCC)向けのマルチモーダルAIエージェントフレームワークであり、Kunlun Techが北京人工知能研究院、南洋理工大学(シンガポール)、北京大学などと共同で開発しました。
Linly-Dubbingは、AIを搭載したオープンソースの動画吹き替え・翻訳ツールで、動画コンテンツを複数の言語に自動的に翻訳し、字幕を生成します。WhisperXとFunASRを使用して正確な音声認識を実現し、Edgeベースの技術を採用しています。
VITAは、Tencent YouTu Labが開発した世界初のオープンソースのマルチモーダル大規模言語モデル(MLLM)です。動画、画像、テキスト、音声の理解と処理が可能です。Mixtral 8×7Bモデルをベースに、中国語の語彙を拡張し、…
AI Scientistは、Sakana AIが開発した初の完全自動化された科学的発見のためのAIシステムです。アイデア創出、コーディング、実験実行から論文執筆まで、研究プロセス全体を自律的に完了できます。
ControlNeXtは、香港中文大学とSenseTimeが共同開発した、制御可能な画像および動画生成のための革新的なAIフレームワークです。軽量な制御モジュールと革新的なクロス正規化技術を採用することで、計算リソースと学習時間を大幅に削減します。
FancyVideoは、360が中山大学と共同開発した、AIを活用したテキストベースのビデオモデルです。革新的なクロスフレームテキストガイダンスモジュール(CTGM)に基づき、テキストプロンプトに基づいて動的でリッチなビデオコンテンツを生成できます。
MovieDreamerは、浙江大学がアリババと共同開発した、長尺動画に特化したAI動画生成フレームワークです。自己回帰モデルと拡散レンダリング技術を組み合わせることで、複雑なストーリー展開と高い映像品質を備えた長尺動画を生成できます。
Glyph-ByT5-v2は、Microsoft Research Asia、清華大学、北京大学、リバプール大学が共同開発した多言語対応のビジュアルテキストレンダリングプロジェクトです。Glyph-ByT5-v2は、10種類の言語で正確なビジュアルテキストレンダリングをサポートしています。
Llama-3.1-Minitronは、NVIDIAとMetaが共同開発したAIモデルです。これは、Llama 3.1の8Bモデルを枝刈りと知識蒸留技術によって改良した、より小型の4Bパラメータモデルです。この最適化により、モデルのサイズと複雑さが軽減されます。
CrewAIは、複数のAIエージェント間の効率的なコラボレーション構築に特化したオープンソースプラットフォームです。AIエージェントフレームワークの利用を簡素化することで、企業はインテリジェントな自動化ソリューションを迅速に構築・展開できます。CrewAIプラットフォームの主な利点は、以下の点にあります。
HybridRAGは、BlackstoneがNVIDIAと共同開発した、検索と生成を統合したハイブリッドアーキテクチャです。機械学習アーキテクチャと検索と生成を統合したモデルを組み合わせています。このモデルは、次のような検索を行います。
DeepSeek-Prover-V1.5は、DeepSeekチームが開発したオープンソースの数理モデルで、70億個のパラメータを誇ります。このモデルは、強化学習(RLPAF)とモンテカルロ木探索(特にRMaxTSの変種)を数学的に組み合わせたものです。
SadTalkerは、西安交通大学、テンセントAIラボ、アントグループが共同で立ち上げたオープンソースのAIデジタルヒューマンプロジェクトです。SadTalkerは、単一の顔画像と音声録音から得られる3Dモーション係数を用いて、リアルな話し声のキャラクターを生成することに重点を置いています。
xGen-MMは、Salesforceが開発したオープンソースのマルチモーダルAIモデルです。テキストや画像など、複数のデータタイプを同時に理解・生成し、インターリーブされたデータを処理する能力を備えています。xGen-MMは、大量の画像データとテキストデータから学習します。
Phi-3.5は、マイクロソフトの次世代AIモデルシリーズで、軽量推論、ハイブリッドAI、AIなどを対象としたPhi-3.5-mini-instruct、Phi-3.5-MoE-instruct、Phi-3.5-vision-instructの3つのバージョンで構成されています。