360Zhinao2-7B - 360は、自社開発の360スマートブレイン大型モデルのアップグレード版を発表しました。
360Zhinao2-7Bは、360が独自開発したAI大型モデルである360 Zhinao 7Bのアップグレード版で、基本モデルと様々なコンテキスト長を持つチャットモデルを包含しています。360Zhinao2-7Bモデルは、360Zhinao1-7Bに続く大幅なアップデートであり、…
360Zhinao2-7Bは、360が独自開発したAI大型モデルである360 Zhinao 7Bのアップグレード版で、基本モデルと様々なコンテキスト長を持つチャットモデルを包含しています。360Zhinao2-7Bモデルは、360Zhinao1-7Bに続く大幅なアップデートであり、…
GeneMANは、上海AI研究所、北京大学、南洋理工大学、上海交通大学が共同開発した3D人体生成フレームワークです。1枚の画像から高精細な3D人体モデルを作成できます。このフレームワークは、パラメトリック人体モデルに依存していません。
MagicDriveDiTは、香港中文大学、香港科技大学、ファーウェイクラウド、ファーウェイノアズアークラボが共同開発したDiTアーキテクチャに基づく新しいビデオ生成手法です。自動運転アプリケーション向けに特別に設計されており、高解像度かつ長時間の映像を実現します。
EfficientTAMは、Meta AIが開発した軽量なビデオオブジェクトセグメンテーションおよびトラッキングモデルで、モバイルデバイスに展開した際のSAM 2モデルの高い計算複雑性に対処します。これは、シンプルで非階層的なVision Transformerに基づいています。
Amazon Novaは、Amazon Web Services(AWS)が提供する次世代AI基盤モデル群であり、業界最高水準のパフォーマンスとコスト効率を実現します。このファミリーには、テキスト処理に特化したAmazon Nova Microと、マルチモーダルアプリケーション向けのAmazon Novaが含まれます。
HunyuanVideoは、Tencentが開発したオープンソースの動画生成モデルで、130億ものパラメータを誇り、現在利用可能なオープンソース動画モデルの中でも最もパラメータ数の多いものの1つです。HunyuanVideoは、堅牢な物理シミュレーション、高いテキスト意味忠実度、動きの一貫性などを特徴としています。
Lobe Vidolは、誰もが簡単に自分だけのバーチャルアイドルを作成し、交流できるオープンソースのデジタルヒューマン作成プラットフォームです。Lobe Vidolは、スムーズな対話体験、背景設定、モーションポーズのライブラリ、洗練されたユーザーインターフェースなど、様々な機能を提供します。
GPT Academicは、学術研究と論文執筆のために特別に設計された、機能豊富なオープンソースプロジェクトです。ワンクリックでの論文翻訳、ソースコード解析、インターネット情報検索、LaTeX校正など、様々な機能を統合しています。
Vannaは、大規模言語モデル(LLM)に基づいてデータベース用の正確なSQLクエリを生成するのに役立つ、オープンソースのPython RAG(Retrieval-Augmented Generation)フレームワークです。Vannaはシンプルな2段階のプロセスを使用します...
PersonaCraftは、韓国のソウル大学が開発した、パーソナライズされた全身画像合成技術です。拡散モデルと3D人体モデリングを組み合わせることで、1枚の参照画像から複数の人物のリアルでパーソナライズされた全身画像を生成できます。PersonaCraftは…
StableAnimatorは、復旦大学、マイクロソフトリサーチアジア、Huya、カーネギーメロン大学が共同開発した、エンドツーエンドの高品質なアイデンティティ保持型動画配信フレームワークです。StableAnimatorは、参照画像に基づいて動画を生成し、...
I2V-01-Liveは、Conch AIが開発した画像から動画への変換モデルで、静止した2D画像を動的な動画に変換できます。ディープラーニング技術に基づき、動きの滑らかさと鮮やかさを向上させ、人や物の動きをより自然に表現します。
Genie 2は、DeepMindが開発した次世代の大規模ベースワールドモデルで、1枚の画像から最大1分間のインタラクティブな3Dゲームワールドを生成できます。Genie 2は、オブジェクト間の相互作用、キャラクターのアニメーション、物理効果など、複雑なダイナミクスをシミュレートできます。
Luma Photonは、Luma AIが開発した次世代画像生成モデルであり、革新的なアーキテクチャにより超高画質と低コスト効率を実現します。Luma Photonは、パーソナライズされたクリエイティブな画像生成をサポートし、自然言語を理解できます。
TeleAIビデオ生成モデルは、中国電信AI研究所が開発したビデオ生成モデルです。2段階の生成フレームワークに基づいており、まずテキスト記述に基づいてストーリーボードのスケッチを作成し、次にこれらのスケッチに基づいてビデオを生成します。TeleAIビデオ生成モデル…
TPDM(Time Prediction Diffusion Model)は、西湖大学MAPLE Lab、南方科技大学、北京大学、および西湖大学先端技術研究所が共同開発した画像生成モデルです。自動的に...
ConsisIDは、北京大学や鵬城実験室などが開発したテキストからビデオへの変換(IPT2V)生成モデルです。周波数分解技術に基づいて、ビデオ内の個人の識別情報の一貫性を維持します。このモデルは、チューニング不要(チューニングフリー)のアプローチを採用しています。
Perplexideezは、ユーザーがWeb上やセルフホスト型アプリケーションで情報を素早く検索できるネイティブAIアシスタントです。PerplexideezプロジェクトはPostgresデータベースをベースとし、OllamまたはOpenAI互換のエンドポイントをサポートし、SearchXNGを使用しています。
GenCastは、DeepMindが開発した革新的なAI天気予報モデルで、拡散モデリング技術に基づき、最大15日先までの世界的な天気予報を提供します。GenCastは、予測タスクの97.2%において、世界有数の中期天気予報システムを凌駕する性能を発揮します。
FullStack Benchは、ByteDanceのDoubao Big ModelチームとM-A-Pコミュニティが共同で立ち上げた新しいコード評価ベンチマークで、フルスタックプログラミングと多言語プログラミングスキルを評価することに重点を置いています。FullStack Benchは、11種類以上の実際のプログラミング言語を網羅しています。
モーションプロンプティングは、Google DeepMind、ミシガン大学、ブラウン大学が共同開発した動画生成技術です。モーション軌跡に基づいて動画コンテンツの生成を制御・誘導します。
Fish Speech 1.5は、Fish Audioが提供するテキスト音声合成(TTS)モデルで、Transformer、VITS、VQVAE、GPTなどの深層学習技術に基づいています。Fish Speech 1.5は、英語、日本語、韓国語、…をサポートしています。
ClearerVoice-Studioは、アリババDAMOアカデミーのTongyi Labが開発したオープンソースの音声処理フレームワークで、音声強調、音声分離、音声/動画話者抽出などの機能を統合しています。このフレームワークは、複雑なドメインの深層学習アルゴリズムに基づいており、効果的に...
PaliGemma 2は、Google DeepMindがGemma 2言語モデルファミリーに基づいて開発した新世代のビジュアル言語モデル(VLM)であり、PaliGemmaモデルのアップグレード版として位置づけられています。SigLIP-So400mビジュアルエンコーダーと様々な…