VibeVoice - マイクロソフトのオープンソース音声合成モデル
VibeVoiceは、Microsoftが開発した新しいテキスト読み上げ(TTS)モデルで、ポッドキャストなどの表現力豊かで長尺の複数話者による会話音声を生成します。最新のオープンソースモデルであるVibeVoice-Realtime-0.5Bは、わずか5つのリソースしか必要としません。
VibeVoiceは、Microsoftが開発した新しいテキスト読み上げ(TTS)モデルで、ポッドキャストなどの表現力豊かで長尺の複数話者による会話音声を生成します。最新のオープンソースモデルであるVibeVoice-Realtime-0.5Bは、わずか5つのリソースしか必要としません。
EchoMimicV3は、Ant Groupが開発した、高効率でマルチモーダルかつマルチタスクなデジタルヒューマン動画生成フレームワークです。このフレームワークは13億個のパラメータを持ち、タスクミキシングとモダリティミキシングのパラダイムに基づいており、高速な処理を実現するために斬新なトレーニングおよび推論戦略を採用しています。
SpatialGenは、GroupCore Technologyが開発したオープンソースの3Dシーン生成モデルです。拡散モデルアーキテクチャに基づいており、テキスト記述、参照画像、3D空間レイアウトから時空間的に一貫性のあるマルチビュー画像を生成する機能をサポートし、さらに…
SpatialLM 1.5は、Qunhe Technologyが開発した強力な空間言語モデルです。大規模な言語モデルで学習されており、自然言語コマンドを理解し、空間構造、オブジェクト間の関係、物理パラメータを含む空間言語を出力できます。ユーザーは…
WhisperLiveKitは、リアルタイムで音声をテキストに変換し、話者認識をサポートするオープンソースのリアルタイム音声認識ツールです。このツールは、SimulStreamingやWhisperStreamingなどの高度な技術に基づいており、超低遅延を実現します。
Wan2.2-S2Vは、オープンソースのマルチモーダル動画生成モデルであり、静止画1枚と音声1つだけで、最大数分間の映画のようなデジタルヒューマン動画を生成できます。また、様々な画像形式とアスペクト比にも対応しています。
Gemini 2.5 Flash Image(コードネーム:nano banana)は、Googleが発表したAI画像生成・編集モデルです。このモデルは、異なるシーン間でもキャラクターの一貫性を維持し、自然言語による正確な画像編集をサポートします。
Youtu-agentは、Tencent YouTu Labが開発したオープンソースのインテリジェントエージェントフレームワークで、自律型インテリジェントエージェントの構築、実行、評価に使用されます。このフレームワークは、オープンソースモデルDeepSeek-V3をベースに優れた性能を実現し、様々なモデルAPIやツールをサポートしています。
MiniCPM-V 4.5は、Facewall Intelligence社が開発したエッジサイドマルチモーダルモデルで、8ビットパラメータを特徴としています。このモデルは、画像処理、ビデオ処理、OCRなど複数の分野で優れた性能を発揮し、特に高リフレッシュレートビデオの理解において画期的な成果を上げており、高リフレッシュレートビデオの処理にも対応可能です。
Waver 1.0は、ByteDanceが発表した次世代ビデオ生成モデルです。改良されたストリームトランスフォーマーアーキテクチャに基づいており、テキストからビデオへの変換(T2V)、画像からビデオへの変換(I2V)、テキストから画像への変換(T2I)をサポートし、単一の環境で使用できます。
PixVerse Technologyが独自開発したAI動画生成モデル「PixVerse V5」がグローバルで発売されました。PixVerse V5は、ダイナミックエフェクト、映像品質、一貫性の維持、指示への準拠などにおいて包括的なアップグレードを実現し、…
FramePackLoopは、FramePackをベースにした無限ループ動画生成ツールです。メイン動画とリンクされた動画を組み合わせてループ動画を作成し、背景、アイコン、その他の動画要素として使用できます。
Wenxiaobai 5は、Wenxiaobaiのフラッグシップモデルである「オールインワン」大型モデルで、国内生産の大型モデルの中で最高レベルの知能を誇ります。このモデルは、AA-Index総合評価指数で64.7点を獲得するなど、複数の評価で非常に優れた成績を収めており、STEM能力スコアも高い評価を得ています。
Grok Code Fast 1は、xAIが開発したAIプログラミングモデルで、高速かつ効率的な基本的なコーディング作業向けに設計されています。このモデルは1秒間に92個のタグを処理でき、256KBのコンテキストウィンドウを備えているため、迅速なプロトタイピングやコードのデバッグなどに適しています。
HunyuanVideo-Foleyは、TencentのHunyuanチームが開発したオープンソースのエンドツーエンドのビデオ音声生成モデルです。このモデルは、入力されたビデオとテキストの説明に基づいて、ビデオの映像に正確にマッチする高品質の音声効果を生成し、既存のAIビデオ生成の問題を解決します。
gpt-realtimeは、OpenAIが開発した最新の高度な音声モデルで、実世界のタスク向けに特別に設計されています。このモデルは、高品質で自然な音声を生成し、複数の言語や話し方に対応し、非言語的な手がかりを理解して文脈に応じて音声を調整することができます。
OmniHumanは、1.5バイトの高度なAIモデルで、単一の画像と音声トラックから表現力豊かなデジタルヒューマンアニメーションを生成できます。このモデルは、マルチモーダルな大規模言語モデルと拡散変換器を統合した、デュアルシステム認知理論に基づいています。
Meeseeksは、Meituan M17チームがオープンソース化した大規模なモデル評価スイートであり、モデルが指示に従う能力を評価するために使用されます。Meeseeksは3段階の評価フレームワークを用いて、モデルがユーザーの指示に厳密に従えるかどうかをマクロからミクロまで包括的に測定します。
MAI-Voice-1は、マイクロソフトのAIチームが開発した、表現力豊かで自然な音声生成モデルです。このモデルは、単一のGPU上で1分間の音声を1秒未満で生成できるため、現時点で最も効率的な音声システムとなっています。
Asyncはオープンソースの開発者ツールであり、経験豊富な開発者向けに、AIコーディング、タスク管理、コードレビューを組み合わせた統一されたワークフローを提供し、AI技術を通じて生産性の向上を支援します。
InternVL3.5(Shusheng·Wanxiang 3.5)は、上海人工知能研究所が開発したオープンソースのマルチモーダル大規模モデルです。このモデルは、汎用機能、推論機能、展開効率において包括的なアップグレードを受けており、10億から2410億までの9つのパラメータサイズを提供しています。
MAI-1-previewは、マイクロソフトのAIチームが開発した、エンドツーエンドで学習済みの基盤モデルであり、ユーザーが指示に従ったり、日常的な質問に答えたりする能力を提供する。
MobileCLIP2は、Appleの研究者によって開発された高性能なエッジマルチモーダルモデルであり、MobileCLIPのアップグレード版です。マルチモーダル強化学習における最適化が特徴で、DFNデータセットでの学習を通じてCLIPよりも優れたパフォーマンスを実現しています。
Step-Audio 2 miniは、Step-Audioがリリースしたオープンソースのエンドツーエンド音声モデルです。従来の音声モデル構造から脱却し、真のエンドツーエンドマルチモーダルアーキテクチャを採用することで、生の音声入力を低遅延で直接音声応答出力に変換します。