DeepSeek-V2.5-1210 - モデルの微調整を行い、オンライン検索をサポートするDeepSeek V2.5の最終バージョン。
DeepSeek-V2.5-1210は、DeepSeekがリリースしたDeepSeek V2シリーズの最終AIモデルであり、DeepSeek V2.5の最終ファインチューニングモデルです。このモデルは、トレーニング後の反復処理に基づいており、数学、プログラミング、文章作成、ロールプレイングなどの分野でテストされています。
DeepSeek-V2.5-1210は、DeepSeekがリリースしたDeepSeek V2シリーズの最終AIモデルであり、DeepSeek V2.5の最終ファインチューニングモデルです。このモデルは、トレーニング後の反復処理に基づいており、数学、プログラミング、文章作成、ロールプレイングなどの分野でテストされています。
EXAONE 3.5は、LG AI研究所が公開したオープンソースのAIモデルで、24億、78億、320億のパラメータを持つ3つのバージョンがあります。EXAONE 3.5は長文処理に優れており、ベンチマークテスト、特に実用的なアプリケーションや長文処理において優れた性能を発揮します。
DrivingDojoは、中国科学院自動化研究所がMeituanの自動運転車チームと共同で開発したデータセットです。自動運転のための複雑なインタラクティブワールドモデルのトレーニングと研究に使用されます。このデータセットには、幅広いトピックを網羅した18,000本のビデオクリップが含まれています。
FineWeb 2は、Hugging Faceが提供する1000以上の言語を網羅した多言語事前学習済みデータセットです。FineWeb 2は、言語認識、重複排除、コンテンツフィルタリング、個人情報匿名化などを含むカスタマイズされたデータパイプラインに基づいており、以下のような用途に適しています。
Gemini 2.0は、ネイティブなマルチモーダル入出力に対応したGoogleの最新AIモデルです。Gemini 2.0 Flashは、マルチモーダル入出力とエージェント技術を中心とした2.0ファミリーの最初のモデルで、1.5 Proの2倍の速度を実現しています。
Shusheng·Wanxiang InternVL 2.5は、上海AIラボのOpenGVLabチームが開発した、オープンソースの大規模マルチモーダル言語モデル(MLLM)シリーズです。このモデルシリーズは、特にInternVL 2.0を大幅に強化しており、...
ChatTTSPlusはChatTTSの拡張版であり、TensorRTアクセラレーション、音声クローニング、モバイルモデル展開などの高度な技術を活用して、音声合成のパフォーマンスと柔軟性を向上させています。Windowsプラットフォームでは、3倍以上のパフォーマンスを実現しています。
MMAudioは、マルチモーダルな共同学習に基づく高度なビデオ音声合成技術であり、幅広いオーディオビジュアルデータセットとオーディオテキストデータセットでモデルを学習させることができます。この技術の中核となるのは同期モジュールであり、生成される音声フレームとビデオフレームが高度に同期していることを保証します。
Ultravoxは、テキストと人間の音声を、別途の自動音声認識(ASR)段階に頼ることなく直接理解できる、斬新なマルチモーダル大規模言語モデル(LLM)です。マルチモーダルプロジェクター技術を利用して、音声データを高解像度の音声に変換します。
Project Marinerは、Google DeepMindが開発したブラウザアシスタントです。Gemini 2.0テクノロジーをベースに、Chrome拡張機能を使用してブラウザタスクを自動化し、Webページの操作を理解して実行します。
TEN Agentは、OpenAI Realtime APIとRTCテクノロジーを統合したオープンソースのリアルタイムマルチモーダルAIエージェントフレームワークです。TEN Agentは、音声、テキスト、画像によるマルチモーダルなインタラクションを可能にし、高性能なリアルタイム通信をサポートし、低遅延を実現します。
FLOATは、DeepBrain AIと韓国科学技術院(KAIST)が開発した、音声駆動型のスピーカーアバター生成モデルです。フローマッチング生成モデルに基づき、動きの潜在空間を学習することで、効率的かつ時間的に一貫性のある動きのデザインを実現します。このモデルは…
SynCamMasterは、浙江大学、快手科技、清華大学、香港中文大学の研究者による共同開発によって生まれた、世界初のマルチビュー動画生成モデルです。6自由度カメラポーズを組み合わせることで、あらゆる視点からの自由度の高い動画を生成できます。
STIV(Scalable Text and Image Conditioned Video Generation)は、Appleが発表した大規模ビデオ生成モデルです。STIVは8億7000万個のパラメータを誇り、テキストからビデオ(T2V)やテキストから画像への変換を処理できます。
DiffSenseiは、北京大学、上海AIラボ、南洋理工大学の研究者らが共同開発した漫画生成フレームワークです。制御可能な白黒漫画パネルを生成できます。DiffSenseiは、拡散ベースの画像生成器と複数の…を統合しています。
Mayaは、オープンソースの多言語・マルチモーダルモデルであり、インストラクションベースのファインチューニングを使用して、複数の言語と文化的背景にわたって機能を拡張します。MayaはLLaVAフレームワークに基づいて構築されており、新たに作成された8言語の事前学習済みデータセットが含まれており、視覚的認識能力を向上させています。
QianYingは、Giant Interactiveが開発した大規模なオーディオゲーム生成モデルで、ゲームビデオ生成モデルYingGameとビデオ吹き替えモデルYingSoundで構成されています。YingGameはオープンワールドゲーム向けに設計されており、Giant InteractiveのAIプラットフォームです。
Prompticは、効率的でPythonスタイルの開発アプローチを提供する軽量なLLMアプリケーション開発フレームワークです。LiteLLMをベースとするPrompticは、開発者がたった1行のコード変更で異なるLLMサービスプロバイダー間を簡単に切り替えることを可能にします。
SwiftEditは、VinAI Researchチームが開発したテキストガイド式画像編集ツールです。革新的なワンステップ拡散技術に基づき、0.23秒で高速かつ高品質な画像編集を実現します。このツールの最大の特長は、ワンステップでの画像編集が可能であることにあります。
ChatMCPは、モデルコンテキストプロトコル(MCP)に基づいたAIチャットクライアントであり、OpenAI、Claude、OLLamaなどの様々な大規模言語モデル(LLM)とのインタラクションをサポートしています。ChatMCPは、MCPの自動インストール機能を備えています。
Multimodal Live APIは、Googleが提供する低遅延の双方向インタラクティブAIインターフェースで、テキスト、音声、ビデオの入力をサポートし、音声とテキストを出力します。開発者はこれを利用して、リアルタイムの音声およびビデオストリーミング機能を備えたシステムを構築できます。
CodeArenaは、複数の大規模言語モデル(LLM)が同時に同じアプリケーションを構築し、リアルタイムのランキング結果を表示し、異なるLLMのコード生成能力を比較できるオンラインプラットフォームです。CodeArenaプラットフォームは主に、異なるLLMを評価・比較します。
Phi-4は、Microsoftが発表した14億個のパラメータを持つ小型言語モデルです。数学などの分野における複雑な推論や、従来の言語処理において優れた性能を発揮します。Phi-4は、モデルのパフォーマンス向上を目的として、大量の合成データを取り入れ、学習においてデータ品質を重視しています。
Insight-Vは、南洋理工大学、テンセント、清華大学の研究者らが共同開発したマルチモーダルモデルです。長鎖視覚推論における大規模マルチモーダル言語モデルの能力を強化します。スケーラブルなデータ生成ストリームに基づいています。