Devstral 2 - Mistral AIのオープンソース次世代プログラミングモデルシリーズ
Devstral 2は、Mistral AIが開発した次世代のオープンソースプログラミングモデルで、123Bパラメータを持つDevstral 2と24Bパラメータを持つDevstral Small 2が含まれます。Devstral 2は256Kのコンテキストウィンドウを備えています。
Devstral 2は、Mistral AIが開発した次世代のオープンソースプログラミングモデルで、123Bパラメータを持つDevstral 2と24Bパラメータを持つDevstral Small 2が含まれます。Devstral 2は256Kのコンテキストウィンドウを備えています。
GLM-ASRは、Zhipu AIが提供する一連の音声認識モデルであり、クラウドベースのGLM-ASR-2512とオープンソースのGLM-ASR-Nano-2512が含まれます。GLM-ASR-2512は、複数のシナリオと複数の言語をサポートする、世界をリードするクラウドベースの音声認識モデルです。
Mistral AIが開発したオープンソースのコマンドラインコードアシスタントであるMistral Vibe CLIは、自然言語による対話を通じて、開発者が効率的にコーディング作業を完了できるよう支援します。Mistral Vibe CLIは、プロジェクト構造やGitの状態を自動的に検出できます。
GLM-TTSは、Zhipuが開発したオープンソースのAIテキスト音声合成モデルで、音声クローン、多様な感情表現、高精度なテキスト理解、高品質な音声出力といった特長を備えています。意味モデリングと音響モデリングを組み合わせた2段階生成パラダイムを採用しています。
VoxCPM 1.5は、Wallfacer AIが開発した高度なエンドツーエンドのテキスト音声合成(TTS)モデルで、文脈認識型音声生成とリアルな音声クローンに重点を置いています。このモデルは、エンドツーエンドの拡散自己回帰アーキテクチャを使用して、テキストから直接音声を生成します。
Qwen3-Omni-Flash(Qwen3-Omni-Flash-2025-12-01)は、アリババのQwenチームが開発したフルモーダル大型モデルです。このモデルは、テキスト、画像、音声、動画など複数の入力フォーマットをシームレスに処理し、高解像度画像をリアルタイムで生成できます。
PosterCopilotは、南京大学、LibLib.ai、中国科学院自動化研究所が共同開発したプロ仕様のポスターデザインモデルです。独自の3段階トレーニング戦略により、強力なレイアウト推論能力と正確なエンコーディング能力を備えています。
GPT-5.2は、OpenAIの最新の高度な人工知能モデルシリーズで、専門的な作業や複雑なタスク向けに設計されています。このモデルは3つのバージョンで提供されています。GPT-5.2 Instantは、情報検索などの日常的なタスクを迅速に処理するのに適しています。
Gemini Deep Researchは、Googleが開発した深層学習エージェントで、Gemini 3 Proをベースに構築され、長期的なコンテンツ収集および合成タスクに最適化されています。このエージェントは、多段階強化学習を用いて複雑な情報を処理します。
GWM-1はRunway初の汎用ワールドモデルで、Gen-4.5をベースに構築されています。自己回帰アーキテクチャを使用してビデオコンテンツをフレームごとに予測し、リアルタイムのインタラクションを可能にします。このモデルには、リアルタイム環境シミュレーション用のGWM Worldsなど、3つのブランチがあります。
DeepSearchQAは、ネットワーク調査タスクにおけるエージェントの網羅性と多段階クエリ機能を評価するために使用される、Googleの新しいオープンソースベンチマークツールです。このツールには、17のドメインにわたる900の手作業で設計された「因果連鎖」タスクが含まれており、各ステップは...
Kaleidoは、Zhipu AIが開発したオープンソースのマルチエージェント動画生成フレームワークであり、マルチエージェント動画生成における被写体の一貫性と背景の分離という問題を解決します。このフレームワークは、革新的なデータ構築パイプラインとR-RoPE(Reference Rotary Platform)を活用しています。
SCAIL(Studio-grade Character Animation via In-context Learning)は、Zhipu AIが開発した、映画やテレビの標準規格に対応したキャラクターアニメーション生成フレームワークです。このフレームワークは、革新的な3D一貫性ポーズ表現と完全な...
RealVideoは、Zhipu AIが開発したオープンソースのリアルタイムストリーミングビデオ生成システムです。自己回帰拡散ビデオ生成技術に基づき、RealVideoはテキスト入力を瞬時に連続的で高品質なビデオ応答に変換し、AIとのインタラクションを可能にします。
SSVAE(Spectral-Structured VAE)は、Zhipu AIが開発した、最適化されたビデオ生成のための新しい変分オートエンコーダーです。SSVAEはスペクトル分析を利用して、ビデオVAEの潜在空間が時空間的な低周波バイアスとチャネル固有値を持つ場合、その空間が…
LLaDA 2.0 は、Ant Group によるオープンソースの離散拡散大規模言語モデル (dLLM) で、16B (mini) 版と 100B (flash) 版があります。拡散モデルのスケーラビリティのボトルネックを打破し、パラメータスケールを初めて拡張しました。
Claude-Memは、Claude Code専用に設計されたオープンソースのプラグインで、AIに長期記憶機能を提供します。Claude-Memは、ツール呼び出し、会話ログ、プロジェクトの詳細など、セッションからの重要な情報を自動的に保存および管理します。
Gemini TTSは、Googleが開発した高度なテキスト読み上げ技術で、最新バージョンはGemini 2.5 FlashおよびProモデルです。複数話者、複数言語(24言語以上)の合成に対応し、自然で流暢、かつ感情豊かな音声を生成します。
Tongyi Bailingは、Alibaba Tongyi Labsが開発したエンタープライズレベルの音声基盤モデルです。Fun-ASR音声認識モデルとFun-CosyVoice音声合成モデルを統合し、複雑な環境における音声アプリケーション向けに特別に設計されています。Cont...
OpenScreenは、Screen Studioの代替となる無料のオープンソース画面録画ツールです。MacとWindowsシステムに対応しており、手動ズーム、カスタムズーム深度、ビデオの切り抜き、背景選択、追加などの機能を備えています。
Paper2Slidesは、香港大学が開発したオープンソースのAIツールで、学術論文、レポート、文書をプロフェッショナルなスライドやポスターに素早く変換できます。RAG(Retrieval Augmented Generation)メカニズムを採用し、文書自体から直接コンテンツを抽出することで、…
Wan-Moveは、アリババ傘下のTongyi Labをはじめとする複数の機関が開発した、オープンソースのモーション制御ビデオ生成フレームワークです。潜在軌道誘導によって高品質なビデオモーション制御を実現します。その最大の特長は、既存の画像からビデオへの変換モデルを修正する必要がない点です。
UnityVideoは、香港科技大学がKuaishou Kelingチーム、清華大学などと共同で開発した、斬新なマルチモーダル・マルチタスク動画生成フレームワークです。セグメンテーション、スケルトン化、深度、オプティカルフローなど、複数の視覚モダリティを統合し、学習機能も備えています。
LightX2VはSenseTimeが開発したオープンソースの推論フレームワークであり、業界初のリアルタイムビデオ生成機能を備えています。このフレームワークは、テキストからビデオへの変換(T2V)や画像からビデオへの変換(I2V)など、さまざまなビデオ生成タスクをサポートし、複数の高度なビデオ生成技術を統合しています。