KittenTTS - KittenMLは、オープンソースの軽量テキスト音声合成モデルです。
KittenTTSは、KittenMLチームによって開発された軽量なオープンソースのテキスト読み上げ(TTS)モデルです。非常に小さなモデルサイズ(わずか25MB)と強力なCPU最適化機能を備えているため、GPUを搭載していない低電力デバイスでも動作します。
KittenTTSは、KittenMLチームによって開発された軽量なオープンソースのテキスト読み上げ(TTS)モデルです。非常に小さなモデルサイズ(わずか25MB)と強力なCPU最適化機能を備えているため、GPUを搭載していない低電力デバイスでも動作します。
DreamVVTは、ByteDanceと清華大学(深圳)が共同開発したビデオ仮想試着(VVT)技術です。拡散トランスフォーマー(DiTs)フレームワークに基づき、2段階のアプローチで仮想試着を実現します。
SkyReels-A3は、Kunlun Techが開発した高度なAIモデルです。DiT(Diffusion Transformer)ビデオ拡散アーキテクチャをベースに、フレーム補間、強化学習、カメラ動作制御技術を組み合わせています。このモデルは、音声駆動技術を用いて写真や動画を変換することができます。
AionUiは、ElectronとReactをベースに構築された、無料のオープンソースのクロスプラットフォームデスクトップアプリケーションです。Gemini CLIのコマンドラインAIチャット体験を、現代的で効率的なグラフィカルインターフェースへと変革します。AionUiは、さらに以下の機能を提供します。
Baichuan-M2は、Baichuan Intelligenceが開発したオープンソースの医療拡張モデルです。医療分野で優れた性能を発揮し、HealthBenchベンチマークで60.1のスコアを獲得。OpenAIのgpt-oss120bをはじめとする数多くのオープンソースモデルを凌駕し、世界トップの座に輝きました。
MiroThinkerは、高度な研究や複雑で長期的な問題の解決を目的に設計された、オープンソースのインテリジェントエージェントモデル群です。Qwen3をベースとしたこのモデルは、タスク分解、マルチホップ推論、検索強化型生成、コード実行などの機能を備えています。
MiroFlowは、マルチエージェントシステム開発のための強力なフレームワークであり、特に複雑で高性能なAIエージェントの構築を目的として設計されています。MiroThinkerなどのモデル向けに、高品質なエージェント軌跡データを生成します。このフレームワークは、再現性の高いパフォーマンスを誇ります。
GLM-4.5Vは、Zhipu Open Sourceが開発した最新世代の視覚推論モデルです。106B個のパラメータと12B個のアクティベーション機能を備え、現在、最先端の視覚言語モデル(VLM)となっています。このモデルは、GLM-4.1V-Thinkingをベースにしています。
Matrix-Game 2.0は、Kunlun Tech傘下のSkyWork AIが独自開発した世界モデルです。業界初のオープンソース、汎用、リアルタイム、長系列のインタラクティブ生成モデルであり、完全オープンソースで、インタラクティブ世界モデル分野の発展を牽引しています。
RynnVLA-001は、アリババDAMOアカデミーが開発した視覚・言語・動作モデルです。このモデルは、多数の一人称視点動画を用いた事前学習を通して人間の操作スキルを学習し、それをロボットアームの制御に暗黙的に応用します。
RynnRCPは、Alibaba DAMO Academyが開発したオープンソースのロボティクスコンテキストプロトコルであり、身体化された知能のシームレスな開発を可能にします。RynnRCPは、RCPフレームワークとRobotMotionという2つの主要モジュールで構成されています。
RynnECは、アリババDAMOアカデミーが開発した世界理解モデル(MLLM)であり、身体化された認知タスク向けに特別に設計されています。このモデルは、位置、機能、数量など11次元からシーン内のオブジェクトを包括的に分析し、オブジェクト理解、空間認識などをサポートします。
Matrix-3Dは、Kunlun TechのSkywork AIチームが開発した、探索可能なパノラマ3D世界を生成するためのフレームワークです。このフレームワークは、パノラマビデオ生成と3D再構築を組み合わせ、単一の画像やテキスト情報から高品質で全方向的な3D世界を生成します。
AI Sheetsは、Hugging Faceが開発したオープンソースのノーコードデータ処理ツールです。Excelのようなインターフェースを備えており、ユーザーは自然言語によるプロンプトを通して数千ものオープンソースAIモデルを簡単に呼び出し、データの構築、拡充、分析を行うことができます。
Skywork UniPic 2.0は、Kunlun Wanweiがオープンソース化した高効率マルチモーダルモデルで、画像生成、編集、理解機能を統合的に実現しています。このモデルは、20億個のパラメータを持つSD3.5-Mediumアーキテクチャをベースとしており、事前学習と段階的なデュアルタスク学習を活用しています。
Voostは、NXN Labsが開発した革新的なバーチャル試着・試着モデルで、統一性と拡張性に優れたDiffusion Transformer(DiT)フレームワークに基づいて構築されています。バーチャル試着とバーチャル試着の両方のタスクを同時に処理できます。
hunyuan-large-visionは、テンセントが開発したマルチモーダル理解モデルです。MoEアーキテクチャに基づいており、52個のアクティベーションパラメータを持ち、画像、動画、3D空間入力に対応しています。このモデルは、国際的に有名な大規模モデルアリーナであるLMA Arena Visionで展示されています。
Skywork Deep Research Agent v2は、Kunlun Techがリリースした深層研究エージェントのアップグレード版です。Skyworkスーパーエージェントの中核エンジンとして、マルチモーダル深層研究機能を備え、マルチモーダル検索と理解を初めて統合しました。
Mureka V7.5は、Kunlun Techが開発した高度なAI音楽制作モデルです。このモデルは中国語の楽曲制作に優れており、音色や演奏技術を正確に再現し、発音や感情表現を向上させます。
Shadowは、開発者が既存のコードベースを理解し、推論し、貢献するのを支援するオープンソースのAIプログラミングエージェントです。ShadowはGitHubリポジトリとの統合をサポートし、プルリクエストの生成、ブランチの管理、リアルタイムのタスクステータス更新を提供できます。
MoE-TTSは、崑崙万威音声チームが発表した、MOEに基づく初の役割記述音声合成フレームワークであり、オープン領域のテキスト記述の理解度向上を目的として特別に設計されています。このモデルは、専門家混合モデル(MOE)アプローチを採用しています。
DINOv3は、Meta社が開発した汎用性の高い最先端(SOTA)ビジュアル基盤モデルです。ラベルなしデータで学習されており、画像分類、セマンティックセグメンテーション、物体検出など、様々なタスクに適した高品質かつ高解像度のビジュアル特徴を生成します。
Genie Envisionerは、Logic Studioが発表した初のオープンソースのロボット世界モデリングプラットフォームです。このプラットフォームは、統一されたビデオ生成フレームワークを通じて、ポリシー学習、評価、シミュレーション機能を統合しています。コアコンポーネントには、GE-Base(大規模な…
VeOmniは、ByteDanceのSeedチームが開発した、PyTorchをベースとしたオープンソースのフルモーダル分散トレーニングフレームワークです。VeOmniはモデル中心の設計で、分散並列ロジックをモデル計算から分離し、さまざまな並列処理の柔軟な組み合わせをサポートしています。