AgentCPM-GUI - 清華大学とMianbi Intelligenceが開発した、オープンソースのエッジサイドGUIインテリジェントエージェントモデル。
AgentCPM-GUIは、清華大学とMianbi AIチームが共同開発したオープンソースのエッジGUIエージェントで、中国語アプリケーション向けに最適化されています。このモデルはMiniCPM-V(80億個のパラメータ)をベースに構築されており、スマートフォンのスクリーンショットを入力として受け入れることができます。
AgentCPM-GUIは、清華大学とMianbi AIチームが共同開発したオープンソースのエッジGUIエージェントで、中国語アプリケーション向けに最適化されています。このモデルはMiniCPM-V(80億個のパラメータ)をベースに構築されており、スマートフォンのスクリーンショットを入力として受け入れることができます。
AG-UI(Agent-User Interaction Protocol)は、AIエージェントとフロントエンドアプリケーション間の標準化されたインタラクションをサポートする、オープンソースの軽量イベントベースプロトコルです。AG-UIは16種類の標準イベントタイプを定義しています。
DreamFitは、ByteDanceが清華大学深圳国際大学院および中山大学深圳キャンパスと共同開発した仮想フィッティングフレームワークです。軽量衣料を中心とした人体イメージの生成に特化して設計されています。適応型アテンションとL...
Minion Agentは、ブラウザ操作、MCP(マルチチャネルプログラミング)、自動プランニング、および詳細な調査をサポートするエージェントフレームワークです。Minion Agentは複数のモデルをサポートし、多様なニーズに対応できる柔軟な設定オプションを提供します。
Being-M0は、北京大学、中国人民大学などが共同開発した、ヒューマノイドロボット向けの初の大規模汎用動作生成モデルです。Being-M0は、業界初の数百万個の動作サンプルデータセットであるMotionLibをベースとしており、革新的なモーション生成技術を使用しています。
DanceGRPOは、ByteDance Seedと香港大学が共同で開発した、初の統合型ビジュアル生成強化学習フレームワークです。視覚生成の分野に強化学習を応用し、2つの主要な生成パラダイム(拡散生成と整流生成)を網羅しています。
AlphaEvolveは、Google DeepMindが開発した汎用科学エージェントです。創造性モデル(LLM)と自動評価器を組み合わせた高度なアルゴリズムを設計・最適化します。Gemini FlashとGemini Proの両方を活用しています。
WorldMemは、南洋理工大学、北京大学、上海AI研究所が共同開発した革新的なAI世界生成モデルです。このモデルは、メモリ機構を組み込むことで、長期間にわたる世界生成モデルの一貫性の欠如という重要な課題に対処しています。
GPDiT(Generative Pre-trained Autoregressive Diffusion Transformer)は、北京大学、清華大学、StepFun、中国科学技術大学によって開発された新しいビデオ生成モデルです。このモデルは…
Skywork-VL Rewardは、Skywork AIが開発したオープンソースのマルチモーダル報酬モデルであり、マルチモーダルな理解と推論タスクのための信頼性の高い報酬シグナルを提供します。このモデルはQwen2.5-VL-7B-Instructアーキテクチャに基づいており、報酬ヘッド構造を組み込んでいます。
ChatUIは、Alibabaがリリースしたオープンソースのインテリジェントな会話型UIコンポーネントライブラリです。レスポンシブデザイン、国際化、テーマのカスタマイズなどの機能を提供し、開発者が高品質なチャットアプリケーションを迅速に構築できるよう支援します。ChatUIはAlibabaの…
FaceShotは、同済大学、上海AI研究所、南京理工大学が共同開発した、学習不要の斬新なポートレートアニメーション生成フレームワークです。外観に基づくランドマークマッチングモジュールと座標ベースのランドマーク再配置モジュールを利用して、様々なキャラクターアニメーションを生成します。
MT-Colorは、上海交通大学とBilibiliが共同開発した、拡散モデルに基づく制御可能な画像カラー化フレームワークです。ユーザーが提供するインスタンス認識テキストとマスクに基づいて、インスタンスレベルの正確な画像カラー化を実現します。このフレームワークはピクセルレベルのマスクに基づいています...
Speech-02は、MiniMax社が開発した次世代テキスト音声合成(TTS)モデルです。回帰型Transformerアーキテクチャに基づき、ゼロショット音声クローニングを実現し、わずか数秒の参照音声から非常に類似した目標音声を生成します。
Stable Audio Open Smallは、Stability AIとArmが共同開発した軽量なテキスト音声生成モデルです。Stable Audio Openモデルをベースに、パラメータ数を11億から3億4100万に削減し、生成速度を向上させています。
LBM(潜在ブリッジマッチング)は、Jasper Researchチームが開発した新しい画像間変換フレームワークです。潜在空間でブリッジマッチングを構築することで、高速かつ効率的な画像変換を実現します。LBMは推論ステップが1つだけで済みます。
Sketch2Animは、エジンバラ大学がSnap Researchおよびノースイースタン大学と共同で開発した自動化フレームワークです。2Dスケッチストーリーボードを高品質の3Dアニメーションに直接変換できます。条件付きモーション合成技術に基づいており、3Dキーポーズを使用します。
SWE-1は、Windsurfチームが発表した初のソフトウェアエンジニアリングAIモデルシリーズです。コード生成、テスト、デバッグ、データ取得といった開発段階を網羅し、ソフトウェア開発プロセス全体を最適化することで、開発効率とユーザーエクスペリエンスの向上を目指しています。
DICE-Talkは、復旦大学とテンセントYouTu Labが共同開発した、感情豊かなダイナミックポートレート生成のための革新的なフレームワークです。DICE-Talkは、アイデンティティの一貫性を維持しながら、鮮やかな感情表現を持つダイナミックポートレート動画の生成をサポートします。DICE-Talkは、感情豊かなダイナミックポートレート動画の生成をサポートします。
Hunyuan Image 2.0は、テンセント初のミリ秒レベルの応答時間を誇るリアルタイムAI画像生成モデルです。Hunyuan Image 2.0は、テキスト、音声、スケッチなど、複数のインタラクション方法に対応しています。ユーザーがコマンドを入力すると…
mem0 が開発した OpenMemory MCP は、Open Model Context Protocol (MCP) をベースに構築されたオープンソースツールです。異なるツール間でコンテキスト情報を共有できるようにすることで、AI ツールのメモリ制限に対処します。OpenMemory MCP は 10 種類以上のモデルをサポートしています。
Toolkamiは、読み取り、書き込み、差分表示、閲覧、コマンド、質問、思考の7つのツールをサポートするミニマルなAIエージェントフレームワークです。このフレームワークはT...をサポートしています。
PemoはAIを活用した文書管理ツールです。PDF、Epub、Wordなど様々な形式の文書のインポートと管理に対応し、ワンクリック翻訳、インテリジェントな要約、マインドマップ生成などの機能を備え、ユーザーが複雑な文書を素早く理解できるよう支援します。
BLIP3-oは、Salesforce Researchをはじめとする複数の機関が開発した革新的なマルチモーダルモデルであり、自己回帰モデルの推論機能と指示追従機能、そして拡散モデルの強力な生成機能を組み合わせたものです。このモデルは、豊富な拡散セマンティクスを持つCLIP画像に基づいています。