Gemini Robotics On-Deviceは、Google DeepMindが開発した、ロボット上でローカルに実行できる初の視覚言語動作(VLA)モデルです。このモデルは強力なオフライン操作機能を備えており、自然言語コマンドに従ってタスクを完了することができます。
Gemini Robotics On-Deviceは、Google DeepMindが開発した、ロボット上でローカルに実行できる初の視覚言語動作(VLA)モデルです。このモデルは強力なオフライン操作機能を備えており、自然言語コマンドに従ってタスクを完了することができます。
OmniAvatarは、浙江大学とアリババグループが共同開発した、音声駆動型の全身動画生成モデルです。入力された音声とテキストプロンプトに基づいて、キャラクターの動きが音声と完全に同期した、自然でリアルな全身アニメーション動画を生成します。
AnimaTensorは、CagliostroLabチームとTensorArtが共同開発した2次元画像生成モデルです。革新的なV-Prediction技術に基づき、画像生成プロセスの「速度」を予測することで、ノイズスケジューリングとサンプリング戦略を最適化します。
DAMO GRAPEは、浙江省がん病院とアリババDAMOアカデミーが共同開発した、単純CTスキャンに基づいて早期胃がんを特定する世界初のAIモデルです。DAMO GRAPEは、ディープラーニングを用いて非造影CTスキャンを分析することで、従来の画像診断の限界を克服しています。
Seed 1.6は、ByteDanceのSeedチームが発表した汎用モデルシリーズです。マルチモーダル機能を統合し、256Kの長いコンテキストでの深層推論をサポートします。Seed 1.6は、Seed 1.5のスパースなMoE探索結果を活用し、純粋なテキスト事前学習、マルチモーダルハイブリッド学習などを実施しています。
Gemini CLIは、Googleが提供するオープンソースのエンドポイントAIプログラミングツールで、Gemini 2.5 Proモデルを無料で利用できます。Gemini CLIは、コード理解、ファイル操作、コマンド実行、動的なトラブルシューティングなど、強力なAI機能を提供し、開発者を支援します。
AlphaGenomeは、GoogleのDeepMindが開発した新しいAIモデルで、ゲノムに関するより深い理解を提供します。このモデルは、最大100万塩基対のDNA配列入力を受け取り、それらの調節活動を特徴付ける数千の分子特性を予測し、評価することができます。
Claudiaは、Claude Code向けに設計されたデスクトップアプリケーションおよびツールキットであり、直感的なグラフィカルインターフェースを通じてAI支援開発の効率性とセキュリティを向上させます。プロジェクトおよびセッション管理をサポートし、ユーザーは過去のセッションを簡単に閲覧および復元できます。
DRA-Ctrl(Dimension-Reduction Attack)は、浙江大学がAnt Groupおよび他の機関と共同で開発した革新的なクロスモーダル画像編集フレームワークです。このフレームワークは、ビデオ生成モデルの視覚的、時間的、空間的、および因果的次元を活用しています。
Kwai Keye-VLは、Kuaishouが独自開発したマルチモーダルな大規模言語モデルです。Qwen3-8B言語モデルをベースに、SigLIPで初期化されたビジュアルエンコーダを統合し、動的な解像度入力に対応しています。このモデルは、テキスト、画像などを高度に融合・処理することができます。
Twocastは、AIを搭載したポッドキャスト生成ツールで、2人による会話形式のポッドキャストコンテンツ生成をサポートします。この生成ツールは複数の言語と音声に対応しており、トピック、リンク、ドキュメントなどに基づいて3~5分のポッドキャストを迅速に生成できます。
VLN-R1は、香港大学と上海人工知能研究所が共同開発した新しい身体化知能フレームワークです。大規模視覚言語モデル(LVLM)に基づいて、一人称視点のビデオストリームを連続的なナビゲーションアクションに直接変換します。このフレームワークは、Habit...
Nanonets-OCR-s(Nanonets OCR Small)は、Nanonets社が開発した画像からMarkdownへのOCRモデルで、画像内のドキュメントコンテンツを構造化されたMarkdown形式に変換することをサポートしています。このモデルはテキストを抽出できます...
Hunyuan-A13Bは、Tencentが開発した最新のオープンソース大規模言語モデルで、ハイブリッドエキスパート(MoE)アーキテクチャに基づいており、合計800億個のパラメータと130億個の活性化パラメータを備えています。軽量設計と効率的な推論機能を特徴とし、中級から低価格帯のGPUを1つだけ必要とします。
Kling-Foleyは、Kling AIが開発したマルチモーダルなビデオ・オーディオ生成モデルです。このモデルは、ビデオとテキストのプロンプトを入力として受け取り、ビデオコンテンツに意味的に関連し、時間的に同期した高品質のステレオオーディオを生成します。効果音なども含みます。
4D-LRM(大規模時空間再構成モデル)は、Adobe Research、ミシガン大学、およびその他の機関の研究者によって共同開発された新しい4D再構成モデルです。このモデルは、疎な入力ビューと任意の…に基づいてデータを再構成できます。
FilMasterは、香港大学、快手科技、マイクロソフトリサーチ、清華大学が共同開発したAI映画制作システムです。映画制作の原理と生成型人工知能を組み合わせることで、脚本から完成作品まで、完全自動化された制作を実現します。
MultiAgentPPTは、A2A(Ask-to-Answer)、MCP(Multi-agent Control Protocol)、およびADK(Agent Development Kit)アーキテクチャに基づいたマルチエージェントプレゼンテーション生成システムです。MultiA...
Qwen VLoは、同義千文チームが開発したマルチモーダル統合理解生成モデルです。これは、大規模マルチモーダルモデルからの包括的なアップグレードであり、世界を「見る」ことを可能にし、その理解に基づいて高品質な再現を実行することで、知覚から…への変革を実現します。
XVerseは、ByteDanceのインテリジェントクリエーションチームが開発した、マルチエージェント制御による新しい画像生成モデルです。このモデルは、テキストから画像を生成する領域において、複数の被写体のアイデンティティや意味的属性(ポーズ、スタイル、照明など)をきめ細かく制御します。
Fireplexityは、Firecrawlが開発し、Next.jsをベースに構築されたオープンソースのAI質問応答エンジンです。Fireplexityを使用すると、開発者は独自のAI駆動型質問応答アプリケーションを迅速に構築およびホストできます。迅速なデプロイ(5分以内に起動)が特長です。
MAI-DxO(Microsoft AI Diagnostic Orchestrator)は、マイクロソフトが開発した高度な人工知能システムで、医療診断の精度と効率を向上させます。これは、さまざまな診断方法を用いて連携して作業する仮想医師グループをシミュレートすることに基づいています。
RecGPTは、Taotian Groupが開発した数十億のパラメータを持つ推薦モデルです。現在、Taobaoモバイルアプリのホームページにある「おすすめ商品」フィードに完全に統合されています。マルチモーダル認知、ユーザー行動分析、リアルタイムトレンド理解の融合に基づき、長期的なユーザーの嗜好を正確に捉えます。
ML-Masterは、上海交通大学人工知能学院のエージェントチームが開発したAIエキスパートエージェントです。OpenAIの権威あるベンチマークテストであるMLE-benchにおいて、平均メダル獲得率29.3%で1位を獲得し、Microsoftの…を凌駕する優れたパフォーマンスを発揮しました。