Infinite Mobility - 上海AIラボが発表したインタラクティブなオブジェクト生成モデル
Infinite Mobilityは、上海AIラボが開発したインタラクティブオブジェクト生成モデルです。プロシージャル生成技術に基づいて、高品質なインタラクティブオブジェクトデータアセットを効率的に生成します。Infinite Mobilityは、22種類の一般的なインタラクティブオブジェクトをサポートしています。
Infinite Mobilityは、上海AIラボが開発したインタラクティブオブジェクト生成モデルです。プロシージャル生成技術に基づいて、高品質なインタラクティブオブジェクトデータアセットを効率的に生成します。Infinite Mobilityは、22種類の一般的なインタラクティブオブジェクトをサポートしています。
ChatTS-14Bは、ByteDanceの研究チームがオープンソース化した、時系列データの理解と推論に特化した大規模言語モデルで、140億個のパラメータを持ちます。Qwen2.5-14B-Instructをベースに高度に調整されており、合成データアライメント技術を活用しています。
MAGI-1は、Sand AIがオープンソース化した世界初の自己回帰型動画生成モデルです。自己回帰アーキテクチャを採用し、動画シーケンスをブロックごとに予測することで、滑らかで自然な動画を生成します。また、無限拡張とワンショット長尺動画生成にも対応しています。
WriteHEREは、Jürgen Schmidhuber氏率いるチームによって開発された、オープンソースのAI搭載長文ライティングフレームワークです。WriteHEREは、異種再帰プランニング(HRP)技術に基づいており、ライティングタスクを動的に分解します。
Yuxi-Knowは、大規模なRAG知識ベースと知識グラフ技術に基づいて構築されたインテリジェントな質問応答プラットフォームです。Yuxi-Knowは、さまざまな知識ベースファイル形式(PDF、TXT、MD、Docxなど)をサポートし、ファイルコンテンツの変換もサポートしています。
SurveyGOは、Wallfacer AIチームが開発したオープンソースのAI搭載型学術論文作成ツールです。ユーザーが入力したトピックや説明に基づいて、構造がしっかりしていて内容が豊富なレビュー記事を迅速に生成できるため、研究者や学生の論文執筆効率向上に役立ちます。
Kortix社が開発したSunaは、世界初のオープンソース汎用AIエージェントプロジェクトであり、様々な現実世界のタスクに対する効率的なソリューションを提供します。自然で流暢な対話に基づき、Sunaは調査・分析、データ処理などにおけるインテリジェントな支援をサポートします。
Hunyuan 3D v2.5は、テンセントの次世代3D生成モデルであり、モデリングの詳細度を大幅に向上させています。パラメータの総数は10億から100億に増加し、有効面数は10倍以上に増加、有効幾何学的解像度は1024に達し、超高精細を実現しています。
AvatarFXは、Character.AIが開発した高度なAI動画生成モデルです。アップロードされた画像と選択された音声に基づいて、キャラクターを瞬時に生き生きとさせ、話したり、歌ったり、感情を表現したりすることを可能にします。AvatarFXは複数のキャラクターに対応しています。
Mirasは、Googleが開発した汎用的なディープラーニングアーキテクチャ設計フレームワークであり、特にシーケンスモデリングタスクに適しています。連想記憶とアテンションバイアスの概念に基づき、MirasはTransformerや最新の線形RNNなどのモデルを再定義します。
SocioVerseは、復旦大学、上海創新起研究所、ロチェスター大学、および小紅書が共同で立ち上げた社会シミュレーション世界モデルです。大規模言語モデル(LLM)駆動型インテリジェントエージェントをベースとしており、1000万人の実在ユーザーが含まれています。
Pad.wsは、ホワイトボード機能とIDEツール一式を組み合わせた革新的なオンライン開発環境です。ブラウザ上で動作するため、追加のソフトウェアインストールは不要で、いつでもどこでも、あらゆるデバイスからアクセスできます。インタラクティブなホワイトボードと…
GPT-image-1は、OpenAIがリリースしたネイティブなマルチモーダル画像生成モデルで、開発者はAPIを通じて利用できます。このモデルは、テキストプロンプトと画像に基づいて高品質でプロフェッショナルな画像を生成し、さまざまなスタイルとカスタマイズオプションをサポートしています。
Eagle 2.5はNVIDIAが開発したビジュアル言語モデルであり、わずか8バイトのパラメータで長文コンテキストのマルチモーダル学習に特化したAIモデルです。パラメータ数が少ないにもかかわらず、高解像度画像や長尺動画の処理において非常に優れた性能を発揮します。
Skywork-R1V 2.0 は、Kunlun Wanwei の最新のオープンソースのマルチモーダル推論モデルで、複雑な推論タスク向けに特別に設計されており、強力な視覚的およびテキスト推論機能を備えています。このモデルは、ハイブリッド強化学習とマルチモーダル報酬モデル (Skywork...
Flex.2-previewは、Ostris社が開発したオープンソースのテキストから画像への拡散モデルで、80億個のパラメータを備えています。線、ポーズ、深度などの一般的な制御入力に対応し、修復機能も内蔵しています。このモデルは、単一のアプローチで多様なクリエイティブニーズに対応できます。
DAM-3B(Describe Anything 3B)は、NVIDIAが開発したマルチモーダルな大規模言語モデルで、画像や動画内の特定領域の詳細な記述を生成するように設計されています。このモデルは、点、境界ボックス、落書き、マスクなどを用いて詳細を指定します。
Cooragentは、清華大学のLeapLabチームが開発したオープンソースのAIエージェント連携フレームワークです。ユーザーは、簡単な1行の説明に基づいてエージェントを迅速に作成でき、エージェント間の連携による複雑なタスクの完了をサポートします。Cooragentは…
Open Avatar Chatは、アリババが開発したオープンソースのモジュール式リアルタイムデジタルヒューマン対話システムで、単一のコンピュータ上でフル機能を実現します。Open Avatar Chatは、低遅延のリアルタイム対話(平均応答遅延は約2.2秒)をサポートします。
LongPort MCP(モデルコンテキストプロトコル)は、Longbridge Groupが初めて開発した証券会社向けMCPです。LongPort MCPを基盤として、AIは証券市場データへの迅速なアクセス、株式取引の実行、資産ポートフォリオの管理などが可能になります。
RAGENは、対話型で確率的な環境において大規模言語モデル(LLM)推論エージェントを訓練するためのオープンソースの強化学習フレームワークです。StarPO(State-Thinking-Action-Reward Policy Optimization)に基づいています。
Wenxin Large Model 4.5 Turboは、Baiduが開発した高性能かつ低コストのマルチモーダル大型モデルです。Wenxin Large Model 4.5をベースに、マルチモーダルかつ強力な推論能力を備えるよう最適化されており、テキストや画像など様々な入力形式に対応できます。
Wenxin Big Model X1 Turboは、Baiduが発売した深層思考型モデルです。Wenxin Big Model 4.5 Turboのアップグレード版であり、より高度な思考連鎖と深層思考能力を備えています。文学創作、論理的推論などに優れています。
Hummingbird-0は、Tavus社が開発したAIリップシンクモデルです。Phoenix-3モデルをベースに、ゼロショット学習をサポートしており、追加のトレーニングなしで高精度なリップシンク動画を迅速に生成できます。