ART(Anonymous Region Transformer)は、グローバルなテキストプロンプトと匿名領域レイアウトに基づいて、複数の独立した透明レイヤー(RGBA形式をサポート)を直接生成できる、斬新な多層透明画像生成技術です。
ART(Anonymous Region Transformer)は、グローバルなテキストプロンプトと匿名領域レイアウトに基づいて、複数の独立した透明レイヤー(RGBA形式をサポート)を直接生成できる、斬新な多層透明画像生成技術です。
NextGenAIは、OpenAIがAI技術に基づく教育と研究を推進するために立ち上げたグローバルアライアンスです。NextGenAIは、ハーバード大学、MIT、オックスフォード大学、OpenAIなど、15のトップ大学や研究機関を結集しています。
NotaGenは、中央音楽学院、北京航空航天大学、清華大学などの機関によって開発された音楽生成モデルです。大規模言語モデル(LLM)を模倣したトレーニングパラダイムに基づいて、高品質のクラシック音楽の楽譜を生成します。NotaGenは…
DiffRhythmは、西北工業大学と香港中文大学深圳校が共同開発したエンドツーエンドの音楽生成ツールです。潜在拡散技術に基づいており、音楽を迅速に生成できます。
OmniAlign-Vは、上海交通大学、上海AI研究所、南京大学、復旦大学、浙江大学が共同開発した高品質なデータセットです。マルチモーダル大規模言語モデル(MLLM)と人間の嗜好との整合性を向上させるために特別に設計されています。
TrendPublishは、AIを活用したトレンド発見・コンテンツ配信システムです。Twitter/Xやウェブサイトなど複数の情報源から情報を収集し、DeepseekAIやQianwenといったAIサービスを利用して、インテリジェントな要約やトレンド分析を行います。
Proxy Liteは、3バイトのパラメータを持つオープンソースの軽量ビジュアル言語モデル(VLM)であり、ウェブページの自動化タスクをサポートします。Proxy Liteは、人間のようにブラウザを操作し、ウェブページの操作、データスクレイピング、フォームへの入力などのタスクを実行できます。
WeGenは、中国科学技術大学が上海交通大学、WeChatチーム、中国科学院、その他の機関と共同で開発した、統一されたマルチモーダル生成モデルです。自然な対話に基づいた多様な視覚生成タスクを可能にします。WeGenはマルチモーダルな要素を組み合わせ、...
DiffBrushは、北京郵電大学、清華大学、中国電信人工知能研究所、西北工業大学が共同開発した画像生成・編集フレームワークです。特別なトレーニングは不要で、手描きのスケッチに基づいて直感的に画像生成を制御できます。
Liquidは、華中科技大学、ByteDance、香港大学が共同開発した、ミニマルな統一マルチモーダル生成フレームワークです。VQGANをベースとしており、画像を離散的なビジュアルトークンにエンコードし、テキストトークンと同じ語彙空間を共有することで、大規模な生成を可能にします。
X-Dancerは、ByteDance、カリフォルニア大学サンディエゴ校(UC San Diego)、南カリフォルニア大学(USC)の研究者らが共同開発した、音楽に基づいた人間のダンス動画生成フレームワークです。単一の静止画像から、多様でリアルな全身ダンス動画を生成することができます。
AVD2(Accident Video Diffusion for Accident Video Description)は、清華大学、香港科技大学、吉林大学、南京理工大学、北京理工大学、復旦大学などの機関が共同開発した技術です。
Kiss3DGenは、事前学習済みの2D画像拡散モデルをリファクタリングすることで、3Dオブジェクトを効率的に生成、編集、強化する革新的な3Dアセット生成フレームワークです。そのコア機能は、マルチビュー画像とその対応する画像を組み合わせた「3Dバンドル画像」を生成することです。
Archonは、AIエージェントの構築と最適化に焦点を当てたオープンソースプロジェクトです。コードを自律的に生成し、エージェントのパフォーマンスを最適化することで、現代のAI開発の中核となる概念を実証しています。Archonの主な機能には、エージェントの迅速な構築などが含まれます。
PodAgentは、香港中文大学、マイクロソフト、Xiaohongshuが共同開発したポッドキャスト生成フレームワークです。実際のトークショーのシナリオをシミュレートし、ホスト、ゲスト、ライターを含むマルチエージェント協調システムを使用して、リッチで魅力的なポッドキャストを自動的に生成します。
Chat2SVGは、大規模言語モデル(LLM)と画像拡散モデルを組み合わせることで高品質なSVGグラフィックの作成を自動化する革新的なテキストからベクターグラフィック(SVG)生成フレームワークです。多段階のワークフローを通じて、まず...
QwQ-32Bは、アリババがオープンソース化した新しい推論モデルで、320億個のパラメータを持つ。大規模な強化学習(RL)を用いて学習されており、数学的推論やプログラミングなどのタスクにおいて非常に優れた性能を発揮し、6710億個のパラメータを持つDeepSenseの性能に匹敵する。
Light-R1は、360 AIが開発したオープンソースのAIモデルで、数学における長連鎖推論、特にLight-R1-32Bに焦点を当てています。このモデルはQwen2.5-32B-Instructをベースにしており、70,000個の数学的データポイントと2段階の学習プロセス(SF...)を使用しています。
SpatialVLAは、上海AIラボ、中国電信人工知能研究所、上海科技大学が共同開発した、斬新な空間具現化型汎用マニピュレーションモデルです。数百万の実データポイントを用いた事前学習に基づき、ロボットに汎用的な3D空間具現化能力を与えます。
TheoremExplainAgent (TEA) は、ウォータールー大学、Votee AI、およびその他の機関によって開発されたオープンソースのマルチモーダルエージェントシステムです。数学や科学の定理をよりよく理解できるように、長尺のアニメーション動画を生成します。TheoremExplainAgent...
Cohere社が開発したAya Visionは、マルチモーダルかつ多言語対応のビジョンモデルであり、世界中の多言語・マルチモーダルコミュニケーション機能を強化します。23言語に対応し、画像説明生成、視覚的質問応答、テキスト翻訳などを行うことができます。
BGE-VLは、北京人工知能研究院が複数の大学と共同で開発したマルチモーダルベクトルモデルです。大規模な合成データセットであるMegaPairsで学習されています。BGE-VLは、テキストから画像への検索や複合画像検索など、マルチモーダルな検索タスクに重点を置いています。
Hunyuan Image-Generated Videoは、Tencent Hunyuanが開発したオープンソースの画像生成動画モデルです。ユーザーは画像をアップロードし、簡単な説明文を追加することで、その画像を基にした5秒間のショートビデオを生成できます。このモデルは、リップシンク、モーション駆動編集、背景効果音などをサポートしています。
Granite 3.2は、IBMのオープンソースのマルチモーダルAIモデルファミリーであり、強力な推論、視覚理解、および予測機能を備えています。Granite 3.2には複数のバージョンがあり、Granite 3.2 Instructは実験的な連鎖推論機能を提供します。