ACE - アリババ同義研究所が開発した、総合的な画像生成・編集モデル
ACE(All-round Creator and Editor)は、アリババグループの同義研究所が開発した、拡散変換に基づく包括的な画像生成・編集モデルです。ACEは、ロングコンテキスト条件ユニット(LCU)と統一された条件グリッドを導入しています。
ACE(All-round Creator and Editor)は、アリババグループの同義研究所が開発した、拡散変換に基づく包括的な画像生成・編集モデルです。ACEは、ロングコンテキスト条件ユニット(LCU)と統一された条件グリッドを導入しています。
ViewExtrapolatorは、南洋理工大学と中国科学院大学(UCAS)の研究チームが共同開発した、斬新な透視外挿法です。安定ビデオ拡散(SVD)の生成事前分布に基づいて、訓練画像よりもはるかに広い範囲の視点を合成します。
OpenScholarは、ワシントン大学とアレン人工知能研究所が共同開発した、検索機能を強化した言語モデル(LM)です。科学文献から関連論文を検索・統合することで、科学者が疑問に答えるのを支援します。このシステムは、大規模な科学データベースを利用しています。
SmolVLMは、Hugging Faceが開発した軽量な視覚言語モデルで、特にデバイス上での推論向けに設計されています。20億個のパラメータを持ちながら、高いメモリ効率と高速な処理速度を実現しています。SmolVLMは、さまざまなニーズに対応するために3つのバージョンを提供しています。
OneDiffusionは、AI2が開発した汎用性の高い大規模拡散モデルで、双方向の画像合成と理解をシームレスにサポートし、テキストからの画像生成、条件付き画像生成、画像理解など、さまざまなタスクに対応します。これは、すべての条件と目的を組み合わせることに基づいています。
LongAlignは、香港大学の研究チームが開発した改良型テキスト・画像変換(T2I)拡散モデルであり、長文テキスト入力のアライメント精度を向上させます。LongAlignはセグメントレベルのコーディング技術を用いて長文テキストをセグメント化し、様々なエンコーディング方式に対応します。
ebook2audiobookXTTSは、電子書籍をオーディオブックに変換するオープンソースのAIツールです。epub、pdf、mobiなど様々な電子書籍フォーマットに対応し、Coqui XTTS技術を用いて高品質なオーディオを実現します。
Optimaは、清華大学が開発した、大規模言語モデル(LLM)に基づくマルチエージェントシステム(MAS)の最適化フレームワークです。生成、ランキング、選択、トレーニングという反復的なパラダイムに基づき、通信効率とタスクパフォーマンスを大幅に向上させます。
MuCodecは、清華大学深圳国際大学院、テンセントAIラボ、香港中文大学の研究者らが共同開発した超低ビットレート音楽コーデックです。効率的な音楽圧縮と高忠実度再生を実現します。MuCodecは…
Find3Dは、カリフォルニア工科大学(Caltech)が開発した3Dパーツ分割モデルで、任意のテキストクエリに基づいて、あらゆるオブジェクトの任意のパーツを分割できます。Find3Dは強力なデータエンジンを使用して、インターネット上の3Dアセットからトレーニングデータを自動的に生成します。
Sketch2Lineartは、シンプルな手描きのスケッチを鮮明な線画に変換するAI搭載の描画ツールです。スケッチの説明を自動的に生成し、それに基づいて線画を描画します。また、さまざまなスタイルに合わせて細部を調整することも可能です。ユーザーは…
Fancy123は、華中科技大学と華南理工大学が共同開発した3Dメッシュ生成技術です。プラグアンドプレイ変形技術に基づき、単一画像から高品質な3Dメッシュを生成します。この手法は、2つの強調モジュールとバックプロジェクション演算から構成されています。
Mooncakeは、Dark Side of the MoonのKimi氏、清華大学、その他の機関が共同でオープンソース化した大規模モデル推論アーキテクチャです。KVCacheを中心とした分散アーキテクチャを採用し、プリフィル処理クラスタとデコード処理クラスタを分離することで、GPUクラスタの空き領域を最大限に活用しています。
QwQ-32B-Preview(QwQ-32B)は、アリババが発表したオープンソースのAI推論モデルで、数学とプログラミングにおいて優れた性能を発揮します。QwQ-32B-Previewは325億個のパラメータを持ち、最大32,000トークンのヒントを処理できます。複数の…
InfiMM-WebMath-40Bは、ByteDanceと中国科学院が共同でオープンソース化した大規模なマルチモーダルデータセットです。数学分野におけるマルチモーダルモデルのテキストと画像の混合推論能力の向上を目指しています。このデータセットはCommon Crawlから取得されています。
SAM 2.1(Segment Anything Model 2.1)は、Meta(Facebookの親会社)が画像および動画処理向けに開発した高度なビジュアルセグメンテーションモデルです。シンプルなTransformerアーキテクチャとストリーミングメモリ設計に基づいています。
Qwen2VL-Fluxは、Qwen2VLの視覚言語理解とFLUXフレームワークを組み合わせたマルチモーダル画像生成モデルで、テキストプロンプトと画像参照に基づいて高品質の画像を生成します。このモデルは、バリアント生成、...など、複数の生成モードをサポートしています。
ShowUIは、シンガポール国立大学のShow Labとマイクロソフトが共同開発した視覚言語アクションモデルであり、グラフィカルユーザーインターフェース(GUI)アシスタントの効率向上を目的としています。このモデルは、UI誘導型の視覚トークン選択に基づいて計算コストを削減します。
NVLMはNVIDIAが開発した最先端のマルチモーダル大規模言語モデル(LLM)であり、視覚言語タスクにおいて、トップクラスの独自モデル(GPT-4oなど)やオープンアクセスモデル(Llama 3-V 405BやInternVL 2など)に匹敵する性能を実現しています。
Promptrieverは、ジョンズ・ホプキンス大学とSamaya AIが共同開発した革新的な検索モデルです。言語モデルのように自然言語によるプロンプトを受け付け、ユーザーの検索ニーズに直感的に対応します。Promptrieverは…
LongLLaVAは、MambaモジュールとTransformerモジュールを組み合わせたハイブリッドアーキテクチャに基づくマルチモーダル大規模言語モデル(MLLM)です。大量の画像を効率的に処理でき、特に動画理解と高解像度画像解析に優れています。LongLLaVAは…
Devikaは、複雑な指示を理解し、分解できるオープンソースのAIプログラミングアシスタントです。統合されたAI検索機能とWebブラウジング機能を使用して情報を収集し、目標を達成するためのコードを作成します。Devikaは様々なAIモデルをサポートし、高度な計画能力と推論能力を備えています。
iDP3(Improved 3D Diffusion Policy)は、スタンフォード大学が他の複数の大学と共同で開発した3Dビジョンベースのモーション戦略です。多様な環境におけるヒューマノイドロボットの自律動作能力を向上させます。従来の3D戦略とは異なり、iDP3は…
Proactive Agentは、清華大学がFacewall Intelligenceなどのチームと共同で開発した次世代のプロアクティブエージェントインタラクションパラダイムです。主体性を持ち、ユーザーのニーズを予測し、直接的な指示なしにアクションを起こすことができます。Proactive Agentは…