MAS-Zero - Salesforceが提供するマルチエージェントシステム設計フレームワーク
MAS-Zeroは、Salesforceが提供するマルチエージェントシステム(MAS)設計フレームワークで、人間の介入なしにMASを自動的に設計・最適化します。このフレームワークはメタレベル設計に基づいており、推論中に各問題インスタンスを動的に調整します。
MAS-Zeroは、Salesforceが提供するマルチエージェントシステム(MAS)設計フレームワークで、人間の介入なしにMASを自動的に設計・最適化します。このフレームワークはメタレベル設計に基づいており、推論中に各問題インスタンスを動的に調整します。
MultiTalkは、中山大学深圳キャンパス、美団、香港科技大学が共同開発した、音声駆動型の多人数対話型動画生成フレームワークです。このフレームワークは、マルチチャンネル音声入力、参照画像、テキストプロンプトに基づいて、人間の対話を含む動画を生成します。
SmolVLAは、Hugging Face社が開発した軽量なオープンソースのビジョン・ランゲージ・アクション(VLA)モデルで、コスト効率の高いロボット工学向けに設計されています。4億5000万個のパラメータを持ち、コンパクトで、CPU上で動作するため、必要なのはコンシューマーグレードのGPU1枚のみです。
ContentVは、ByteDanceが開発した、80億個のパラメータを持つオープンソースの画像ベース動画モデルフレームワークです。Stable Diffusion 3.5 Largeの2D-VAEを3D-VAEに置き換え、3D位置エンコーディングを導入することで、画像モデルが動画生成機能を迅速に獲得できるようにしています。
PartCrafterは、単一のRGB画像から意味的に明確に定義され、幾何学的に多様な複数の3Dメッシュを生成できる高度な3D生成モデルです。各3Dパーツの潜在空間表現を組み合わせ、階層的なアテンションメカニズムを使用して...
MaskSearchは、大規模言語モデル(LLM)のエージェント検索機能を強化するためにAlibaba Tongyi Labsが開発した、汎用性の高い新しい事前学習フレームワークです。検索拡張マスク予測(RAMP)タスクを通じて、モデルが入力テキストに対して検索を実行できるようにします。
InftyThinkは、大規模モデル推論のための革新的なパラダイムであり、長時間の推論タスクにおける従来モデルの限界を克服します。複雑な推論プロセスをセグメント化された反復処理によって複数の短いセグメントに分割し、各セグメントの後に中間サマリーを生成します。
o3-proはOpenAIの強力な推論モデルです。o3のアップグレード版として、複雑な問題の処理と正確な回答の提供に優れており、特に科学研究、プログラミング、教育、執筆などのシナリオでその真価を発揮します。o3...
Magistralは、Mistral AIが開発した推論モデルであり、透明性、多言語対応、ドメイン固有の推論機能に重点を置いています。このモデルには、Magistral Small(オープンソース版)とMagistral Medium(エンタープライズ版)が含まれます。
Vuiは、Fluxions-AIチームがオープンソース化した軽量音声対話モデルで、LLaMAアーキテクチャに基づいています。このモデルは4万時間もの対話トレーニングを経ており、実際の会話における間投詞、笑い声、間などをシミュレートできるため、没入感のあるインタラクティブな体験を提供します。
Krea 1は、Krea AIが開発したAI画像生成モデルで、従来のAI画像生成における「AIの美学」という課題に取り組んでいます。このモデルは、非常にリアルで質感のある画像を生成でき、複数の芸術スタイルに対応し、スタイルの参考資料も提供します。
Seedance 1.0は、ByteDanceのSeedチームが開発した基本的な動画生成モデルです。このモデルはテキストと画像の入力をサポートし、シームレスなマルチカメラ切り替えによる1080pの高画質動画を生成でき、ネイティブのマルチカメラストーリーテリング機能を備え、さらに…
Doubao-Seed-1.6は、ByteDanceが開発したマルチモーダル深層思考モデルです。このモデルは、自動、思考、非思考の3つの思考モードをサポートし、テキスト、画像、動画などを処理できます。
Reorは、オープンソースでローカライズされたAI搭載の個人知識管理アプリケーションです。関連するメモの自動リンク、セマンティック検索、Q&A機能をサポートしています。ユーザーはObsidianに似たMarkdownエディタを使用してメモを編集します。ReorはOl...
V-JEPA 2は、Meta AIが開発した世界最高水準のモデルであり、ビデオデータに基づいて物理世界の理解、予測、計画を可能にします。V-JEPA 2は、自己教師あり学習に基づき、12億個のパラメータを持つ統合型組み込み予測アーキテクチャ(JEPA)を利用しています。
HistAgentは、プリンストン大学AI研究所と復旦大学歴史学部が共同開発したAIアシスタントシステムで、歴史研究に特化して設計されています。歴史研究におけるマルチモーダル情報処理、多言語分析、複雑な推論に対応しています。
SeedVR2は、ByteDanceが発表した新しいシングルステップビデオ復元(VR)モデルで、拡散モデルと敵対的事後学習(APT)技術に基づいています。このモデルは…
Next-Frame Diffusion (NFD) は、北京大学とマイクロソフトリサーチが共同開発した自己回帰型ビデオ生成モデルです。拡散モデルの高忠実度生成能力と、自己回帰モデルの因果性と制御性を兼ね備えています。Next-Frame...
LLIA(Low-Latency Interactive Avatars)は、Meituanが開発した、拡散モデルに基づくリアルタイム音声駆動型ポートレートビデオ生成フレームワークです。このフレームワークは、音声入力に基づいて仮想アバターを生成し、低遅延をサポートしています。
Hunyuan3D-2.1は、TencentのHunyuanチームが立ち上げたオープンソースプロジェクトで、画像から高精細な3Dアセットを生成することに重点を置いています。物理ベースレンダリング(PBR)マテリアル合成機能を備え、金属反射などのリアルなテクスチャやマテリアルを生成します。
MAGREF(Masked Guidance for Any-Reference Video Generation)は、ByteDanceが開発したマルチエージェント動画生成フレームワークです。MAGREFは、単一の参照画像とテキストプロンプトのみで、高品質で対象に特化した動画を生成します。
Code Researcher は、Microsoft Research が開発した高度な調査エージェントツールで、大規模なシステムコードベースとそのコミット履歴を処理し、システムコードのクラッシュの修復を自動化するように特別に設計されています。このツールは、分析 (Analysis)、...
Seaweed APT2は、ByteDanceが開発した革新的なAI動画生成モデルです。自己回帰型敵対的事後学習(AAPT)技術により、双方向拡散モデルを単方向自己回帰型ジェネレーターに変換することで、効率的かつ高品質な動画生成を実現します。
MiniMax-M1は、MiniMaxチームがリリースした最新のオープンソース推論モデルです。ハイブリッドエキスパートアーキテクチャ(MoE)とライトニングアテンションを組み合わせ、合計4560億個のパラメータを誇り、各トークンは...