Magnetic-One - 複雑なタスクを完了するためのマイクロソフトのマルチAIエージェント協調システム
Magnetic-Oneは、Microsoftが開発した汎用マルチエージェントシステムで、さまざまなドメインにわたる複雑なネットワークおよびファイルタスクを解決するように設計されています。このシステムは、WebSurfer、FileSurferなどを調整するOrchestratorエージェントをリーダーとするマルチエージェントアーキテクチャに基づいています。
Magnetic-Oneは、Microsoftが開発した汎用マルチエージェントシステムで、さまざまなドメインにわたる複雑なネットワークおよびファイルタスクを解決するように設計されています。このシステムは、WebSurfer、FileSurferなどを調整するOrchestratorエージェントをリーダーとするマルチエージェントアーキテクチャに基づいています。
X-Portrait 2は、ByteDanceのインテリジェントクリエーションチームが開発した、単一画像から動画を生成する技術です。1枚の静止画と動画クリップを基に、高品質で映画のような動画を生成します。X-Portrait 2は、元の画像のアイデンティティとなる特徴を保持し、正確に…
Ichigoは、オープンソースのマルチモーダルAI音声アシスタントであり、音声とテキストのインターリーブされたシーケンスをリアルタイムで処理するために、混合モーダルモデルを採用しています。音声を直接離散トークンに量子化し、統一されたトランスフォーマーアーキテクチャを使用して音声とテキストを同時に処理します。
Zhipu AIの最新サウンドエフェクトモデル「CogSound」は、無音動画に魅力的なサウンドエフェクトを追加します。GLM-4Vの動画理解機能に基づき、CogSoundは動画に込められた意味や感情を正確に識別・理解し、無音動画のサウンドを向上させます。
AgentSquareは、清華大学のチームが開発した、大規模言語モデル(LLM)システム向けエージェントの自動探索と最適化のためのフレームワークです。標準化されたモジュールインターフェースの抽象化に基づいており、AIエージェントの高速な自己進化と適応的進化を可能にします。このフレームワークには、以下の機能が含まれています。
Fashion-VDMは、Googleとワシントン大学が共同開発した仮想試着技術で、ビデオ拡散モデル(VDM)に基づいています。この技術は、特定の衣服の画像に人物が着用した高品質な仮想試着画像と、その人物の動画を生成することができます。
Olly.botは、iMessageとSMSに統合されたパーソナルAIアシスタントです。OpenAIの大規模モデルに基づいており、ウェブ検索、文書分析、画像生成などの機能を提供します。Olly.botはダウンロードや登録が不要で、ユーザーの個人情報を収集せず、プライバシーを保護します。
AdaCache(アダプティブキャッシング)は、Meta社が開発したオープンソース技術で、AIによる動画生成プロセスを高速化します。AdaCacheのアダプティブキャッシングメカニズムは、コンピューティングリソースの割り当てを最適化し、さまざまな動画コンテンツの複雑さに基づいて計算負荷を動的に調整します。
CogVideoX v1.5 は、Zhipu が開発した最新のオープンソース AI ビデオ生成モデルです。このモデルには、CogVideoX v1.5-5B と CogVideoX v1.5-5B-I2V の 2 つのバージョンがあります。5B シリーズモデルは、768P 解像度で 5 秒から 10 秒の長さのビデオを 16 ビットで生成できます。
MiLoRAは、大規模言語モデル(LLM)向けのパラメータ効率の高い微調整手法であり、重み行列の二次特異点を更新することで計算コストとメモリコストを削減します。この手法は、特異値分解(SVD)に基づいて重み行列を主成分と副成分に分割します。
OpenCoderは、メルボルン大学、復旦大学、その他の大学の研究者らがInfinite Lightyearと共同で開発したオープンソースの大規模言語モデル(LLM)です。オープンソースLLMの性能を独自開発モデルと同等のレベルまで向上させ、コードAIの研究を推進します。
Infinity-MMは、北京人工知能研究院(BAAI)が公開した、数千万サンプルを含むマルチモーダルな学習データセットです。4300万サンプル、10TBのデータが含まれています。このデータセットは、高品質と多様性を確保するために品質フィルタリングと重複排除処理が施されており、オープンソースの画像処理技術の向上に貢献します。
FabricDiffusionは、Googleとカーネギーメロン大学が共同開発した、高精度な3D衣服生成技術です。実世界の2D衣服画像の質感やプリントを、任意の形状の高品質な3D衣服モデルに転写することができます。
HourVideoは、スタンフォード大学のFei-Fei Li氏とJia-Jun Wu氏のチームが開発した、長尺動画理解のベンチマークデータセットです。20分から120分までの長さの500本の1人称視点動画が含まれており、77種類の日常活動を網羅し、マルチモーダルモデルの性能評価に利用できます。
App Intentsは、Appleが導入した新しいフレームワークで、開発者がiOSやmacOSなどのプラットフォーム上でSiriやApple Intelligenceを統合し、アプリケーション機能やシステムエクスペリエンス(Siri、Spotlight検索、ショートカットなど)を実現できるようにするものです。
DimensionXは、香港科技大学、清華大学、BioNTechが共同開発したフレームワークです。ビデオ拡散技術に基づき、空間的・時間的な次元を精密に制御することで、単一画像から非常にリアルな3Dおよび4Dシーンを生成できます。
SeedEditは、ByteDanceのDoubao Big Modelチームが開発した汎用画像編集モデルです。レタッチ、衣服の差し替え、補正、スタイル変換、指定領域への要素の追加や削除など、シンプルな自然言語コマンドによる画像編集が可能です。
HK-O1awは、香港生成AI研究開発センター(HKGAI)傘下のAI for Reasoningチーム(HKAIR)と北京大学(PKU)のアライメントチームとの共同開発により、スローシンキングパラダイムに基づいた世界初の本格的な法的推論モデルです。
AnimePro FLUXは、Apache 2.0ライセンスに基づいたアニメ風画像生成モデルで、特に高品質な2Dイラストの生成を目的として設計されています。AnimePro FLUXは、Flux.1 Shnellモデルを改良したバージョンであり、DEV版のライセンス上の制限を克服しています。
VideoChatは、音声入力とリアルタイム会話をサポートするオープンソースのリアルタイムデジタルヒューマン対話システムです。ユーザーはデジタルヒューマンの外見と声をカスタマイズでき、トレーニングなしで音声クローンも可能です。最初のパケットの遅延は3秒と短く、以下のような用途に適しています。
TableGPT2は、浙江大学が開発した、表形式データの統合と処理を目的とした斬新な大規模マルチモーダルモデルです。構造化データを独立したモダリティとして学習する初のモデルであり、データベースやExcelファイルなどからのデータを直接理解し、操作することができます。
GenXDは、シンガポール国立大学とマイクロソフトが共同開発した3D-4D共創フレームワークです。任意の数の条件付き画像から高品質の3Dおよび4Dシーンを生成できます。このフレームワークは、データ処理ワークフローを使用してビデオからカメラデータを抽出します。
AlphaFold 3は、GoogleのDeepMindチームが開発したAIモデルで、タンパク質、核酸(DNAおよびRNA)、小分子、イオン、修飾残基などの生体分子の三次元構造を予測できます。このモデルは、構造予測において非常に高い精度を達成しています。
PDFMathTranslateは、科学論文などのPDFファイルを翻訳するために設計されたオープンソースのPDF文書翻訳ツールです。数式やグラフを含む元のレイアウトを保持します。PDFMathTranslateはバイリンガル比較をサポートし、元のレイアウトを維持します。