AutoAgentsは、大規模言語モデル(LLM)に基づいた自動エージェント生成フレームワークです。ユーザー定義の目標に基づいて複数のエキスパート役割エージェントを自動的に生成し、複雑なタスクで連携できるようにします。このプロジェクトは、インテリジェントオートメーションを活用しています。
AutoAgentsは、大規模言語モデル(LLM)に基づいた自動エージェント生成フレームワークです。ユーザー定義の目標に基づいて複数のエキスパート役割エージェントを自動的に生成し、複雑なタスクで連携できるようにします。このプロジェクトは、インテリジェントオートメーションを活用しています。
RSIDiffは、テキストから画像への拡散モデルのパフォーマンスを向上させるための再帰的自己学習(RSI)フレームワークです。モデル自体が生成したデータに基づいてモデルを学習させることで、モデルを反復的に最適化し、従来の自己学習でよく見られる学習クラッシュ問題を解決します。
LLaDA(Large Language Diffusion with mAsking)は、中国人民大学高陵AI学院・アリグループに所属する李崇軒教授と温継栄教授のチームが共同開発した、斬新な大規模言語モデルです。拡散モデルフレームワークに基づいています。
エージェント推論は、大規模言語モデル(LLM)の推論能力を強化するためにオックスフォード大学が開発したフレームワークです。ウェブ検索、コード実行、構造化メモリなどの外部ツールを統合することで、複雑な多段階推論問題を解決します。
RuiPathは、上海交通大学医学院附属瑞金病院とファーウェイが共同開発した、臨床グレードの国産マルチモーダルインタラクティブ病理モデルです。このモデルは、中国における年間全がん症例の90%をカバーしています。
Step-Audio-TTS-3Bは、Stepfun-AIチームが開発した高性能テキスト音声合成(TTS)モデルで、強力な音声合成機能を誇ります。膨大な量の合成データで学習されており、30億個のパラメータを備え、自然で流暢な音声を生成できます。
CLaMP 3は、清華大学人工知能学院の朱文武教授の研究チームが開発した、マルチモーダルかつ多言語対応の音楽情報検索フレームワークです。対照学習に基づき、楽譜(ABC記号など)、音声(MERT特徴量など)、演奏情報などを統合しています。
SWE-Lancerは、OpenAIが立ち上げた大規模なモデルベンチマークであり、フリーランスのソフトウェアエンジニアリングタスクにおける最先端の言語モデル(LLM)のパフォーマンスを評価します。Upworkからの1400以上のタスクが含まれており、総額は100ドルです。
DynamicCityは、上海AIラボが開発した、大規模な動的シーン生成のための4D生成フレームワークです。DynamicCityは、意味情報を含む動的なLiDARシーンの生成に特化しており、大規模な空間シーン(80×80×6.4 m³)を処理できます。
MoBA(Mixture of Block Attention)は、Moonshot AIが提案した新しいアテンションメカニズムで、長文コンテキストタスクを処理する際の大規模言語モデル(LLM)の効率を向上させます。これは、コンテキストを複数のブロック(bl...)に分割することで機能します。
ToddlerBotは、スタンフォード大学が開発したオープンソースの機械学習およびヒューマノイドロボットプラットフォームで、モーション操作を目的としており、大規模で高品質なトレーニングデータを効率的に収集できるように設計されています。ToddlerBotは30の自由度を持ち、Dyn...
Phantomは、ByteDanceのインテリジェントクリエーションチームが開発した、被写体から動画(S2V)を生成するためのフレームワークです。クロスモーダルアライメント技術に基づき、テキストと画像の手がかりを組み合わせることで、参照画像から主要な被写体を抽出します。
Aiderは、ターミナルと大規模言語モデル(LLM)を使用して効率的なコード編集と開発を可能にする、オープンソースのAI支援プログラミングツールです。Aiderは、Python、JavaScript、TypeScriptなど、複数のプログラミング言語をサポートしています。
TongGeometryは、北京総合AI研究所と北京大学AI研究所が共同開発した、ツリー探索に基づく幾何モデルです。オリンピックレベルの幾何問題を提起・解決するために特別に設計されています。TongGeometryは効率的な探索に基づいています...
Magmaは、Microsoft Researchが開発した新しいマルチモーダルAI基盤モデルであり、マルチモーダルAIエージェントに汎用的な機能を提供します。Magmaは、デジタル環境と物理環境の両方を網羅するマルチモーダル入力を用いてタスクを理解し、実行することができます。
FluentReadは、ネイティブスピーカーのような読書体験をユーザーに提供することに特化したオープンソースのブラウザ翻訳プラグインです。高度なAI技術に基づき、FluentReadは従来の機械翻訳やAI翻訳など、複数の翻訳エンジンをサポートしています。
Museは、マイクロソフト初のゲームアイデア生成のための生成型AIモデルであり、「ワールド・アンド・ヒューマン・アクション・モデル」(WHAM)に基づいています。Museは、人間のゲームプレイから学習することで、ゲームのビジュアルやコントローラーの動作を生成できます。
HealthGPTは、浙江大学、中国電子科技大学、アリババなどが共同開発した高度な医療画像言語モデル(Med-LVLM)です。異種知識適応技術を活用し、医療画像の理解と生成タスクを実現します。
PaliGemma 2 Mixは、Google DeepMindが開発した最新のマルチタスク視覚言語モデル(VLM)です。様々な画像処理機能と言語処理機能を統合しており、画像記述、物体検出、画像セグメンテーション、OCR、文書理解などをサポートします。
FlexTokは、スイス連邦工科大学ローザンヌ校(EPFL)とApple社が共同開発した画像処理技術です。2次元画像を1次元の離散トークンシーケンスにリサンプリングすることで、柔軟な長さの記述を可能にします。
Helixは、Figure社が開発した、ヒューマノイドロボットを制御するための汎用的な視覚・言語・動作(VLA)モデルです。Helixは、ロボットの上半身全体(手首、胴体、頭部、指を含む)の高速制御を先駆けて実現しました。
BioEmuは、Microsoft Researchが開発した生成型深層学習システムであり、タンパク質の動的構造と平衡コンフォメーションを効率的にシミュレートします。単一のGPU上で1時間に数千ものタンパク質構造サンプルを生成でき、従来の分子動力学シミュレーションの効率をはるかに凌駕します。
OSUM(Open Speech Understanding Model)は、西北工業大学コンピュータサイエンス学部の音声・言語処理研究グループによって開発されたオープンソースの音声理解モデルです。OSUMは、WhisperエンコーダとQwen2 LLMを組み合わせています。
Crawl4LLMは、清華大学とカーネギーメロン大学が共同開発したオープンソースのインテリジェントWebクローラーシステムで、大規模言語モデル(LLM)の事前学習の効率向上を目的としています。Crawl4LLMは、LLMの事前学習におけるWebページの価値をインテリジェントに評価し、クロールするWebページの優先順位を決定します。