Graphiti - オープンソースのAI動的知識グラフ生成フレームワーク
Graphitiは、動的な環境向けに設計されたAI知識グラフ生成フレームワークであり、AIエージェントがクエリ可能で時間認識型の知識ネットワークを構築することを可能にします。Graphitiは、構造化データと非構造化データをリアルタイムで取り込み、処理することができます。
Graphitiは、動的な環境向けに設計されたAI知識グラフ生成フレームワークであり、AIエージェントがクエリ可能で時間認識型の知識ネットワークを構築することを可能にします。Graphitiは、構造化データと非構造化データをリアルタイムで取り込み、処理することができます。
MedGemmaは、Googleが開発したオープンソースのAIモデルで、医療画像とテキストの分析に特化して設計されています。Gemma 3アーキテクチャをベースに、40億パラメータのマルチモーダルモデルと270億パラメータのプレーンテキストモデルを搭載しています。40億パラメータモデルは、医療画像の解釈に優れています。
Context7はUpstashが提供するAIツールで、大規模言語モデル(LLM)やAIコードエディタ向けに、最新かつバージョン固有のドキュメントとコードスニペットを提供します。ドキュメントの解析、コンテンツの拡充、ベクトル化、再配置などを行うことで機能します。
DreamGenは、NVIDIAが開発した革新的なロボット学習技術で、AIビデオワールドモデルに基づいて合成データを生成し、ロボットが「夢」のような環境で新しいスキルを学習できるようにします。DreamGenは少量の実際のビデオデータのみを必要とし、大量のデータを生成できます。
Devstralは、Mistral AIとAll Hands AIが開発したプログラミング特化型モデルで、ソフトウェアエンジニアリングタスク向けに設計されています。Devstralは、現実世界のソフトウェア問題を解決することに優れており、SWE-Bench Verifiedベンチマークで高いスコアを獲得しています。
MMaDA(Multimodal Large Diffusion Language Models)は、プリンストン大学、清華大学、北京大学、ByteDanceによって開発されたマルチモーダル拡散モデルです。テキスト間推論、マルチモーダル理解、テキスト...
MoviiGen 1.1は、ZulutionAIが開発した、映画品質の動画生成に特化したAIモデルです。Wan2.1をベースに改良を重ね、プロの映画制作者やAIGCクリエイターによって60の美的側面から評価され、その優れた性能が実証されています。
ScrapeGraphAIは、大規模言語モデル(LLM)を基盤としたインテリジェントなWebクローラーツールキットで、さまざまなWebサイトやHTMLコンテンツから構造化データを効率的に抽出することに重点を置いています。主な機能は3つあります。SmartScraperは…
Claude 4は、Anthropic社が開発した次世代AIモデルで、Claude Opus 4とClaude Sonnet 4から構成されています。Opus 4は現在、世界で最も強力なプログラミングモデルであり、複雑なタスクや長時間の実行処理において優れた性能を発揮します。
Joy Industrialは、JD Industryがサプライチェーンを中心に構築した、業界をリードする初の大規模産業モデルです。産業シナリオを対象とし、JD Industryがインテリジェント産業サプライチェーン分野で培ってきた経験とデータ蓄積を、「産業ビッグデータ」の概念に基づいて活用しています。
SurfSenseは、NotebookLMやPerplexityに似たオープンソースのAI研究ツールですが、より高い拡張性を備えています。検索エンジン、Slack、Notion、YouTube、GitHubなど、さまざまな外部データソースと連携できます。
Vid2Worldは、清華大学と重慶大学が共同開発した革新的なフレームワークです。これは、完全なシーケンスで非因果的な受動的なビデオ拡散モデル(VDM)を、自己回帰的でインタラクティブな、行動条件付きのワールドモデルに変換することをサポートします。このモデルは、…に基づいています。
Pixel Reasonerは、ウォータールー大学、香港科技大学、中国科学技術大学などの機関によって開発された視覚言語モデル(VLM)です。ピクセル空間推論に基づいて、視覚情報を理解し、推論するモデルの能力を向上させます。
MTVCrafterは、中国科学院深圳先進技術研究院のコンピュータビジョン・パターン認識研究所や中国電信人工知能研究所など複数の機関によって開発された、斬新な人物画像アニメーションフレームワークです。オリジナルの3Dモーションシーケンスに基づいています。
Morphikは、高度な技術文書や視覚的に豊かな文書を処理するために設計されたオープンソースのマルチモーダル検索拡張生成(RAG)ツールです。画像、PDF、動画など、さまざまな文書形式の検索をサポートし、ColPalなどの技術を活用しています。
AgenticSeekは、完全にローカライズされたオープンソースのAIアシスタントであり、Manusのオープンソース代替品です。AgenticSeekは、Webブラウジング、コード作成、複雑なプロジェクトの計画など、ローカルデバイス上で自律的にタスクを実行できます。すべてのデータと...
Slidevは、MarkdownとVueの技術スタックに基づいて構築されたオープンソースのスライドショー作成ツールです。シンプルなMarkdown構文を使ったスライドショー作成をサポートし、コードのハイライト表示、リアルタイムのコードデモンストレーション、数式のレンダリングなど、豊富な機能を備えています。
カンパニーリサーチエージェントは、マルチエージェントフレームワークに基づいた企業調査ツールであり、ワンクリックで包括的な企業調査レポートを自動生成できます。このツールは、企業ウェブサイト、ニュース記事、財務報告書、業界分析など、複数の情報源からのデータを活用します。
Direct3D-S2は、南京大学、DreamTech、復旦大学、オックスフォード大学の研究者らが共同開発した高解像度3D生成フレームワークです。疎なボリューム表現と革新的な空間疎アテンション(SSA)メカニズムに基づいています。
QwenLong-L1-32Bは、アリババグループのQwen-Docチームがオープンソース化した最初の大規模長文推論モデルです。このモデルは、段階的な文脈拡張、コース誘導型強化学習、難易度を考慮した回顧的サンプリング戦略に基づいており、…
LMEvalは、大規模モデル(LLM)のベンダー横断的な評価を簡素化するためにGoogleが開発したオープンソースのフレームワークです。このフレームワークは、マルチモーダル(テキスト、画像、コード)およびマルチメトリック評価をサポートしており、Google、OpenAI、Anthropicなどと互換性があります。
LLaDA-Vは、中国人民大学ヒルハウス人工知能研究所とアントグループが開発したマルチモーダル大規模言語モデル(MLLM)です。純粋な拡散モデルアーキテクチャに基づいており、視覚的な指示の微調整に重点を置いています。このモデルは、LLaDAをベースに、視覚的な要素を導入することで構築されています。
PC Agent-Eは、上海交通大学とSIIが共同開発した高効率なインテリジェントエージェントトレーニングフレームワークです。このフレームワークは、312の人間が注釈を付けたコンピュータ使用軌跡を使用して、クロード3.7ソネットモデルに基づいて多様な行動決定を合成し、大幅に効率化します。
CAR(Certainty-based Adaptive Reasoning)は、ByteDanceと復旦大学が共同開発した適応型推論フレームワークです。大規模言語モデル(LLM)およびマルチモーダル大規模言語モデル(MLLM)の様々なタスクにおける性能を向上させます。