EmbodiedGen - 身体化された知能アプリケーションのための生成型3Dワールドエンジン
EmbodiedGenは、エンボディドAIアプリケーション向けの生成型3Dワールドエンジンおよびツールキットです。高品質で低コスト、かつ物理的に妥当な3Dアセットとインタラクティブな環境を迅速に生成できるため、研究者の作業を支援します。
EmbodiedGenは、エンボディドAIアプリケーション向けの生成型3Dワールドエンジンおよびツールキットです。高品質で低コスト、かつ物理的に妥当な3Dアセットとインタラクティブな環境を迅速に生成できるため、研究者の作業を支援します。
EX-4Dは、ByteDanceの子会社であるPicoが開発した新しい4Dビデオ生成フレームワークです。単眼ビデオ入力を使用して、極端な視点から高品質な4Dビデオを生成できます。このフレームワークは、独自のDeep Waterproof Mesh(DW-Mesh)に基づいています。
LinGenは、プリンストン大学とMetaが共同開発した、テキストからビデオへの変換を行うための新しいフレームワークです。このフレームワークは、従来の拡散変換モジュールに代わる、線形複素数MATEモジュール(MA分岐とTE分岐を含む)に基づいています。
Midjourney V1は、Midjourney初のAI動画生成モデルです。静止画像を動画に変換できます。ユーザーは画像をアップロードするか、Midjourney内で「アニメーション」ボタンを使用して画像を生成できます。
Animated Drawingsは、Meta AIが開発したオープンソースツールで、AI技術を用いて手描きの肖像画を自動的にアニメーションに変換します。Animated Drawingsは、絵の中の人物を検出・分割できるツールとアルゴリズムを包括的に提供します。
MiDashengLMは、Xiaomiがオープンソース化した高効率オーディオ理解モデルであり、具体的にはMiDashengLM-7Bバージョンです。このモデルは、Xiaomi DashengオーディオエンコーダーとQwen2.5-Omni-7B Thinkerデコーダーをベースに構築されています。
LangExtractは、Googleが開発したオープンソースのPythonライブラリで、非構造化テキストから構造化情報を抽出します。LangExtractは大規模言語モデル(LLM)を使用して、臨床記録やレポートなどの資料を自動的に処理し、情報を識別して整理します。
Qwen-Imageは、アリババ同義千文チームが開発したオープンソースの20パラメータMMDiTモデルです。同義千文シリーズ初の基本的な画像生成モデルであり、複雑なテキストレンダリングと精密な画像編集に優れ、複数行のテキストにも対応しています。
AudioGen-Omniは、Kuaishouが開発したマルチモーダルオーディオ生成フレームワークです。このフレームワークは、ビデオやテキストなどの入力に基づいて、高品質のオーディオ、音声、楽曲を生成できます。このフレームワークは、統合された歌詞テキストエンコーダーと位相整合異方性…を利用しています。
GPT-OSSは、OpenAIが発表したオープンソースの推論モデルシリーズで、gpt-oss-120bとgpt-oss-20bの2つのバージョンがあります。gpt-oss-120bは1170億個のパラメータを持ち、そのうち約51億個のパラメータが有効になっており、80GBのGPU1基で実行可能です。
Genie 3は、GoogleのDeepMindが開発した次世代のユニバーサルワールドモデルで、リアルタイムで非常にダイナミックかつ一貫性のある仮想世界を生成できます。このモデルは、物理現象、自然生態系、ファンタジーシーン、歴史的シナリオなどをシミュレートでき、…
Claude Opus 4.1は、Anthropic社が開発した最新の大規模言語モデルであり、Claude Opus 4のアップグレード版です。このモデルは、推論品質、命令への準拠性、全体的なパフォーマンスなど、いくつかの側面で最適化および改善されています。
Chunkrは、Lumina AIが提供するオープンソースのドキュメント処理APIで、特にRAG(検索拡張生成)および知識ベースのシナリオ向けに設計されています。Chunkrは、複雑なドキュメント(PDF、PPT、Word文書、画像など)を構造化されたドキュメントに変換できます。
dots.vlm1は、Xiaohongshu氏のhi研究室がオープンソース化した初のマルチモーダル大規模モデルです。12億個のパラメータを持つNaViTビジュアルエンコーダをゼロから学習させ、DeepSeek V3大規模言語モデル(LLM)をベースに構築されており、強力な視覚認識能力を備えています。
Qwen-Flashは、Alitongyi QianwenがリリースしたQwen3シリーズのFlashモデルで、バージョン番号はqwen-flash-2025-07-28です。このモデルは、汎用性、推論能力、中国語と英語の知識処理能力、エージェント機能において大幅な改善が施されています。
Speech 2.5はMiniMaxが開発した次世代音声生成モデルで、多言語表現力、音色再現性、対応言語数において飛躍的な進歩を遂げています。このモデルは40言語に対応し、様々な言語やアクセントを正確に再現できます。
GPT-5はOpenAIの最新の人工知能モデルであり、現在利用可能なモデルの中で最も強力で、すべてのユーザーに公開されています。GPT-5は、一般的な質問に答えるための基本モデル、深層推論モデル(...
WeKnoraは、Tencentが開発したオープンソースの文書理解および意味検索フレームワークで、大規模言語モデル(LLM)に基づいています。このフレームワークはモジュール設計を採用し、マルチモーダル文書解析(PDF、Word、画像など)をサポートし、RAG(Retrieval Augmentation Array)を利用しています。
LandPPTは、AIを活用したプレゼンテーション作成プラットフォームで、ドキュメントコンテンツをプロフェッショナルなPPTプレゼンテーションに素早く変換できます。LandPPTは、OpenAI、Claude、Geminiなど複数のAIモデルをサポートし、PDF、Word、Markdownなどのフォーマットに対応しています。
GitMCPは、GitHubリポジトリ(コードベースやGitHubページを含む)をリアルタイムのドキュメントセンターに変換するオープンソースのリモートModel Context Protocol(MCP)サーバーであり、AIツール(Cursorなど)がドキュメントに直接アクセスして公開することを可能にします。
NeuralAgentは、キーボード入力、マウスクリック、ブラウザナビゲーション、フォーム入力、メール送信などのさまざまな複雑なタスクを自然言語コマンドで自動化するオープンソースのデスクトップAIパーソナルアシスタントです。NeuralAgentは…
self-llm(Open Source Large Model Usage Guide)は、Datawhaleが中国の初心者向けに作成したオープンソースの大規模モデルチュートリアルです。Linuxプラットフォームをベースに、環境設定からモデルのデプロイと微調整まで、LLaMAを含む包括的なガイドを提供します。
Glassは、Pickleチームが開発したオープンソースのステルス型AIデスクトップアシスタントです。Glassは、画面の内容と音声をリアルタイムでバックグラウンドでキャプチャし、構造化された知識に変換します。Glassの主要機能には、リアルタイムの会議録画、自動要約などが含まれます。
WrenAIは、Canner社が開発したオープンソースのビジネスインテリジェンスAIエージェントツールです。自然言語による対話を通じて、複雑なSQLコードを記述することなく、構造化データを迅速にクエリ、分析、視覚化できます。ユーザーは、以下のツールを使用するだけで済みます。