MoneyPrinterTurbo - オープンソースのAIショートビデオ生成ツール
MoneyPrinterTurboは、ユーザーが指定した動画テーマやキーワードに基づいて、動画のテキスト、素材、字幕、BGMを自動生成し、高画質のショート動画を作成するオープンソースのAIショート動画生成ツールです。このツールはAPIをサポートしています。
MoneyPrinterTurboは、ユーザーが指定した動画テーマやキーワードに基づいて、動画のテキスト、素材、字幕、BGMを自動生成し、高画質のショート動画を作成するオープンソースのAIショート動画生成ツールです。このツールはAPIをサポートしています。
iRAGは、Baiduが2024年のBaidu世界会議で発表したテキストベースの画像強調技術です。Baidu検索の膨大な画像リソースと強力な基本モデル機能を組み合わせることで、テキストベースの画像処理における大規模モデリングの課題を解決します。
Vidu 1.5は、クリエイターが自由に自己表現し、効率的に制作できるよう支援するためにShengshu Technologyが開発したAI動画生成プラットフォームの最新バージョンです。マルチモーダル動画モデルを搭載し、参照動画、画像生成動画、テキスト生成動画をサポートすることで、…
AgentReviewは、大規模言語モデル(LLM)に基づいたフレームワークであり、学術的な査読プロセスをシミュレートします。LLMプロキシを使用することで、AgentReviewは査読者、著者、分野責任者の役割をシミュレートし、研究者がプライバシーを尊重できるよう支援します。
CHANGERは、デジタルコンテンツ制作において、俳優の頭部をターゲットとなる身体にシームレスに合成するために使用される、産業グレードの超自然的なAIヘッドスワッピングおよびクロマキー合成技術です。視覚効果、デジタルヒューマン作成、仮想アバターに適しています。CHANGERはクロマキー合成技術に基づいています。
Kirokuは、ユーザーが文書を整理・作成するのを支援するマルチエージェントシステムです。創設者がスタンフォード大学での博士課程在学中に経験した学術論文執筆の経験に着想を得て開発されたKirokuは、学生と指導者の間のやり取りをシミュレートし、ユーザーが迅速に文書を作成できるよう支援します。
Vision Search Assistant (VSA) は、ビジュアル言語モデル (VLM) と Web エージェントを組み合わせることで、未知のビジュアルコンテンツを理解するモデルの能力を高めるフレームワークです。インターネット検索に基づいて、VLM が未知のコンテンツに関する質問を処理し、回答できるようにします。
MVDrag3Dは、マルチビュー生成と再構築の事前情報を組み合わせることで、柔軟で創造的なドラッグ&ドロップ編集を実現する革新的な3D編集フレームワークです。このフレームワークは、生成事前情報としてマルチビュー拡散モデルを使用し、複数のレンダリングされたビュー間で一貫性を確保します。
Chonkieは、テキスト処理向けに設計された、軽量で高速かつ機能豊富なRAG(Retrieval-Augmented Generation)チャンキングライブラリです。Chonkieは、トークン、単語、文、意味などに基づいた様々なチャンキング方法をサポートしています。
MSQA(Multi-modal Situated Question Answering)は、3Dシーンにおける具現化されたAIエージェントの理解力と推論能力を向上させるために設計された、大規模なマルチモーダル状況推論データセットです。このデータセットには、251,000組の質問と回答のペアが含まれており、…
Excalidrawは、クリーンで手描き風のスタイルとリアルタイムのコラボレーション機能を備えたオープンソースのオンライン描画ツールです。Excalidrawはブラウザ上で完全に動作し、インストールは不要で、複数のユーザーが同時に同じ図面を編集でき、エンドツーエンド暗号化を提供します。
RMBG-2.0は、BRIA AIの最新のオープンソース画像背景除去モデルです。高度なAI技術に基づき、高精度な前景と背景の分離を実現し、最先端(SOTA)レベルに達しています。RMBG-2.0は…
DeepSeek社のJanusシリーズ製品であるJanusFlowは、マルチモーダルな理解と生成タスクに使用されるモデルです。自己回帰言語モデルとキャリブレーションフロー技術を統合することで、単一モデル内で画像理解と生成を実現します。このフレームワークは、分離に基づいています...
SWE-Kitは、ソフトウェアエンジニアリングにおけるAIエージェントの開発プロセスを簡素化するComposioのオープンソースフレームワークです。SWE-Kitは、カスタムコードによるエージェント構築のためのヘッドレスIDE環境とAIネイティブツールを提供し、様々なエージェントタイプとの統合をサポートします。
Text Behind Imageは、画像内の人物の背後にテキストを追加できるオープンソースのオンラインツールです。視覚的にインパクトのあるポスターやソーシャルメディア画像を作成できます。ユーザーは、画像内の主要被写体の背後にカスタムテキストを追加できます。
雲金天張は、Caiyun TechnologyがDCFormerアーキテクチャに基づいて開発した汎用大型モデルです。DCFormerは、従来のTransformerモデルに比べて1.7~2倍の性能向上を実現しています。架空の世界を基にした雲金天張は、小説に…
MikuDanceは、拡散モデルに基づいたアニメーション生成技術であり、ハイブリッドモーションダイナミクスを統合して様式化されたキャラクターアートをアニメーション化します。MikuDanceは、ハイブリッドモーションモデリングとハイブリッド制御拡散技術を利用して、高ダイナミックなモーションとパラメータに対応します。
MATRIX-Genは、上海交通大学とオックスフォード大学の研究チームによって開発されたマルチエージェントシミュレーションシステムです。独立したアイデンティティと個性を持つ1000体以上のAIエージェントで構成される社会をシミュレートし、多様で高品質なトレーニングデータを生成します。
BodyTalkは、Panjaya社が開発したAI動画吹き替えツールです。生成AI技術に基づき、動画内の人物の声を他の言語に変換し、動画内の人物の表情や体の動きを自動的に調整し、新しい言語に自然にマッチさせます。
Codeium社が開発したWindsurfは、リアルタイムコラボレーション、マルチシステムサポート、強力なコンテキスト認識機能を備えたAIプログラミングツールです。Windsurfは、協調的なコパイロットと独立して動作するエージェントを組み合わせています。
OmniParseは、非構造化データを構造化された実用的なデータに変換するデータ解析プラットフォームであり、GenAI(大規模言語モデル)アプリケーション向けに最適化されています。OmniParseは、文書、表など、約20種類のファイル形式をサポートしています。
Promptimは、自動化されたプロセスを通じて特定のタスクにおけるAIシステムの提案性能を向上させる、実験的なAI提案最適化ライブラリです。ユーザーは初期提案、データセット、カスタム評価器を提供し、Promptimは自動的に最適化ループを実行します。
TinyTroupeは、Microsoftがリリースした実験的なPythonライブラリで、特定の性格、興味、目標を持つ人工エージェント(TinyPerson)をシミュレートし、シミュレートされた環境(TinyWorld)内で相互作用することを可能にします。TinyTroupeは…
Thinking Claudeは、ディープシンキングプロトコルとブラウザ拡張機能に基づき、Claude-3.5 AIモデルの「深層思考」能力を強化し、その思考ロジックを人間の思考ロジックに近づけるプロジェクトです。自然で、フィルターのかかっていないAIをサポートします。