CustomCrafter - テンセントと浙江大学が共同開発したカスタムビデオ生成フレームワーク
CustomCrafterは、テンセントと浙江大学が共同で開発したカスタム動画生成フレームワークです。テキストプロンプトと参照画像に基づいて高品質でパーソナライズされた動画を生成できるだけでなく、モーション生成やコンセプト構成の機能も備えています。
CustomCrafterは、テンセントと浙江大学が共同で開発したカスタム動画生成フレームワークです。テキストプロンプトと参照画像に基づいて高品質でパーソナライズされた動画を生成できるだけでなく、モーション生成やコンセプト構成の機能も備えています。
LitServeは、FastAPIをベースとした高性能AIモデル展開エンジンであり、エンタープライズグレードのAIサービス向けに特化して設計されています。バッチ処理、ストリーミング処理、およびGPUの自動スケーリングをサポートし、モデル展開プロセスを簡素化します。
LongVILAは、NVIDIA、MIT、カリフォルニア大学バークレー校、テキサス大学オースティン校が共同開発した、長尺動画理解のための視覚言語AIモデルです。共同アルゴリズムとシステム設計により、多数のGPU上で高いパフォーマンスを実現しています。
AutoShortsは、AI技術を用いてワンクリックで顔のない動画を生成・カスタマイズできるオープンソースのAI動画作成・公開プラットフォームです。AutoShortsは、カスタムスクリプト、ナレーション、視覚効果をサポートし、YouTubeやTierに毎日新しい動画を自動的に公開します。
MARS5-TTSは、CAMB.AIが開発したオープンソースのAI音声クローンツールです。画期的なほどリアルな韻律を誇り、140以上の言語に対応しています。スポーツ解説やアニメーションのAIナレーションなど、複雑な韻律シナリオにも対応可能です。MARS5-TTSには、1つの言語と140以上の言語に対応しています。
HeadGAPは、ByteDanceと上海科技大学が共同開発した3Dアバター生成モデルです。少数の画像のみを使用して、リアルな3Dアバターを高速に生成します。大規模なマルチビュー動的データに基づいた、事前学習とパーソナライズされた作成フェーズのフレームワークを採用しています。
LeRobotは、HuggingFaceが立ち上げたオープンソースのAIチャットボットプロジェクトで、元テスラの研究員であるレミ・カデネ氏が率いています。LeRobotは、事前学習済みモデルやデータなどを提供することで、ロボット工学への参入障壁を下げることを目指しています。
LMMs-Evalは、マルチモーダルAIモデル向けに特別に設計された統合評価フレームワークであり、モデル性能評価のための標準化された、広範囲を網羅した、費用対効果の高いソリューションを提供します。50以上のタスクと10以上のモデルを含み、透明性の高い評価を実現します。
OmniCorpusは、86億枚の画像と1兆6960億個のテキストタグを含む大規模なマルチモーダルデータセットで、中国語と英語の両方をサポートしています。上海人工知能研究所と複数の著名な大学および研究機関が共同で構築しました。OmniCorpusは…
MooERは、Moore Threads社が開発し、国内生産のフル機能GPUで学習させた、業界初のオープンソース音声理解モデルです。中国語と英語の音声認識だけでなく、中国語から英語への音声翻訳機能も備えています。
EasyOCRは、中国語、アラビア語、キリル文字など80以上の言語と複数の文字体系をサポートする強力なオープンソースOCR(光学文字認識)プロジェクトです。ディープラーニング技術に基づいており、高精度のテキスト認識を提供します。
StockBotは、Llama3をベースにしたAI搭載の金融エージェントで、リアルタイムの株価情報、金融データ、ニュース、インタラクティブなチャートを提供します。株式、外国為替、債券、仮想通貨など、複数の資産市場に対応しています。ユーザーは自然な言葉で操作できます。
GptEngineerは、AI技術を用いて簡単なテキストプロンプトからWebアプリケーションのプロトタイプを迅速に生成するオープンソースツールです。ユーザーは要件を説明するだけで、AIが自動的にコードを生成して実行します。GitHubとの同期やワンクリックでの操作にも対応しています。
Imagine Yourselfは、Meta社が開発したパーソナライズされたAI画像生成モデルです。従来の手法の限界を打ち破り、ユーザーごとに個別に調整する必要性をなくし、単一のモードで多様なユーザーニーズに対応します。このモデルは…
STranslateは、Windowsユーザー向けに特別に設計された多機能翻訳およびOCRツールです。複数の言語をサポートし、単語のハイライト表示、スクリーンショット、クリップボードの監視など、さまざまな翻訳方法を備え、複数の翻訳サービスへのインターフェースを提供します。また、基本的な機能も備えています。
BarkはSuno AIが開発したオープンソースのテキスト音声変換モデルで、リアルな多言語音声や音楽、背景雑音などの様々な種類の音声を生成するだけでなく、笑い声や泣き声といった非言語コミュニケーションもサポートしています。Barkは事前学習済みのモデルを提供しています。
LTM-2-miniは、Magic Technologies社が開発したコンテキストAIモデルで、1億トークンをサポートし、1,000万行のコードまたは750冊の小説に相当するコンテンツを処理できます。LTM-2-miniはシーケンス次元アルゴリズムを使用しており、Llama 3.1 405よりも計算効率が優れています。
eSearchは、スクリーンショット、OCR認識、検索と翻訳、画像貼り付け、画像検索、画面録画などの機能を統合した、オープンソースのクロスプラットフォームAIデスクトップアプリケーションです。eSearchはElectronフレームワークに基づいて開発されており、Linux、Windowsなどに対応しています。
VectorVeinは、オープンソースのノーコードAIワークフローツールです。プログラミングの知識を必要とせず、シンプルなドラッグ&ドロップ操作でインテリジェントなワークフローを構築し、日常業務を自動化できます。データ処理、分析、および…をサポートしています。
Sapiensは、Meta Labsが開発したAIビジョンモデルで、画像や動画における人間の動きを理解することに特化して設計されています。2D姿勢推定、身体部位のセグメンテーション、深度推定、表面法線予測などのタスクをサポートし、視覚変換技術を活用しています。
OpenCityは、香港大学、華南理工大学、Baiduが共同開発した交通予測モデルです。OpenCityはTransformerアーキテクチャとグラフニューラルネットワークを採用し、大規模な事前学習を通じて交通データの時空間的な依存関係を学習します。
EagleはNVIDIAが開発したマルチモーダル大規模モデルで、最大1024×1024ピクセルの画像処理に優れ、視覚的な質問応答と文書理解能力を大幅に向上させます。Eagleモデルはマルチエキスパート視覚エンコーダーアーキテクチャを採用し、シンプルかつ効率的な処理を実現しています。
PGTFormerは、解析されたガイド付き時間的一貫性変換によって時間的一貫性を高めながら、動画内の高忠実度の詳細を復元する高度な動画顔復元フレームワークです。この方法は事前の位置合わせを必要とせず、最も...
HivisionIDPhotoは、軽量なAI搭載型ID写真作成ツールです。背景をインテリジェントに認識して切り抜き、様々な仕様に対応したID写真を素早く生成します。背景の色やサイズをカスタマイズできるほか、今後は美肌フィルターなどの機能も追加予定です。