SleepFM - スタンフォード大学のオープンソースのマルチモーダル睡眠分析モデル
SleepFMは、スタンフォード大学が開発したオープンソースのマルチモーダル睡眠分析モデルです。14,000人以上の参加者から得られた100,000時間分の睡眠データに基づいて、脳活動、心電図、呼吸信号を統合することで、包括的な睡眠健康評価を提供します。
SleepFMは、スタンフォード大学が開発したオープンソースのマルチモーダル睡眠分析モデルです。14,000人以上の参加者から得られた100,000時間分の睡眠データに基づいて、脳活動、心電図、呼吸信号を統合することで、包括的な睡眠健康評価を提供します。
QA-MDT(Quality-aware Masked Diffusion Transformer)は、中国科学技術大学とiFlytekが共同開発したオープンソースの音楽生成モデルです。このモデルは、テキストによる説明に基づいて、高品質で音楽的に豊かな音楽を生成します。
上海人工知能研究所が開発したVchitect 2.0は、中国文化と東洋の美意識に沿った動画コンテンツを生成するために設計された、アップグレードされたオープンソースの動画生成モデルです。このモデルは、最大20秒の動画をサポートしています。
AI YouTube Shorts Generatorは、GPT-4、FFmpeg、OpenCVなどの技術を用いて長尺動画を自動的に分析し、最も魅力的な部分を抽出して短い動画形式にトリミングするオープンソースのAI動画編集ツールです。
PhotoPrismは、Go言語で書かれたオープンソースのAI写真管理ツールで、ユーザーに分散型の写真ストレージおよび整理ソリューションを提供するように設計されています。ユーザーは自身のハードウェア上で実行できるため、完全な制御権を得ることができます。
Claude Devは、Visual Studio Codeに統合されたAIプログラミングアシスタントです。AnthropicのClaude 3.5 Sonnetモデルをベースに、開発者に自動化されたプログラミング支援を提供します。Claude Devは、以下の内容を自動的に処理します...
FaceSwapは、ディープフェイク動画や画像を作成するために使用されるオープンソースのAIソフトウェアです。ディープラーニング技術に基づいており、動画や画像内の人物の顔を別の人物の顔に置き換えます。FaceSwapは…をサポートしています。
Seed-Musicは、ByteDanceが開発したAI音楽生成モデルで、ユーザーが録音した10秒間の音声データを完全な楽曲に変換します。ユーザーのマルチモーダル入力(スタイルなど)に基づき、自己回帰言語モデルと拡散手法を活用しています。
ConFinerは、複数の大学や研究機関によって開発された革新的な動画生成フレームワークです。既存の拡散モデルに関する専門知識を複数組み合わせることで、追加のトレーニングなしに高品質で一貫性のある動画コンテンツを生成します。
M2UGenは、Tencent PCG ARC Labsとシンガポール国立大学が共同開発した、高度なマルチモーダル音楽理解・生成フレームワークです。大規模言語モデル(LLM)の機能を組み合わせて、テキスト、画像、動画などを処理し、音楽の理解と生成を可能にします。
Nemotron-Mini-4B-Instructは、NVIDIAが開発したオープンソースの小型言語モデルで、ロールプレイング、検索拡張生成(RAG)、関数呼び出しタスク向けに最適化されています。このモデルは、蒸留、枝刈り、量子化といった技術を用いて最適化されています。
PoseTalkは、テキストと音声に基づくジェスチャー制御およびモーション精緻化手法を用いて、一度の処理で話す顔の動画を生成するオープンソースプロジェクトです。画像、音声、ジェスチャーから話す顔の動画を合成し、ユーザーに…
Follow-Your-Canvasは、テンセントのHunyuanチームが清華大学をはじめとする複数の機関と共同開発した高解像度動画拡張技術です。分散処理とレイアウト調整という2つのコア設計により、動画コンテンツを任意のサイズに拡張できます。
FilmfotosはDynamicWangが開発したLoRAモデルで、Fluxアーキテクチャをベースに、フィルムの質感や効果のシミュレートと再現に重点を置いています。彩度を抑えた、日本のフィルムのようなスタイルが特徴で、写真に柔らかく繊細でレトロな雰囲気をもたらします。
Faster Whisperは、OpenAI Whisperモデルをベースにした高効率な音声認識ツールで、CTranslate2エンジンを使用して高速な推論を実現しています。音声文字起こしの速度を向上させ、メモリ使用量を削減しながら、高い精度を維持します。
SwiftBrush V2は、改良されたトレーニング方法とモデル融合技術により、マルチステップの安定拡散モデルに匹敵する性能を実現する、シングルステップのテキストから画像への拡散モデルです。このモデルは、より優れた重み初期化を利用しています...
Jina-embeddings-v3は、Jina AIが開発した高度なテキスト埋め込みモデルで、多言語データ処理と長文テキストのコンテキスト検索タスク向けに設計されています。このモデルは5億7000万個のパラメータを持ち、最大8192個のトピックをサポートしています。
Click2Maskは、複雑なマスキングや詳細な説明を必要とせず、画像をクリックするだけで局所的な編集を実行できる高度な画像編集技術です。これは、マスクを動的に生成し、混合潜伏拡散(BLD)と組み合わせることで実現されます。
DrawingSpinUpは、香港城市大学の研究チームが開発した高度な3Dアニメーション生成技術です。2Dキャラクターのイラストを、元の絵のスタイルを維持しながら、ダイナミックな3Dアニメーションに変換します。
Qwen2.5-Coderは、アリババのQwenチームが開発した、オープンソースのコード言語モデルの開発を推進する包括的なコード生成モデルです。コード生成、コード推論、コード修正などのタスクにおいて非常に優れた性能を発揮します。このシリーズは、さまざまな分野を網羅しています。
Qwen2.5-Mathは、アリババのQwenチームが開発したオープンソースのAI数学モデルです。Qwen2-Mathのアップグレード版であり、中国語と英語の両方をサポートしています。このモデルは大規模な数学データで事前学習されており、CoT、PoT、TIR推論手法を組み合わせています。
Qwen2.5は、アリババ傘下のTongyi Qianwenチームがオープンソース化した最新かつ最も強力なAIモデルです。0.5B、1.5B、3B、7B、14B、32B、72Bなど、様々なパラメータスケールを持つモデルが用意されています。このモデルは、最先端の大規模事前学習技術を活用しています。
abab-video-1は、MiniMax初のAI搭載高解像度動画生成モデルです。最大解像度1280x720、フレームレート25fpsの高解像度動画生成に対応し、映画のようなカメラワーク効果や、テキスト説明に基づいた動画の高速生成機能などを備えています。
abab-music-1は、MiniMaxが開発した大規模なエンドツーエンドAI音楽生成モデルです。多機能なエンドツーエンド音楽生成をサポートし、インストゥルメンタルやアカペラなど様々な音楽形式の合成が可能で、伴奏やボーカルにも対応しています。