Video Alchemist - マルチエージェントによるオープンアンサンブルパーソナライゼーション機能を備えたAIビデオ生成モデル。
Video Alchemistは、Snapなどの企業が開発した新しい動画生成モデルです。マルチ被写体、オープンセットのパーソナライゼーション機能を備え、テスト中に最適化を必要とせずに、テキストプロンプトと参照画像に基づいて動画を生成できます。このモデルは…
Video Alchemistは、Snapなどの企業が開発した新しい動画生成モデルです。マルチ被写体、オープンセットのパーソナライゼーション機能を備え、テスト中に最適化を必要とせずに、テキストプロンプトと参照画像に基づいて動画を生成できます。このモデルは…
PSHumanは、高度な単一画像3Dポートレート再構築技術です。クロススケールマルチビュー拡散モデルに基づいて、1枚の写真から、詳細な表情や全身のポーズを含む、非常にリアルな3Dポートレートモデルを生成できます。その最大の強みは…
Wear-Any-Wayは、アリババの淘宝画像検索チームが開発した革新的な仮想試着フレームワークです。疎な対応関係アライメントメカニズムにより、高精細でカスタマイズ可能な仮想試着効果を実現します。ユーザーはリアルな試着画像を生成できます。
GameFactoryは、香港大学とKuaishou Technologyが共同で提案した革新的なフレームワークで、ゲームビデオ生成におけるシーン一般化の問題を解決します。このフレームワークは、事前学習済みのビデオ拡散モデルをベースに、オープンドメインのビデオデータと小規模で高品質な画像を組み合わせています。
Step-2 miniは、Step-Starが発売した軽量・高速大型モデルで、次世代の自社開発アテンションアーキテクチャMFAをベースに開発されました。Step-2の80%以上の性能を維持しながら、パラメータはわずか3%に削減されており、性能が大幅に向上しています。
FramePainterは、AIベースのインタラクティブな画像編集ツールで、ビデオ拡散モデルと直感的なスケッチ操作を組み合わせることで、ユーザーは簡単な描画、クリック、ドラッグ操作によって編集意図を示すことができ、画像を自在に操作できます。
Bailingは、自動音声認識(ASR)、音声活動検出(VAD)、大規模言語モデル(LLM)、テキスト音声合成(TTS)技術を使用して、ユーザーとの自然な音声対話を実現し、ほぼ普遍的な音声対話を実現するオープンソースの音声対話アシスタントです。
LineArtは、吉林大学、スウェーデン王立工科大学、東京工業大学が共同開発した、トレーニング不要の高品質なデザイン図面外観転送フレームワークです。複雑な外観特性を詳細なデザイン図面に転送できるため、デザイナーの作業を支援します。
SynthLightは、イェール大学とAdobe Researchが共同開発したポートレート写真のライティング技術です。拡散モデルに基づいており、さまざまな照明条件下でシミュレートされた合成データを使用してトレーニングされ、ポートレート写真を再レンダリングします。
X-Dynaは、拡散モデルに基づいたアニメーション生成フレームワークです。動画内の顔の表情や体の動きを制御することで、単一の人物画像をアニメーション化し、リアルで環境認識に優れたダイナミックな効果を生み出します。その中核となるのはDynam...
DeepSeek-R1は、杭州に拠点を置くDeepSeek社が開発した高性能AI推論モデルであり、OpenAIのO1公式リリースに匹敵する性能を持つ。DeepSeek-R1推論モデルは、大規模な強化学習技術を用いて事後学習されており、非常に少ないリソースで済む。
k1.5は、Moonlit Dark Side Technology社が発表した最新のマルチモーダル思考モデルであり、強力な推論能力とマルチモーダル処理能力を備えています。ショートCoT(短連鎖思考)モードでは、数学、コード、視覚のマルチモーダル能力、および汎用能力において著しい進歩が見られます。
OmniThinkは、浙江大学とアリババの同義研究所が共同開発した革新的な機械筆記フレームワークです。人間の反復的な拡張と反省のプロセスをシミュレートすることで、機械筆記における大規模言語モデルの知識の限界を打ち破ります。このフレームワークは…
H-Optimus-0は、フランスのスタートアップ企業Bioptimusがリリースした、病理学分野における世界最大のオープンソースAIモデルです。このモデルは11億個のパラメータを持ち、4,000の臨床現場から収集された500件のデータを含む独自のデータセットで学習されています。
Roop-Unleashedは、Roopをベースとしたオープンソースプロジェクトで、ディープフェイク技術の実装と最適化に重点を置いています。ユーザーは、複雑な学習プロセスを経ることなく、画像や動画内の顔を素早く置き換えることができます。
「舒生・普祥」アルゴリズムは、上海人工知能研究所が香港中文大学、浙江大学などの研究機関と共同で開発した超高ダイナミックレンジ画像処理アルゴリズムです。その中核となるのは普祥HDR(UltraFusion HDR)です。このアルゴリズムは、AIGC技術とHDR技術を組み合わせたものです。
DeepSeek R1-Zeroは、DeepSeekチームが開発した推論モデルで、教師ありファインチューニング(SFT)データを一切使用せず、純粋な強化学習(RL)トレーニングのみに依存しています。推論タスクにおいて非常に優れた性能を発揮し、AIME 2024で高得点を獲得しました。
VideoWorldは、北京交通大学、中国科学技術大学、ByteDanceが共同で実施する研究プロジェクトです。このプロジェクトでは、深層生成モデルが、ラベル付けされていない動画データのみから、ルールを含む複雑な知識を学習できるかどうかを検証します。
Step-1o Visionは、Step-1oの最新のネイティブなエンドツーエンドのマルチモーダル生成・理解統合モデルのビジュアル版です。視覚タスクに特化しており、強力な画像認識、知覚、推論、および指示追従機能を誇ります。
3DIS-FLUXは、ディープラーニングに基づくマルチインスタンス生成フレームワークであり、分離インスタンス合成によって高品質な画像生成を実現します。3DISフレームワークの深度駆動型シーン構築とFLUXモデルの拡散トランスフォーマーアーキテクチャを組み合わせ、2段階で実装されています。
DITTO-2は、Adobeとカリフォルニア大学の研究者が共同開発した革新的な音楽生成モデルです。拡散モデルの推論時間を最適化することで、高速かつ制御可能な音楽生成を実現します。このモデルは、拡散モデルの推論時間を最適化することに基づいています。
DiffEditorは、北京大学深圳大学院とテンセントPCGの研究チームが提案した、拡散モデルに基づいた画像編集ツールです。画像プロンプトとテキストヒントを導入しています。
Textoonは、アリババグループのTongyi Labが立ち上げた革新的なプロジェクトで、テキストプロンプトに基づいてLive2D形式の2D漫画キャラクターを生成する初の手法です。高度な言語モデルとビジュアルモデルに基づいて、多様なキャラクターを生成できます。
Ziyue-o1は、NetEase Youdaoが中国で初めてリリースした、段階的な説明を出力する推論モデルです。このモデルは、コンシューマー向けグラフィックカード向けに特別に設計された14Bの軽量アーキテクチャを採用しており、ビデオメモリが少ないデバイスでも安定して動作します。思考連鎖技術を通じて、…