ToonCrafter - テンセントなどが開発した、オープンソースの漫画アニメーション動画フレーム補間ツール。
ToonCrafterは、Tencent AI Lab、香港中文大学、香港城市大学の研究者によって開発されたオープンソースのアニメーション動画補間ツールです。従来のアニメーション制作における直線運動の仮定という制約を打破し、革新的な手法を採用しています。
ToonCrafterは、Tencent AI Lab、香港中文大学、香港城市大学の研究者によって開発されたオープンソースのアニメーション動画補間ツールです。従来のアニメーション制作における直線運動の仮定という制約を打破し、革新的な手法を採用しています。
人工知能スタートアップのStability AIは、最新のテキストから画像への生成モデルであるStable Diffusion 3 Medium(SD3 Medium)の公式オープンソースリリースを発表しました。Stable Diffusion 3 Mediumには20種類のテキストから画像への変換モデルが含まれています。
MimicBrushは、アリババ、香港大学、アントグループの研究者によって開発されたAI画像編集・融合フレームワークです。ユーザーは簡単な操作でソース画像上の編集領域を指定でき、以下のような機能を備えたフレームワークを提供します。
Halloは、復旦大学、百度、チューリッヒ工科大学、南京大学の研究者らが共同で提案した、AIを活用したリップシンクポートレート画像アニメーション技術です。音声入力に基づいて、リアルでダイナミックな画像を生成できます。
Unique3Dは、清華大学が開発した、単一画像を3Dモデルに変換するためのオープンソースフレームワークです。マルチビュー拡散モデルとノーマル拡散モデルを組み合わせ、効率的なマルチレベルアップサンプリング戦略を用いることで、単一画像を3Dモデルに変換できます。
QinYue Big Modelは、Tencent AI LabとTencent TME Tianqin Labが共同開発したAI搭載の音楽制作モデルです。このモデルは、中国語または英語のキーワード、説明的なフレーズ、または音声を入力することで、ステレオ音声などを直接生成できます。
Diffutoonは、アリババと華東師範大学の研究者によって開発されたAIフレームワークで、動画を漫画やアニメ風に変換します。拡散モデルに基づいた編集可能な漫画調色技術により、リアルな動画をアニメ風アニメーションに変換できます。
アリババと華東師範大学の研究者によって開発されたExVideoは、ビデオ合成モデルのポストチューニング技術です。既存のビデオ合成モデルの時間スケールを拡張し、より長いビデオを生成します。このチームはStable Vをベースにしています...
Toucan TTSは、ドイツのシュトゥットガルト大学自然言語処理研究所(IMS)が開発したテキスト音声合成ツールキットです。7,000以上の言語(様々な方言や変種を含む)に対応し、複数話者による音声合成、音声認識などの機能を提供します。
MOFA-Videoは、テンセントAIラボと東京大学の研究者によって開発された、画像から動画への制御可能な生成を実現するオープンソースモデルです。この技術は、生成モーションフィールドアダプタを利用して画像をアニメーション化し、動画を生成します。
CriticGPTは、OpenAIがリリースした新しい人工知能モデルで、GPT-4をベースに構築されており、特に大規模言語モデル(ChatGPTなど)によって生成されたコードのレビューとエラーの特定を目的として設計されています。CriticGPTは人間のフィードバックに大きく依存しています。
Gemma 2は、GoogleのDeepMindがリリースした次世代オープンソース人工知能モデルで、90億パラメータ版と270億パラメータ版が提供されています。このモデルは、優れたパフォーマンス、効率的な推論速度、幅広いハードウェア互換性を特徴としており、様々なハードウェアで動作可能です。
MimicMotionは、Tencentの研究者によって開発された高品質な人体動作動画生成フレームワークです。信頼度を考慮した姿勢誘導技術を採用することで、高品質な動画フレームと滑らかな時間的遷移を実現しています。さらに、MimicMotionは…
FreeAskInternetは、GPT-3.5などの高度な大規模言語モデル(LLM)とSeerXNGメタ検索エンジンを統合した、無料のオープンソースネイティブAI検索エンジンであり、ユーザーに検索機能とインテリジェントな回答生成サービスを提供します。
Fish Speechは、Fish Audioが開発したオープンソースのテキスト音声合成(TTS)ツールで、中国語、英語、日本語に対応しています。約15万時間分の多言語データで学習されており、人間とほぼ同等の音声合成結果を実現しています。
Moshiは、フランスのAI研究機関Kyutaiが開発したエンドツーエンドのリアルタイム音声マルチモーダルAIモデルです。聞く、話す、見る能力を持ち、70種類の感情やコミュニケーションスタイルをシミュレートできます。ベンチマークとして…
EchoMimicは、アリババ傘下のAnt Groupが立ち上げたオープンソースのAIデジタルヒューマンプロジェクトで、静止画に生き生きとした声と表情を与える。深層学習モデルと音声および顔の特徴点を組み合わせることで、非常にリアルな動的なポートレート動画を作成する。
MimicMotionは、テンセントが上海交通大学と共同開発したAI動画生成フレームワークです。ユーザーは画像と参照動画を提供するだけで、ワンクリックでリアルな人間の動きを再現した動画を生成できます。ダンスやスポーツなど、さまざまなジャンルに適しています。
FunAudioLLMは、アリババ同義研究所が立ち上げたオープンソースの音声モデルプロジェクトで、SenseVoiceとCosyVoiceの2つのモデルで構成されています。SenseVoiceは多言語音声認識と感情検出に優れており、50以上の言語をサポートしています。
Chameleonは、Meta(Facebookの親会社)の人工知能研究チームであるFAIR(Facebook AI Research)が発表したハイブリッドマルチモーダルモデルで、任意の画像とテキストのシーケンスを理解し、生成することができます。Chameleonは、...
Mem0は、大規模言語モデル向けのオープンソースのメモリ拡張ツールであり、AIが長期的かつ適応的なメモリを持つことを可能にします。その適応型メモリシステムにより、AIはアプリケーション間でユーザーの好みや操作を記憶し、一貫性のある継続的な処理を提供できます。
STORM AIは、スタンフォード大学が開発したオープンソースのAIライティングツールです。トピックを数秒で長文の記事や研究論文に変換でき、完全に無料で、Perplexity Pagesの代替ツールとして利用できます。STORM AIは…
DCLM-7Bは、Appleの研究チームとの共同開発により開発された、70億個のパラメータを持つ小型のオープンソースモデルです。その性能はMistral-7Bを凌駕し、Llama 3やGemmaに匹敵します。最近、AppleはDataComp-LM(DCLM)プロジェクトの研究機関として…
LivePortraitは、Kuaishouが開発したオープンソースのポートレートアニメーション生成フレームワークです。動画を動かす表情やポーズを、静止画または動画のポートレートに効率的かつ制御可能に転送し、表現力豊かな動画を作成することに重点を置いています。この技術は暗黙的な...