Parler-TTS - Hugging Faceのオープンソース音声合成モデル
Parler-TTSは、Hugging Faceが開発したオープンソースのテキスト音声合成(TTS)モデルです。入力されたプロンプトに基づいて、特定の話し手(性別、声のトーン、話し方など)のスタイルを模倣し、高品質で聞き取りやすい音声を生成します。
Parler-TTSは、Hugging Faceが開発したオープンソースのテキスト音声合成(TTS)モデルです。入力されたプロンプトに基づいて、特定の話し手(性別、声のトーン、話し方など)のスタイルを模倣し、高品質で聞き取りやすい音声を生成します。
VASA-1は、Microsoft Research Asiaが提案したフレームワークで、静止画をリップシンク動画に変換します。1枚の静止画と音声データに基づいて、リアルな3Dの話し顔アニメーションをリアルタイムで生成できます。
Llama 3は、Metaが新たにリリースした次世代大規模言語モデル(LLM)の最新オープンソース版であり、8Bおよび70Bパラメータを持つモデルも含まれ、オープンソース人工知能分野における新たな重要な進歩を示しています。Llamaシリーズの第3弾として…
FunClipは、Alibaba DAMO Academyが開発した、完全オープンソースのローカル展開型自動動画編集ツールです。Alibaba Tongyi LabsのFunASR Paraformerシリーズモデルを呼び出すことで、動画の自動音声認識を実現しています。
Phi-3は、Microsoft Researchが開発した次世代の高度な小型言語モデルで、phi-3-mini、phi-3-small、phi-3-mediumの3つの異なるサイズがあります。これらのモデルは、小さなパラメータサイズを維持しながら、...
Hyper-SDは、ByteDanceの研究者によって開発された高効率画像生成フレームワークです。軌道分割一貫性蒸留(TSCD)技術と、人間のフィードバック学習および分画蒸留を組み合わせることで、拡散モデルのパフォーマンスを大幅に向上させ、より少ないデータ量で効率的な画像生成を実現します。
Arcticは、クラウドコンピューティング大手SnowflakeのAI研究チームが開発した、高性能なオープンソースのエンタープライズグレードの大規模言語モデルです。この大規模モデルは480億(480B)ものパラメータを持ち、128人の精緻な専門家によって構築されています。
OpenELMは、Appleの最新の高性能オープンソース言語モデルシリーズで、OpenELM-270M、OpenELM-450M、OpenELM-1_1B、OpenELM-3Bなど、さまざまなパラメータスケールを持つバージョンが含まれています。この大規模モデルはレイヤーを利用し...
ID-Animatorは、テンセントフォトンスタジオ、中国科学技術大学、中国科学院合肥物質科学研究院の研究者らが開発した、ゼロショット方式の人体動画生成技術です。単一の参照顔画像に基づいて動画を生成することができます。
IDM-VTONは、韓国科学技術院(KAIST)とOMNIOUS.AIの研究者らが提案した、高度なAI仮想試着技術です。拡散モデルを改良することで、衣服を着用した人物のリアルな画像を生成し、よりリアルな仮想試着効果を実現します。
VideoGigaGANは、Adobeとメリーランド大学の研究者によって提案された、斬新な生成型ビデオ超解像(VSR)モデルです。ビデオ解像度を最大8倍までアップスケールし、ぼやけたビデオを非常に鮮明な映像に変換することができます。
Viduは、盛舒科技と清華大学が共同開発した、中国初の長時間再生、高一貫性、高ダイナミックな動画モデルです。このAI動画生成モデルは、独自のU-ViTアーキテクチャを採用し、拡散とトランスフォーマーを組み合わせています。
PuLIDは、ByteDanceが開発したオープンソースのパーソナライズされたテキストから画像を生成する技術です。コントラスト調整と高速サンプリング手法により、モデルを調整することなく効率的なIDカスタマイズを実現し、画像顔交換効果を容易に実現します。
IC-Lightは、ControlNetの開発者である張緑民氏が開発したAI画像照明ツールです。光源の操作や画像内の光と影の再構築が可能で、様々な背景との完璧な融合を実現します。ユーザーは画像をアップロードし、適切な照明を選択するだけで済みます。
AniTalkerは、上海交通大学X-LANCE LabとAISpeechの研究者によって開発された、AIを活用したリップシンク動画生成フレームワークです。人物の静止画像1枚と入力音声から、まるで生きているかのようなアニメーションを生成できます。
Hunyuan-DiTは、テンセントのHunyuanチームが開発した高性能なテキストから画像への拡散変換モデルです。中国語と英語の理解能力に優れ、テキストプロンプトに基づいて複数の解像度の画像を生成できます。
Veoは、Google DeepMindが開発した動画生成モデルです。ユーザーは、テキスト、画像、または動画の指示に従って、希望する動画コンテンツを生成できます。1分以上の高画質1080p動画を生成可能です。
CogVLM2は、Zhipu AIが開発した新世代のマルチモーダル大規模モデルです。視覚と言語の理解において大幅な性能向上を実現し、最大8Kのテキスト長と1344×1344ピクセルの画像入力に対応し、強力なテキスト処理機能を備えています。
Universal-1は、AI音声認識スタートアップ企業AssemblyAIが開発した多言語音声認識・文字起こしモデルです。1250万時間以上の多言語音声データで学習されており、英語、スペイン語、フランス語、ドイツ語などの言語に対応しています。
Codestralは、フランスの人工知能スタートアップ企業であるMistral AIが開発したコード生成AIモデルです。ソフトウェア開発の効率化を目的として設計されており、Python、Java、C、C++など、80種類以上のプログラミング言語をサポートしています。
ChatTTSは、会話シナリオに特化して設計されたテキスト音声合成(TTS)モデルで、中国語と英語の両方をサポートしています。約10万時間分の中国語と英語のデータで学習されており、高品質で自然かつ流暢な会話音声を生成できます。
Seed-TTSは、ByteDanceが開発した高度なテキスト音声合成(TTS)モデルシリーズです。人間の音声に極めて近い高品質な音声を生成でき、優れた文脈学習能力と自然さを備えています。
Qwen2は、アリババクラウドの同義千文チームがオープンソース化した次世代の大規模言語モデルです。このシリーズは、0.5Bから72Bまでの5つのスケールモデルを網羅し、既存の中国語と英語のモデルに27言語の高品質データを追加することで、大幅な改善を実現しています。
Follow-Your-Emojiは、香港科技大学、テンセント渾源、清華大学の研究者らが開発した、拡散モデルに基づくポートレートアニメーションフレームワークです。拡散モデルを用いて、参照ポートレートにターゲット表情シーケンスを追加することで、アニメーションを実現します。