FineVideo - Hugging Faceが公開した大規模なマルチモーダル動画データセット。
Hugging Faceが開発したFineVideoは、感情分析、ストーリーテリング、メディア編集など、ビデオ理解における複雑なタスクに焦点を当てた大規模なマルチモーダルビデオデータセットです。FineVideoには43,000を超えるY...
Hugging Faceが開発したFineVideoは、感情分析、ストーリーテリング、メディア編集など、ビデオ理解における複雑なタスクに焦点を当てた大規模なマルチモーダルビデオデータセットです。FineVideoには43,000を超えるY...
VoidはVisual Studio Codeをベースに構築されたオープンソースのテキストエディタで、AI技術を統合することでプログラミング体験を向上させています。Voidはコードの自動補完、インライン編集、AIによるコード検索、大規模な言語モデルとの直接的な対話などをサポートしています。
Draw an Audioは、中国科学院自動化研究所と美団点評の研究者らが開発した、映像から音声を生成するシステムです。映画制作におけるフォーリーアートのように、映像コンテンツに基づいて自動的に適切な効果音を生成します。
CogVideoX-5B-I2Vは、Zhipu AIが開発したオープンソースの画像から動画への変換モデルで、単一の画像とテキストプロンプトから動画を生成します。このモデルは、3D因果変分オートエンコーダーとエキスパート適応型LayerNormテクノロジーを採用しており、以下のような出力が可能です。
RapidPagesは、AI技術を用いてReactとTailwind CSSのUIコンポーネントを迅速に生成することに特化したオープンソースの統合開発環境(IDE)です。自然言語処理に基づいており、ユーザーは希望するインターフェースを説明するだけでUIコンポーネントを作成できます。
Ovis 1.6は、アリババの国際AIチームが開発したマルチモーダル大規模モデルです。マルチモーダルコンピューティングの総合ベンチマークであるOpenCompassにおいて優れた結果を達成しており、特にパラメータ数が30億未満のモデルの中で総合スコア1位を獲得しています。
Gummyは、Tongyi Labが2024年のYunqi Conferenceで発表したエンドツーエンドの音声翻訳モデルです。このモデルは、中国語、英語、広東語、日本語、韓国語、フランス語、ドイツ語などを含む言語に対応し、リアルタイムストリーミングで音声認識と翻訳結果を生成できます。
cogvlm2-llama3-captionモデルは、CogVLM2アーキテクチャに基づいた動画説明生成モデルです。このモデルは、動画コンテンツを理解し、動画コンテンツを説明するテキストタイトルや字幕を自動的に生成するために使用されます。
3DTopia 2.0は、上海人工知能研究所と南洋理工大学が共同開発した大規模3Dオブジェクト生成モデルです。このモデルは、革新的なプリミティブベースの3D表現手法であるPrimXを採用しています。
StoryMakerは、Xiaohongshuが開発したオープンソースのテキストから画像を生成するツールで、クリエイターが連続する画像コンテンツ全体でペルソナの一貫性を維持できるよう支援することに重点を置いています。Stable Diffusion XLモデルとLoRAテクノロジーに基づいて、...
CogVideoX-Funは、CogVideoXをベースにEasyAnimateで改良されたAIビデオ生成パッケージです。より柔軟な生成条件を提供し、テキストからビデオ、画像からビデオ、ビデオからビデオの生成をサポートします。ツール...
ItiNeraは、香港大学とMITが共同開発したスマートシティ旅行計画システムです。大規模言語モデル(LLM)と空間最適化技術に基づき、カップル向けのバーやアニメ・マンガをテーマにした場所など、ユーザーの個人的なニーズに合わせて、ワンクリックでC++テンプレートを生成します。
華智ビッグモデル5.0は、同方知識網とファーウェイクラウドが共同で開発したAIビッグモデルであり、マルチモーダルな理解と生成能力を備えています。華智ビッグモデル5.0の最大の特長は、70億から1350億までの多次元モデル構築能力にあります。
LVCD(Large Video Color Diffusion)は、アニメーション動画の線画に色を付けるために特別に設計された動画拡散フレームワークです。白黒の線画を自動的にカラーアニメーション動画に変換できます。LVCDは高度な拡散モデルを使用しています...
LLaMA-Omniは、中国科学院計算技術研究所および中国科学院大学の研究者によって開発された、大規模言語モデル(LLM)を用いた低遅延かつ高品質な音声対話を実現するための新しいモデルアーキテクチャです。これは、事前学習済みのモデルを統合し、...
SCoRe(強化学習による自己修正)は、Google DeepMindが開発した革新的な複数ラウンド強化学習手法であり、大規模言語モデル(LLM)の自己修正能力を向上させることを目的としています。
AiNieeは、RPGやSLGゲーム、EpubやTXT形式の小説、SrtやLrc形式の字幕ファイルをワンクリックで自動翻訳できるAI翻訳ツールです。このツールは複数のファイル形式に対応し、OpenAIなどの主要なAIインターフェースプラットフォームに接続できます。
ANTOは、SRT形式の動画字幕ファイルを翻訳するためのオープンソースのWindowsデスクトップ字幕翻訳ツールです。Google翻訳、DeepL、Microsoft翻訳、Baidu翻訳、Youdao翻訳など、複数の翻訳エンジンを統合しており、ユーザーは翻訳プロセスをカスタマイズできます。
OpenMusicは、QA-MDT(Quality-aware Masked Diffusion Transformer)技術に基づいた、高品質なテキストベースの音楽モデルです。高度なAIアルゴリズムを用いて、テキスト記述に基づいて高品質な音楽を生成します。
SFR-RAGは、Salesforce AI Researchが開発した大規模言語モデルであり、テキストの理解と生成における機械学習能力の向上に重点を置いています。このモデルは、特に高度なテキスト検索において、文脈の忠実な理解を重視しています。
oneWebot2は、ワンクリックでWeChat AIロボットを起動できるソフトウェアパッケージです。複雑なPython環境設定は不要で、.exeファイルをダウンロードしてダブルクリックするだけで起動できます。グラフィカルインターフェースを備えているため、設定プロセスが簡素化され、技術的な知識のないユーザーでも簡単に設定できます。
GOT-OCR 2.0は、OCR技術を2.0時代へと押し上げる高度な光学文字認識(OCR)モデルです。GOT-OCR 2.0のエンドツーエンドモデルは、テキストを処理できる高圧縮エンコーダと長コンテキストデコーダで構成されています。
PixelDanceはByteDanceの最新AI動画生成モデルで、DiTアーキテクチャを採用し、テキストベースと画像ベースの両方の動画に対応しています。複雑な指示を理解し、最大10秒のまとまりのある動画クリップを生成でき、複数の被写体のやり取りをカバーできます。
SeaweedはByteDanceが開発したAI動画生成モデルで、テキストベースと画像ベースの両方の動画モードをサポートしています。Transformerアーキテクチャに基づいており、時空間圧縮技術を用いて学習されているため、マルチ解像度出力にネイティブに対応し、以下のような用途に適しています。