Podcastfyは、複数の言語で複数のソースのテキストを音声に変換することをサポートするAIテキスト読み上げツールです。
Podcastfyは、Webコンテンツ、PDFドキュメント、テキストを多言語音声会話に変換するオープンソースのPythonパッケージです。このツールは、高度な生成型人工知能(GenAI)技術を利用しており、...
Podcastfyは、Webコンテンツ、PDFドキュメント、テキストを多言語音声会話に変換するオープンソースのPythonパッケージです。このツールは、高度な生成型人工知能(GenAI)技術を利用しており、...
Gradioは、機械学習モデルのデモンストレーションと共有を簡素化するオープンソースのPythonライブラリです。開発者は、シンプルなコードでユーザーフレンドリーなWebインターフェースを迅速に作成でき、誰でもどこでも簡単に機械学習を利用できるようになります。
LosslessCutは、動画ファイルと音声ファイルを迅速かつロスレスにカットおよび結合するためのオープンソースの動画編集ツールです。強力なFFmpegライブラリをベースに構築されており、直感的なグラフィカルユーザーインターフェースを提供することで、ユーザーは簡単にカットや結合を行うことができます。
Future Youは、MITが開発したAI搭載の対話型チャット製品で、ユーザーは60歳になった自分の仮想アバターと対話することができます。Future Youは、高度なAI技術とユーザーの現在の人生目標を組み合わせたものです。
PixWizardは、自然言語コマンドに基づいて画像生成、編集、翻訳などのタスクを実行する、多機能な画像間ビジュアルアシスタントです。このシステムは、統一された画像からテキスト、そして画像生成フレームワークを通じて、さまざまなビジュアルタスクを統合します。
Screenpipeは、AI技術を用いてユーザーのコンピュータ画面とマイクを24時間監視するオープンソースソフトウェアです。画面上のアクティビティと音声をキャプチャし、AIによるインテリジェントな分析によって作業効率の向上とデータプライバシーの保護を実現します。Screenpipeは…
Pyramid-Flowは、北京大学、快手科技、北京郵電大学の研究者によって共同開発された高度なビデオ生成モデルです。このモデルは、テキストプロンプトに基づいて、最大10秒の長さ、最大1280x768の解像度、2フレームレートのビデオを生成できます。
Rhymes AIチームが開発したAriaは、テキスト、コード、画像、動画など、さまざまな入力モダリティを理解・処理できる、世界初のオープンソースのネイティブマルチモーダルハイブリッドエキスパート(MoE)モデルです。このモデルは、マルチモーダルタスクと言語タスクにおいて優れた性能を発揮します。
Swarmは、OpenAIが開発した実験的なフレームワークであり、マルチエージェントシステムの構築、オーケストレーション、および展開を目的としています。軽量なエージェントとハンドオフメカニズムに基づいており、エージェント間の調整と実行プロセスを簡素化し、より精密な制御を可能にします。
Baidu AI CloudのYijianは、Baidu AI Cloudが提供するビジュアル大規模モデルプラットフォームです。最先端のビジュアル大規模モデル技術と豊富なシナリオベースのアルゴリズムソリューションに基づき、プロフェッショナルグレードのビジュアルAIアプリケーションを普及させることを目指しています。このプラットフォームは、モデル生成からプロセス全体を接続します。
libcomは、上海交通大学(BCMI)研究所が開発した画像合成ツールキットです。前景と背景の外観、形状、意味の不一致などの矛盾を解消し、リアルな合成画像を生成することを目的としています。
F5-TTSは、上海交通大学がオープンソース化した高性能テキスト音声合成(TTS)システムです。ストリームマッチングを用いた非自己回帰生成方式と、拡散トランスフォーマー(DiT)技術を組み合わせたシステムです。このシステムは…
CursorCoreは、大規模言語モデル(LLM)に基づいたプログラミング支援フレームワークであり、対話型のインタラクションを用いてプログラマーのコード記述とコード修正の効率化を支援します。このフレームワークは、コード履歴、コード修正、プログラミングプロセスからのさまざまな情報を統合します。
MM1.5は、Appleがリリースしたマルチモーダルな大規模言語モデルで、リッチイメージの理解、視覚的な参照と位置特定、および複数イメージの推論機能を強化するように設計されています。このモデルは、大規模な事前学習データを利用したデータ中心のトレーニング手法に基づいています。
Suryaは、文書認識専用に設計された強力なオープンソースOCR(光学文字認識)ツールキットで、90以上の言語をサポートしています。Suryaは文書内のテキストを正確に認識し、テキストの読み順を分析することができます。
Illuminateは、学術論文をAI生成の音声ディスカッションに変換するGoogleのプロジェクトです。Googleの強力な言語モデルGeminiをベースに、論文の内容を魅力的な対話に変換し、…
Loongは、香港大学とByteDanceが共同開発した、斬新な長尺動画生成モデルです。一貫した外観、豊かなダイナミクス、自然なシーン遷移を備えた1分間の動画を生成できます。このモデルは、自己回帰型大規模言語モデル(LLM)に基づいています。
ScriptVizは、スタンフォード大学の研究者によって開発された脚本可視化ツールです。大規模な映画データベースであるMovieNetを基に、脚本のテキストとセリフから一致する映画シーンを抽出し、脚本家が書いた描写を視覚化します。
MLE-benchは、OpenAIが開発したベンチマークツールで、機械学習エンジニアリングタスクにおけるAIエージェントのパフォーマンスを測定するために設計されています。このテストには、自然言語処理を網羅するKaggleの75のコンペティションタスクが含まれています。
GTSingerは、浙江大学の研究チームが開発した大規模でオープンソースの高品質な歌唱データセットであり、多様な歌唱タスクをサポートするように設計されています。GTSingerには、9つの異なる言語を網羅した、プロが録音した80.59時間のボーカルが含まれています。
LightRAGは、香港大学の研究チームによって開発された検索拡張生成(RAG)システムです。統合されたグラフ構造インデックスと2層の検索メカニズムに基づいて、大規模言語モデルのパフォーマンスを向上させます。
Gen2Actは、Google、カーネギーメロン大学、スタンフォード大学が共同開発したロボット操作戦略です。予測ネットワークデータから得られる動作情報に基づいて人間のような動画を生成し、これらの動画を用いてロボットが新しいタスクを実行する際の誘導を行います。
T2V-Turboは、Google、カリフォルニア大学サンタバーバラ校、ウォータールー大学の研究者によって開発された、高度なテキストからビデオへの生成モデルです。
FLUX.1-Turbo-Alphaは、AlimamaクリエイティブチームがFLUX.1-devモデルをベースにトレーニングした8段階蒸留LoRaモデルです。マルチヘッドディスクリミネータ技術に基づき、生成画像の品質を向上させ、テキストから画像への変換やインペインティング制御ネットワークをサポートします。