WhisperChainは、音声入力に基づいて作業効率を向上させるオープンソースの音声認識ツールです。WhisperChainはWhisper.cppを使用してリアルタイム音声認識を実装し、音声をテキストに変換した後、LangChainを使用してテキストを処理します。
WhisperChainは、音声入力に基づいて作業効率を向上させるオープンソースの音声認識ツールです。WhisperChainはWhisper.cppを使用してリアルタイム音声認識を実装し、音声をテキストに変換した後、LangChainを使用してテキストを処理します。
Spark Medical Large Model X1は、iFlytekがリリースした深層推論大規模モデルであり、医療分野向けに特別に設計され、複雑な問題を処理する強力な機能を備えています。深層推論アルゴリズムを通じて、このモデルはエビデンスに基づいたプロセスを段階的に説明し、大幅な削減を実現します。
Story-Flicksは、高画質の短編ストーリー動画をワンクリックで生成できるAIベースのプロジェクトです。ユーザーがストーリーのテーマを入力すると、システムはAI技術を用いて画像、テキスト、音声、字幕を含む短編動画を生成します。Story-Flicksは…
CSM(会話型音声モデル)は、セサミチームが開発した新しい音声対話モデルで、音声アシスタントの自然さと感情的な対話能力を向上させます。CSMは、テキストデータと音声データを組み合わせたマルチモーダル学習フレームワークに基づいています。
AgiBot Digital Worldは、AIZOO Roboticsが開発した高忠実度ロボットシミュレーションフレームワークであり、ロボット操作スキルの研究と応用を効率的にサポートします。AgiBot Digital Worldは、膨大な量のリアルな3Dアセット、複数の...
ARTalkは、東京大学と理化学研究所が共同開発した、音声駆動型の斬新な3D頭部アニメーション生成フレームワークです。自己回帰モデルに基づき、リアルタイムで高度に同期した唇の動き、自然な表情、頭部の姿勢を実現します。
LuminaBrushは、画像に照明効果を描画するためのインタラクティブツールです。FluxテクスチャリングプロジェクトをベースにしたLuminaBrushは、2段階のアプローチを採用しています。第1段階では画像を「均一に照らされた」外観に変換し、第2段階では…
HumanOmniは、人間中心のシナリオに焦点を当てた大規模なマルチモーダルモデルであり、視覚と聴覚のモダリティを融合させています。ビデオ、オーディオ、または両方の入力の組み合わせを処理することで、人間の行動、感情、および相互作用を包括的に理解します。このモデルは、…に基づいています。
Spark-TTSは、SparkAudioチームの大規模言語モデル(LLM)に基づいた、オープンソースの高効率テキスト音声合成(TTS)ツールです。追加の生成モデルを必要とせず、LLMが予測したエンコーディングから直接音声を再構築し、ゼロサンプルを実現します。
ViDoRAGは、アリババ同義研究室が中国科学技術大学および上海交通大学と共同で開発した、視覚文書検索の強化および生成フレームワークです。マルチエージェント協調と動的反復推論に基づいて、複雑な処理における従来の手法の課題に対処します。
Shanduは、LangChainとLangGraphの技術を組み合わせて多段階の情報マイニングと分析を自動化し、構造化された調査レポートを生成するオープンソースのAI研究自動化ツールです。Shanduのコア機能は…
LCVD(Lighting Controllable Video Diffusion Model)は、四川大学が開発した、高忠実度で照明制御可能なポートレートアニメーション生成フレームワークです。LCVDは、ポートレートの本質的な特徴(アイデンティティや外見など)を分離することに基づいています。
SepLLMは、香港大学、ファーウェイ・ノアズアーク・ラボ、その他の機関が共同で提案した、大規模言語モデル(LLM)を高速化するための効率的なフレームワークです。段落情報を圧縮し、冗長なタグを削除することで、モデルの推論速度を大幅に向上させます。
CogView4は、Zhipuが開発したオープンソースのテキスト画像変換モデルで、60億個のパラメータを持ち、中国語入力と中国語テキスト生成に対応しています。このモデルはDPG-Benchベンチマークテストで1位を獲得し、オープンソースのテキスト画像変換モデルの中で最高スコアを記録しました。
PRefLexOR(Preference-based Recursive Language Modeling for Exploratory Optimization of Reasoning)は、MITの研究チームが提案した、選好最適化と…を組み合わせた新しい自己学習型AIフレームワークです。
Problyは、スプレッドシート機能とPythonのデータ分析機能を組み合わせた、AI搭載のスプレッドシートツールです。WebAssemblyをベースとしたProblyは、ブラウザ上でPythonコードを実行し、インタラクティブなスプレッドシート、データ処理などをサポートします。
MindLLMは、イェール大学、ダートマス大学、ケンブリッジ大学が共同開発したAIモデルです。脳の機能的磁気共鳴画像法(fMRI)信号を自然言語テキストにデコードします。MindLLMは、被験者に依存しないモデルに基づいています。
MiniMindは、オープンソースの超小型言語モデルプロジェクトで、個々の開発者が極めて低コストで独自の言語モデルをゼロからトレーニングするのに役立ちます。MiniMindは軽量な使用を想定して設計されており、最小バージョンではわずか2580万個のパラメータしか必要とせず、GPT-...
フラクタル生成モデルは、MITコンピュータ科学・人工知能研究所とGoogle DeepMindによって開発された新しい画像生成手法です。フラクタル生成モデルは…
Image-01は、MiniMax社製の高度なテキスト画像生成モデルで、卓越した画像生成機能を誇ります。ユーザーが入力したテキスト記述を高品質な画像に正確に変換し、様々なアスペクト比や高解像度出力に対応しています。
SuperGPQAは、ByteDanceのDoubao Big Model TeamとM-A-Pが共同で開発した知識推論ベンチマークテストスイートです。大学院レベルの285分野を網羅し、26,529問の専門的な問題を収録しています。従来のベンチマークテストにおける対象分野の網羅性の限界を克服しています。
SpeciesNetは、Googleが開発したオープンソースの人工知能モデルで、カメラトラップで撮影された写真を分析することで動物種を識別します。6500万枚以上の画像で学習されており、動物を含む2000種類以上のタグを認識できます。
GaussianCityは、南洋理工大学のS-Labチームが開発した、効率的で境界のない3D都市生成フレームワークであり、3Dガウスレンダリング(3D-GS)技術に基づいています。コンパクトなBEV-Point表現方法を導入することで、シーンのビデオメモリ(VRAM)を最小限に抑えています。
Asyncflow v1.0は、ポッドキャストプラットフォームPodcastleが提供するAIテキスト読み上げモデルです。450種類以上の音声オプションに対応し、複数の言語やスタイルに適した高品質なテキストコンテンツの読み上げが可能です。