gpt-4o-mini-transcribeは、OpenAIがリリースした音声認識モデルで、gpt-4o-transcribeの簡易版です。GPT-4o-miniアーキテクチャをベースに、gpt-4o-mini-transcribeは知識蒸留技術を用いて大規模データセットからテキストを抽出します。
gpt-4o-mini-transcribeは、OpenAIがリリースした音声認識モデルで、gpt-4o-transcribeの簡易版です。GPT-4o-miniアーキテクチャをベースに、gpt-4o-mini-transcribeは知識蒸留技術を用いて大規模データセットからテキストを抽出します。
SpatialLMは、GroupCore Technologyが開発したオープンソースの空間認識マルチモーダルモデルであり、ロボットやインテリジェントシステムに人間のような空間認知能力を与えます。一般的な携帯電話で撮影された動画を分析することで、詳細な3Dシーンレイアウトを再構築できます。
マルチエージェントオーケストレーターは、複数のインテリジェントエージェントを管理・調整するためのフレームワークです。分類器によってユーザー入力の意図を識別し、処理に最適なエージェントにリクエストを割り当て、対話ストレージを活用します。
LongCatは、美団が独自に開発した生成型AIモデルであり、人工知能技術を通じて社内業務の効率化とイノベーション能力の向上を目指しています。このモデルは強力なマルチモーダル機能を備えており、テキストや画像など様々な種類のデータを処理できます。
Food Godは、Robam Appliancesが調理分野に本格的に参入した初の大型モデルです。Robam Appliancesが46年間蓄積してきた膨大な調理データとDeepSeekテクノロジーを組み合わせることで、調理シーンのニーズを正確に把握できます。ユーザーは音声、テキストなど様々な方法でコミュニケーションを取ることができます。
Soundwaveは、香港中文大学深圳校が開発したオープンソースの音声理解モデルで、音声とテキストのインテリジェントなアライメントと理解に重点を置いています。革新的なアライメントおよび圧縮アダプタ技術により、音声とテキストの認識における問題を効果的に解決します。
Motiaは、ソフトウェアエンジニア向けに設計されたAIエージェントフレームワークであり、AIエージェントの開発、テスト、およびデプロイを簡素化します。Python、TypeScript、Rubyなど、複数のプログラミング言語をサポートしているため、開発者は熟練した言語を使用できます。
InfiniteYou(InfU)は、ByteDanceのインテリジェントクリエーションチームが開発した、拡散トランスフォーマー(FLUXなど)をベースとした、本人確認機能を備えた画像生成フレームワークです。InfuseNetを使用して本人確認機能を注入します。
RuoYi AIは、フロントエンド、バックエンド管理、ミニプログラムアプリケーションを包括的に提供するフルスタックAI開発プラットフォームであり、柔軟なコード変更と配布をサポートします。RuoYi AIはローカルRAGソリューションをサポートし、Milvus/Weaviateなどと統合します。
MoshiVisは、Kyutaiが開発したオープンソースのマルチモーダル音声モデルです。Moshiリアルタイム対話音声モデルをベースに、視覚入力機能を追加しています。音声と視覚情報を統合することで、画像との自然なリアルタイム音声対話を実現します。
DeepMeshは、清華大学と南洋理工大学の研究者によって提案された3Dメッシュ生成フレームワークです。強化学習と自己回帰トランスフォーマーに基づいて高品質の3Dメッシュを生成します。2つの重要なイノベーションによりメッシュ生成を最適化します。1つ目は...
BlockDanceは、復旦大学とByteDanceのインテリジェントクリエーションチームが共同開発した、拡散モデルを高速化する新しい手法です。BlockDanceは、隣接するタイムステップにおける構造的に類似した時空間特徴(STSS)を識別して再利用することで、冗長性を削減します。
Reve Imageは、Reveが開発した全く新しいAI画像生成モデルです。美的パフォーマンスの向上、正確なキュー追従、優れたタイポグラフィに重点を置き、高品質なビジュアル作品を生成します。このモデルは、…
StarVectorは、ServiceNow Research、Mila-Quebec AI Institute、およびETS Montrealが共同開発したオープンソースのマルチモーダル視覚言語モデルであり、画像とテキストをスケーラブルなベクトルに変換することに重点を置いています。
LHM(Large Animatable Human Reconstruction Model)は、アリババ傘下のTongyi Labsが開発した製品で、1枚の画像からアニメーション付きの3D人体モデルを再構築します。マルチモーダルなTransformerアーキテクチャに基づいており、3Dジオメトリを統合し、...
OceanDSは、中国初の海洋垂直分野における大規模言語モデルであり、国家海洋環境予測センター、海洋出版社、360デジタルセキュリティテクノロジーが共同で開発・発表しました。このモデルは、360 Brain 13BとDeepseek-R1を活用しています。
Qwen2.5-VL-32Bは、Alibabaが提供するオープンソースのマルチモーダルモデルで、パラメータサイズは32バイトです。Qwen2.5-VLシリーズをベースに、強化学習を用いて最適化されており、より人間らしい応答スタイルと大幅な精度向上を実現しています。
AndroidGenは、Zhipu Technologyチームが開発したフレームワークで、特にデータが少ない状況において、大規模言語モデル(LLM)ベースのエージェントの機能を強化することを目的としています。このフレームワークは、人間のタスク軌跡を収集し、これらの軌跡に基づいて言語モデルをトレーニングします。
ReasonGraphは、大規模言語モデル(LLM)の推論プロセスを可視化および分析するためのオープンソースのWebプラットフォームです。ReasonGraphは、Anthropic、OpenAI、Googleなど、50以上の主要なモデルをサポートしており、…
Gemini 2.5 Proは、Googleの最新AIモデルであり、応答前に推論を行う「思考型モデル」として、パフォーマンスと精度を向上させています。このモデルは、特に推論とコード生成において、複数のベンチマークテストで優れた性能を発揮します。
pdf-craftは、PDFファイルを他の形式(MarkdownやEPUBなど)に変換するためのツールで、特にスキャンされた書籍のPDFファイルの処理に特化しています。pdf-craftは、本文の抽出、ヘッダーやフッターなどのフィルタリングをサポートしています。
TaoAvatarは、アリババグループの研究チームが開発した、高忠実度かつ軽量な3D全身対話型仮想人間技術です。3Dガウススパッタリング技術に基づいており、高解像度レンダリングをサポートするフォトリアリスティックな3D全身仮想アバターを生成できます。
Mureka O1は、Kunlun Techが発表した世界初の大型音楽推論モデルであり、「思考連鎖」(CoT)技術を導入した世界初の音楽モデルです。Mureka O1は、思考と自己批判を推論プロセスに組み込んでいます。
Mureka V6は、Kunlun TechのAI音楽制作プラットフォームの基盤となるモデルであり、10言語での純粋な音楽生成とAI音楽制作をサポートしています。自社開発のICL(インコンテキスト学習)技術を搭載し、より広い音場を実現します。