Video-T1 - 清華大学とテンセントが共同開発した動画生成技術。
Video-T1は、清華大学とテンセントの研究者が共同開発した動画生成技術です。テストタイムスケーリング(TTS)に基づいて、生成される動画の品質と一貫性を向上させます。従来の動画生成モデルは、トレーニング中に...
Video-T1は、清華大学とテンセントの研究者が共同開発した動画生成技術です。テストタイムスケーリング(TTS)に基づいて、生成される動画の品質と一貫性を向上させます。従来の動画生成モデルは、トレーニング中に...
Fin-R1は、上海財経大学と蔡岳星辰が共同で開発した、金融分野における初の大規模R1クラス推論モデルです。70億個のパラメータを持つQwen2.5-7B-Instructアーキテクチャをベースとし、金融推論シナリオからの高品質な思考連鎖データを利用してSF(Simple Framework)推論を行います。
Olivaは、LangchainとSuperlinkedの技術を組み合わせたオープンソースの音声RAGアシスタントです。音声駆動型のRAG(検索拡張生成)アーキテクチャに基づいており、Qdrantベクトルデータベース内の情報をリアルタイムで検索するのに役立ちます。
Qwen2.5-Omniは、AlibabaのQwenシリーズにおけるオープンソースのフラッグシップマルチモーダルモデルです。70億個のパラメータと強力なマルチモーダル知覚機能を誇り、テキスト、画像、音声、ビデオ入力を処理し、ストリーミングをサポートします。
Cosmos-Reason1は、NVIDIAが開発したマルチモーダルな大規模言語モデルシリーズで、物理ベースの応答を生成できます。Cosmos-Reason1には、Cosmos-Reason1-7BとCosmos-Reason1-5の2つのモデルが含まれています。
RF-DETRは、Roboflowが開発したリアルタイム物体検出モデルです。RF-DETRは、COCOデータセットで平均精度(mAP)60以上を達成した初のリアルタイムモデルであり、既存の物体検出モデルを凌駕しています。RF-DETRは、LWと...
Bolt3Dは、Google Research、オックスフォード大学のVGGチーム、そしてGoogle DeepMindが共同開発した新しい3Dシーン生成技術です。これは、単一のGPUから7秒未満で直接シーンを生成できる可能性を秘めた拡散モデルです。
Piece it Together (PiT) は、Bria AI およびその他の機関によって開発された革新的な画像生成フレームワークであり、部分的な視覚要素から完全な概念画像を生成するように特別に設計されています。ドメイン固有の事前知識に基づいて、ユーザーが提供する断片を変換し、...
TripoSRは、Stability AIとVASTが共同開発したオープンソースの3D生成モデルです。単一の2D画像から0.5秒未満で高品質な3Dモデルを高速に生成できます。このモデルはTransformerアーキテクチャに基づいており、大規模な再構築モデルを採用しています。
ModelEngineは、ファーウェイが提供するオープンソースのエンドツーエンドAI開発ツールチェーンであり、データ活用、モデル活用、アプリケーション活用という3つの主要機能を中心に構成されています。これにより、時間のかかるデータエンジニアリング、モデルトレーニング、およびAIの産業展開に伴うその他のプロセスにおける課題を解決します。
BizGenは、清華大学とマイクロソフトリサーチが共同開発したAIインフォグラフィック生成ツールで、記事レベルのビジュアルテキストレンダリングに特化しています。長文記事をワンクリックでプロ仕様のインフォグラフィックやスライドショーに変換でき、従来の手法の問題点を解決します。
Ideogram 3.0は、Ideogramが発表したAI画像生成モデルです。Ideogram 3.0は、高いリアリズム、優れたテキストレンダリング、強力な言語理解能力を備え、画像生成品質において飛躍的な進歩を遂げ、以下のような画像生成をサポートします。
QVQ-Maxは、Alitongyiが開発したビジュアル推論モデルであり、QVQ-72B-Previewの正式アップグレード版です。QVQ-Maxは画像や動画コンテンツを「理解」し、情報を組み合わせて分析、推論、問題解決を行うことができます。QVQ-Maxは…をサポートしています。
TxGemmaは、Googleが創薬向けに開発した汎用人工知能モデルであり、AI技術を通じて創薬プロセスを加速します。GoogleのGemmaフレームワークに基づいて開発されており、通常のテキストだけでなく、化学物質、分子なども理解できます。
TripoSGは、VAST-AI研究チームが開発した高精度3D形状合成技術であり、大規模補正フロー(RF)モデルに基づいています。大規模補正フロー変換器アーキテクチャとハイブリッド教師あり学習を利用しています。
TripoSFは、VASTが開発した次世代3D基本モデルであり、ディテール、複雑な構造、スケーラビリティといった点で従来の3Dモデリングのボトルネックを打破します。疎なボクセル構造とSparseFlex表現手法を組み合わせることで、オブジェクト表面近傍のディテールのみをモデリングします。
DistilQwen2.5-R1は、アリババが知識蒸留技術に基づいて開発した小型化された深層推論モデルシリーズです。3B、7B、14B、32Bの4つのパラメータスケールを持つモデルが含まれています。DistilQwen2.5-R1は、超大規模モデルのサイズを縮小します(...
PaddleSpeechは、Baidu PaddlePaddleチームが開発したオープンソースの音声処理ツールで、音声認識、音声合成、話者認識、音声翻訳など、包括的な音声処理機能を提供します。PaddleSpeechは、コマンドラインインターフェース、各種サービスなどを提供しています。
ChatAnyoneは、Alibaba Tongyi Labsが開発したリアルタイムのスタイリッシュなポートレート動画生成フレームワークです。音声入力から、豊かな表情と上半身の動きを持つポートレート動画を生成します。効率的な階層型モーション拡散モデルを採用し、…
Math24oは、SuperCLUEに類似した、中国のオープンソースの大規模モデル評価ベンチマークであり、高校生のオリンピックレベルの数学的推論能力評価のために設計されています。主に大規模言語モデルの数学的推論能力を評価するために使用されます。2024年の国家標準規格を採用しています。
RoboBrainは、北京人工知能研究院(BAAI)が発表したオープンソースの身体化された脳モデルであり、単一機械知能を群知能へと発展させるものです。タスク計画のための基本モデル、運用領域認識のためのA-LoRAモジュール、そして…の3つのモジュールで構成されています。
RoboOSは、北京人工知能研究院が発表した、初のクロスオントロジー対応の身体化された小脳-小脳協調フレームワークです。階層的な「脳-小脳」アーキテクチャに基づき、身体化された脳であるRoboBrainは全体的な知覚と意思決定を担い、小脳スキルライブラリは低遅延かつ正確な実行を担います。
Vidu Q1は、清華大学人工知能研究所副所長であり、盛舒科技の創設者兼チーフサイエンティストである朱軍教授率いるチームによって開発された、高度な制御が可能なビデオモデルです。繊細な画質と豊かなディテールを備えた1080pの高解像度ビデオの生成をサポートします。
ObjectMoverは、香港大学とAdobe Researchが共同で提案した新しい画像編集モデルです。画像内のオブジェクトの移動、挿入、削除時に発生する、照明や影の不整合、オブジェクトの歪みなどの問題を解決します。