PixelHacker - 華中科技とVIVOが共同開発した画像復元モデル
PixelHackerは、華中科技大学とVIVO AI Labが共同開発した画像修復モデルです。潜在カテゴリガイダンス(LCG)パラダイムに基づいており、...
PixelHackerは、華中科技大学とVIVO AI Labが共同開発した画像修復モデルです。潜在カテゴリガイダンス(LCG)パラダイムに基づいており、...
ZenCtrlは、Fotographer AIが開発したAI画像生成ツールです。追加の学習データを必要とせずに、1枚の画像から高品質で多視点、かつ多様なシーン画像を生成することができます。
Seed1.5-Embeddingは、ByteDanceのSeedチームがリリースした最新のベクトルモデルで、Seed1.5(Doubao-1.5-pro)をベースにさらに学習されています。このモデルは、権威あるベンチマークリストMTEBにおいて、中国語と英語の両方で最先端(SOTA)の性能を達成しました。
FastVLMは、Appleが開発した高効率ビジュアル言語モデル(VLM)であり、高解像度画像処理の効率とパフォーマンスを向上させます。このモデルは、革新的なFastViTHDハイブリッドビジュアルエンコーダを導入し、ビジュアルトークンの数を効果的に削減し、処理速度を大幅に向上させます。
Audio-SDSは、NVIDIAのAI研究チームが開発した革新的な技術で、スコア蒸留サンプリング(SDS)技術をテキストベースの条件付き音声拡散モデルに拡張し、音声処理分野に大きなブレークスルーをもたらします。
PrimitiveAnythingは、テンセントのAIPD(AIプラットフォーム部門)と清華大学が共同開発した、斬新な3D形状生成フレームワークです。複雑な3D形状を単純な基本要素に分解し、自己回帰的なアプローチを用いてこれらの基本要素を生成します。
OptoChat AIは、南智光電子と南京大学が共同で立ち上げた、中国初のフォトニクスに特化した大規模モデルです。このモデルはフォトニクス産業チェーン全体に焦点を当て、30万件以上のフォトニックチップ関連の特許、文献、業界データリソースを統合し、…
Xianyu AutoAgentは、Xianyuプラットフォーム向けに設計されたインテリジェントな顧客サービスロボットシステムです。24時間365日の自動運用、複数専門家による協調的な意思決定、インテリジェントな交渉、および状況認識型対話をサポートしています。状況認識技術に基づいて、顧客対応を管理します。
Matrix-Gameは、Kunlun Wanweiが開発したオープンソースの産業グレード100億+空間知能モデルであり、Matrix-Zeroワールドモデル内のインタラクティブなビデオ生成モデルです。このモデルは2段階の学習戦略に基づいており、ユーザー入力に基づいて連続的なビデオを生成します。
GitFriendは、React、TypeScript、およびAI技術に基づいて構築された、AI搭載のGitHubアシスタントツールです。GitHubのワークフローを簡素化し、開発効率を向上させます。GitFriendは、ユーザー向けのAIベースのチャット機能をサポートしています。
Muyan-TTSは、ポッドキャスト向けに設計されたオープンソースのテキスト音声合成(TTS)モデルです。このモデルは10万時間以上のポッドキャスト音声データで事前学習されており、ゼロショット音声合成を実現し、大量のターゲット話者の音声データを必要とせずに音声を生成できます。
Chinese-LiPSは、北京人工知能研究院と南開大学が共同開発した、高品質な中国語マルチモーダル音声認識データセットです。100時間分の音声、動画、手動で書き起こされたテキストが含まれており、読唇動画と音声を革新的に統合しています。
ViLAMP(VIdeo-LAnguage Model with Mixed Precision)は、Ant Groupと中国人民大学が共同開発した視覚言語モデルで、特に長尺動画コンテンツを効率的に処理するために設計されています。混合精度戦略に基づき、…
Seed 1.5-VLは、ByteDanceのSeedチームがリリースした最新のビジュアル言語マルチモーダル大規模モデルです。強力な汎用マルチモーダル理解および推論能力を備え、推論コストを大幅に削減しています。このモデルは、5億3200万個のパラメータを持つビジュアルコンパイラで構成されています。
Co-Sightは、ZTEコーポレーションによるオープンソースのスーパーエージェントプロジェクトであり、協調的なビジュアル分析プラットフォームおよびインテリジェントオートメーションの基盤として機能します。マルチエージェントアーキテクチャを採用し、DAGタスクエンジンによって駆動される協調的な「デジタルチーム」システムを構築し、タスクを実行します。
MCPHubは、MCP(Model Context Protocol)サーバー集約のためのワンストッププラットフォームです。複数のMCPサーバーをさまざまなストリーミングHTTP(SSE)エンドポイントに統合し、直感的なWebインターフェースと強力なプロトコル処理機能に基づいてAPI実装を簡素化します。
HealthBenchは、OpenAIが開発した医療分野向けのオープンソースベンチマークであり、医療分野における大規模言語モデル(LLM)の性能と安全性を評価するために使用されます。HealthBenchには、ユーザーや医療専門家によるテストに使用できる5000のモデルが含まれています。
Seedance 1.0 liteは、Volcano Engineが開発した動画生成モデル「Doubao」の小型版です。テキストベースと画像ベースの両方の動画生成方法に対応しており、長さ5秒または10秒、解像度480pまたは720pの動画を生成できます。
Nexus-Genは、Modaチーム、華東師範大学、およびその他の機関によって開発されたオープンソースの総合的な画像生成モデルです。画像の理解、生成、編集を同時にサポートします。Nexus-Genは、言語モデルと拡散モデルの強力な機能を組み合わせています。
StreamBridgeは、Appleと復旦大学が共同開発したエッジサイドビデオ大規模言語モデル(Video-LLM)フレームワークであり、AIがライブビデオストリームをリアルタイムで理解するのに役立ちます。このフレームワークは、メモリバッファとラウンドベースの減衰圧縮戦略に基づいています。
Step1X-3Dは、StepFunがLightIllusionsと共同開発した、高精度で制御可能な3Dアセット生成フレームワークです。厳密なデータ処理プロセスに基づき、500万点以上の3Dアセットから200万点の高品質アセットを選定します。
OpenVisionは、カリフォルニア大学サンタクルーズ校(UCSC)が開発した、完全にオープンで効率的かつ柔軟な高度なビジュアルエンコーダー群であり、マルチモーダル学習に重点を置いています。590万から6億3210万パラメータまでの様々なサイズのモデルを提供し、以下のような用途に適しています。
FLUX-Textは、アリババが発表した新しい多言語テキスト編集フレームワークで、拡散モデルと軽量グリフ埋め込みモジュールに基づいています。このフレームワークは、グリフの条件情報を注入することで、複雑なシナリオにおけるテキスト編集を強化します。
MCA-Ctrl(Multi-party Collaborative Attention Control)は、中国科学院計算技術研究所と中国科学院大学が開発した画像カスタマイズ生成フレームワークです。テキストと複雑な視覚条件に基づいて高品質な画像生成を実現します。