渾源イメージ3.0 - テンセントの画像生成・編集モデル
HunyuanImage 3.0-Instructは、テンセントが開発した高度な画像生成・編集モデルです。80個のパラメータを持つハイブリッドエキスパート(MoE)アーキテクチャに基づいており、ユーザーが入力した画像を深く理解することができます。
HunyuanImage 3.0-Instructは、テンセントが開発した高度な画像生成・編集モデルです。80個のパラメータを持つハイブリッドエキスパート(MoE)アーキテクチャに基づいており、ユーザーが入力した画像を深く理解することができます。
SGLangは、大規模な言語モデルおよびマルチモーダルモデル向けのオープンソースの高性能推論フレームワークです。このフレームワークは、低遅延かつ高スループットの推論サービスを提供し、単一GPUから大規模分散クラスタまで、幅広い環境への展開をサポートします。
vLLMは、カリフォルニア大学バークレー校のSky Computing Labが開発したオープンソースの大規模言語モデル(LLM)推論および展開フレームワークです。ユーザーに高速かつ低コストのモデルサービスを提供することをサポートしています。vLLMは革新的なメモリ管理技術を活用しています。
Clawdbotは、ローカルデバイス上で動作し、WhatsAppやTelegramなどのチャットアプリケーションを通じてユーザーと対話するオープンソースのパーソナルAIアシスタントです。
OpenJudgeは、プロトタイプから本番環境への移行における課題を解決するオープンソースのAIアプリケーション評価フレームワークです。体系的な評価メカニズムを通じて、このフレームワークは開発者がAIアプリケーションのパフォーマンスを定量的に評価し、複雑なビジネスシナリオにおける有効性を確保するのに役立ちます。
D4RT(Dynamic 4D Reconstruction and Tracking)は、Google DeepMindが開発した動的4D再構成モデルです。このモデルは、統一された時空間クエリインターフェースを通じて、3D再構成、カメラトラッキング、および動的オブジェクトトラッキングを統合します。
FlowAct-R1は、ByteDanceが開発したリアルタイムのインタラクティブなデジタルヒューマン動画生成フレームワークです。単一の参照画像と音声データのみで、長さ無制限の全身ダイナミック動画のストリーミング生成をサポートします。
Agentationは、開発者とAIプログラミングアシスタント間の非効率的なコミュニケーションの問題を解決するオープンソースのAIプログラミングコラボレーションツールです。このツールを使用すると、ユーザーはWebページ上で質問を直接注釈付けし、視覚的なフィードバックを読みやすいコードに変換できます。
Qwen3-TTSは、Qwenが提供するオープンソースの音声生成モデルシリーズで、音色の複製、生成、音声制御において強力な機能を備えています。このモデルは、革新的なQwen3-TTS-Tokenizer-12Hzマルチコードブック音声エンコーダーに基づいており、効率的な音声生成を実現します。
Being-H0.5は、陸宗慶氏のチームが開発した汎用ロボットモデルです。人間の事前知識と統一的な動作アライメントを用いることで、異なるハードウェア形態のロボット間での戦略伝達の問題を解決できます。
LightOnOCR-2-1Bは、LightOnAIが開発した高効率OCRモデルです。わずか10億個のパラメータで、複雑な文書処理において卓越した性能を発揮し、学術論文、数式、複雑な表の認識に優れています。
AgentCPM-Reportは、清華大学自然言語処理研究所、中国人民大学、Wallfacer Intelligence、およびOpenBMBオープンソースコミュニティが共同開発した、ローカライズされた深層学習エージェントです。8B個のパラメータを持つMiniCPM4.1モデルに基づいています。
VibeVoice-ASRは、Microsoftがオープンソース化した高度な音声認識モデルで、最大60分までの長尺音声クリップの処理に特化して設計されています。このモデルは音声セグメント全体を一度に処理できるため、全体的なコンテキストが保持され、従来のモデルによく見られる分割処理の制約を回避できます。
Model1は、DeepSeekがFlashMLAのコードベース内で更新・公開した謎のモデルです。これは、次世代フラッグシップモデルであるDeepSeek-V4の内部コードネーム、あるいは最初のエンジニアリングバージョンである可能性があります。
Chroma 1.0は、FlashLabs初のオープンソースリアルタイムエンドツーエンド音声対話モデルであり、低遅延の対話、高忠実度のパーソナライズされた音声クローン、そして強力な会話機能を特徴としています。このモデルは音声理解と音声生成を密接に連携させ、1:2のテキスト対音声比率を採用しています。
Step3-VL-10Bは、Step3 StarCraftが開発した、わずか10個のパラメータを持つオープンソースのマルチモーダルモデルです。視覚認識、論理的推論、数学競技、一般的な対話といったタスクにおいて、200個のパラメータを持つモデルと同等の性能を発揮します。
EmbodiChainは、生成シミュレーションデータを通じて身体知能の開発を促進する、クロスディメンションのオープンソース身体知能学習プラットフォームです。オンラインデータストリームと自己修復機能を組み合わせることで、物理的に正確な3Dシーンとタスクを自動的に作成します。
json-renderは、制御不能なAI生成UIの問題を解決するVercelによるオープンソースプロジェクトです。json-renderはカタログを定義し、AIが特定のスキーマに準拠したJSONデータのみを生成するように制約します。
COTAは、ハイパーパラメータテクノロジー社が開発した新しいタイプのゲームインテリジェントエージェントです。大規模言語モデル(LLM)を基盤とし、認知能力、運用能力、戦術能力、補助能力を備えています。COTAは、従来の強化学習や教師あり学習モデルを凌駕し、革新的なアーキテクチャによってその目標を達成します。
x-Algorithmは、イーロン・マスク氏が開発したオープンソースのレコメンデーションアルゴリズムで、xプラットフォームの中核システムとして、「おすすめ」ニュースフィードにパーソナライズされたコンテンツを提供します。ユーザーがフォローしているアカウント(ネットワーク内)の投稿と、機械学習によって取得されたグローバルコンテンツ(ネットワーク外)を組み合わせて使用します。
NVIDIA PersonaPlexは、NVIDIAが開発した全二重対話型AIモデルで、同時に聞き取りと発話が可能であり、自然な会話における中断、間、応答にも対応できます。ユーザーは音声プロンプトやテキストプロンプトを使用して、ペルソナと音声をカスタマイズできます。
GLM-4.7-Flashは、Zhipuが開発した無料のオープンソースハイブリッド思考モデルで、300億個のパラメータと30億個の活性化パラメータを備えています。このモデルは、パフォーマンスと効率性のバランスが取れており、プログラミング、中国語の文章作成、翻訳など、さまざまなシナリオで非常に優れた性能を発揮します。
VerseCrafterは、復旦大学、テンセントPCG ARC Labなどの機関によって開発された、動的でリアルなビデオ世界モデルであり、4D幾何学的制御機能を備えています。このモデルは、大規模な実世界データセットVerseControl4Dで学習されています。
NovaSRはオープンソースのオーディオ超解像モデルで、わずか52KBのメモリで、16kHzの低サンプリングレートオーディオ(電話品質など)を48kHzの高サンプリングレートオーディオ(スタジオ品質など)にアップサンプリングできます。このモデルはニューラルネットワークによる前処理を使用しています...